logo of alibaba

阿里巴巴1688-多智能体Multi-Agent训练-杭州

社招全职2年以上地点:杭州状态:招聘

任职要求


1. 具备LLM/RL/Reasoning/Multi-Agent相关背景知识,熟悉主流大模型算法架构,精通alignment RL常见方法,包括但不限于SFT/DPO/PPO/GRPO等;
2. 熟悉MA…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


1. 负责以LLM为代表的多智能体(Multi-Agent)协同系统的算法设计与优化,支撑产业链智能化场景中的决策效率与资源整合能力提升;  
2. 结合强化学习、因果推断与大模型技术,构建多模态环境下的智能体交互模型,解决复杂场景下的动态决策与资源分配问题;  
3. 推动算法在电商产业链(如供应链、选品、选商、询盘、素材、营销等)中的落地应用,通过A/B测试验证效果,并协同跨团队完成工程化部署与持续迭代。
包括英文材料
大模型+
AI agent+
算法+
还有更多 •••
相关职位

logo of jd
校招多模态大模型与应

1、 设计并实现面向电商复杂业务场景的高可用、高扩展性多智能体协作系统,支持复杂业务链路下的任务协同与决策优化; 2、 构建基于大语言模型的智能体协作框架,优化智能体在动态环境中的任务规划(Planning)、工具调用(Tool Use)与跨智能体协作能力,提升相关实际业务指标; 3、 探索多智能体任务分解与协同执行机制,实现复杂业务流程的智能化自动编排与闭环执行; 4、 探索并实现基于LLM的多智能体联合训练框架,研究如何通过Proposer-Solver-Judge(提案-求解-评判)等博弈机制实现智能体能力的闭环自增; 5、 针对多体环境下的非稳态(Non-stationarity)挑战设计鲁棒的联合训练机制,优化信用分配(Credit Assignment)策略,精准量化各智能体在长路径决策中的贡献度; 6、 探索多模态信息(文本、代码、结构化数据)融合的统一表示与生成技术,提升模型对异构信息的理解与操作精度; 7、 通过指令微调(SFT)与偏好对齐(RLHF/DPO),优化模型在电商垂域的知识与价值观对齐,构建场景感知的智能体“大脑”。

更新于 2026-06-16北京
logo of vivo
实习

1、协助研发基于多智能体协同(Multi-Agent)、上下文压缩,智能体自进化等的agent相关算法,参与算法原型搭建、调试与优化,配合团队将技术落地到实际场景; 2、 协助团队抽取、挖掘多智能体、多模态领域的技术专利点,辅助提升技术层面实力; 3、跟踪多智能体协同、多模态、Transformer、VERL等相关领域的前沿技术与论文,协助完成论文精读、技术调研及报告撰写

更新于 2026-04-20杭州|上海
logo of 10jqka
校招研发技术类

岗位职责: 1、构建多 Agent 编排与 MCP 工具链,设计端到端工作流,引入 LLM 评审机制,打通各工程环节; 2、基于通用 LLM 做领域指令对齐与轻量化微调;沉淀高质量语料与可复用 Prompt/系统提示策略; 3、建设代码感知的RAG,对设计规范、组件库等做分块、去重与版本化,支持高效检索与生成校对; 4、跟进行业前沿并推动在业务场景落地,形成实际收益。

杭州
logo of sf
社招3-5年

岗位职责 1、智能Agent研发 基于 AutoGen 或 LangGraph 框架,设计和实现多智能体(Agent)系统,支持 Agent-to-Agent 协作。 构建物流垂域的智能应用场景,如运输调度、仓储优化、路径规划、订单跟踪与异常处理。 2、系统架构与优化 负责多智能体系统的架构设计、任务分解与交互协议制定。 优化 Agent 的推理链路和交互效率,提升系统的稳定性与可扩展性。 3、模型与数据集成 将大语言模型与物流业务数据(订单、运单、库存、GPS轨迹等)结合,提升智能体的业务理解与决策能力。 参与构建和优化奖励机制、反馈回路,确保 Agent 输出符合业务目标。 4、跨团队协作 与产品、算法、业务团队紧密合作,推动智能Agent在物流场景的落地与迭代。

更新于 2025-10-30深圳