logo of jd

京东多智能体强化学习驱动的物流决策系统研发

校招全职机器学习方向地点:北京状态:招聘

任职要求


1. 机器学习或人工智能等相关领域的本硕博在校生。
2. 精通强化学习(RL/MARL)与环境建模理论,具备数据驱动仿真或基于模型的强化学习(MBRL)落地经验。
3. 熟悉供应链运筹学或仓储物流场景,能熟练将复杂业务…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


1.负责构建智能仓储、物流、制造业垂直领域的数据驱动仿真引擎(World Model):利用海量IoT数据、AGV运行轨迹数据、边缘PDA交互数据,训练高保真的时序预测模型。
2.开展基于大模型及代理式AI驱动提效的强化学习:搭建分布式RL框架,驱动全局调度Agent与边缘端交互Agent进行百万次并发训练与策略寻优。
3.解决人机协同场景的建模难题:量化并模拟一线作业员(通过PDA)的随机性与干预,纳入智能体训练闭环。
4.主导Sim-to-Real(虚实迁移)架构设计,确保虚拟策略安全落地至真实仓储与产线系统中。
包括英文材料
机器学习+
强化学习+
高并发+
还有更多 •••
相关职位

logo of jd
校招多模态大模型与应

1、 设计并实现面向电商复杂业务场景的高可用、高扩展性多智能体协作系统,支持复杂业务链路下的任务协同与决策优化; 2、 构建基于大语言模型的智能体协作框架,优化智能体在动态环境中的任务规划(Planning)、工具调用(Tool Use)与跨智能体协作能力,提升相关实际业务指标; 3、 探索多智能体任务分解与协同执行机制,实现复杂业务流程的智能化自动编排与闭环执行; 4、 探索并实现基于LLM的多智能体联合训练框架,研究如何通过Proposer-Solver-Judge(提案-求解-评判)等博弈机制实现智能体能力的闭环自增; 5、 针对多体环境下的非稳态(Non-stationarity)挑战设计鲁棒的联合训练机制,优化信用分配(Credit Assignment)策略,精准量化各智能体在长路径决策中的贡献度; 6、 探索多模态信息(文本、代码、结构化数据)融合的统一表示与生成技术,提升模型对异构信息的理解与操作精度; 7、 通过指令微调(SFT)与偏好对齐(RLHF/DPO),优化模型在电商垂域的知识与价值观对齐,构建场景感知的智能体“大脑”。

更新于 2026-06-16北京
logo of vivo
实习

1、协助研发基于多智能体协同(Multi-Agent)、上下文压缩,智能体自进化等的agent相关算法,参与算法原型搭建、调试与优化,配合团队将技术落地到实际场景; 2、 协助团队抽取、挖掘多智能体、多模态领域的技术专利点,辅助提升技术层面实力; 3、跟踪多智能体协同、多模态、Transformer、VERL等相关领域的前沿技术与论文,协助完成论文精读、技术调研及报告撰写

更新于 2026-04-20杭州|上海
logo of 10jqka
校招研发技术类

岗位职责: 1、构建多 Agent 编排与 MCP 工具链,设计端到端工作流,引入 LLM 评审机制,打通各工程环节; 2、基于通用 LLM 做领域指令对齐与轻量化微调;沉淀高质量语料与可复用 Prompt/系统提示策略; 3、建设代码感知的RAG,对设计规范、组件库等做分块、去重与版本化,支持高效检索与生成校对; 4、跟进行业前沿并推动在业务场景落地,形成实际收益。

杭州
logo of alibaba
社招2年以上

1. 负责以LLM为代表的多智能体(Multi-Agent)协同系统的算法设计与优化,支撑产业链智能化场景中的决策效率与资源整合能力提升; 2. 结合强化学习、因果推断与大模型技术,构建多模态环境下的智能体交互模型,解决复杂场景下的动态决策与资源分配问题; 3. 推动算法在电商产业链(如供应链、选品、选商、询盘、素材、营销等)中的落地应用,通过A/B测试验证效果,并协同跨团队完成工程化部署与持续迭代。

更新于 2025-11-13杭州