京东多智能体强化学习驱动的物流决策系统研发
任职要求
1. 机器学习或人工智能等相关领域的本硕博在校生。 2. 精通强化学习(RL/MARL)与环境建模理论,具备数据驱动仿真或基于模型的强化学习(MBRL)落地经验。 3. 熟悉供应链运筹学或仓储物流场景,能熟练将复杂业务…
工作职责
1.负责构建智能仓储、物流、制造业垂直领域的数据驱动仿真引擎(World Model):利用海量IoT数据、AGV运行轨迹数据、边缘PDA交互数据,训练高保真的时序预测模型。 2.开展基于大模型及代理式AI驱动提效的强化学习:搭建分布式RL框架,驱动全局调度Agent与边缘端交互Agent进行百万次并发训练与策略寻优。 3.解决人机协同场景的建模难题:量化并模拟一线作业员(通过PDA)的随机性与干预,纳入智能体训练闭环。 4.主导Sim-to-Real(虚实迁移)架构设计,确保虚拟策略安全落地至真实仓储与产线系统中。
1、 设计并实现面向电商复杂业务场景的高可用、高扩展性多智能体协作系统,支持复杂业务链路下的任务协同与决策优化; 2、 构建基于大语言模型的智能体协作框架,优化智能体在动态环境中的任务规划(Planning)、工具调用(Tool Use)与跨智能体协作能力,提升相关实际业务指标; 3、 探索多智能体任务分解与协同执行机制,实现复杂业务流程的智能化自动编排与闭环执行; 4、 探索并实现基于LLM的多智能体联合训练框架,研究如何通过Proposer-Solver-Judge(提案-求解-评判)等博弈机制实现智能体能力的闭环自增; 5、 针对多体环境下的非稳态(Non-stationarity)挑战设计鲁棒的联合训练机制,优化信用分配(Credit Assignment)策略,精准量化各智能体在长路径决策中的贡献度; 6、 探索多模态信息(文本、代码、结构化数据)融合的统一表示与生成技术,提升模型对异构信息的理解与操作精度; 7、 通过指令微调(SFT)与偏好对齐(RLHF/DPO),优化模型在电商垂域的知识与价值观对齐,构建场景感知的智能体“大脑”。
1、协助研发基于多智能体协同(Multi-Agent)、上下文压缩,智能体自进化等的agent相关算法,参与算法原型搭建、调试与优化,配合团队将技术落地到实际场景; 2、 协助团队抽取、挖掘多智能体、多模态领域的技术专利点,辅助提升技术层面实力; 3、跟踪多智能体协同、多模态、Transformer、VERL等相关领域的前沿技术与论文,协助完成论文精读、技术调研及报告撰写

岗位职责: 1、构建多 Agent 编排与 MCP 工具链,设计端到端工作流,引入 LLM 评审机制,打通各工程环节; 2、基于通用 LLM 做领域指令对齐与轻量化微调;沉淀高质量语料与可复用 Prompt/系统提示策略; 3、建设代码感知的RAG,对设计规范、组件库等做分块、去重与版本化,支持高效检索与生成校对; 4、跟进行业前沿并推动在业务场景落地,形成实际收益。