百度Agent算法实习生(J103893)
任职要求
-计算机、人工智能、运筹优化、应用数学、工业工程等相关专业在读 -熟练使用 Python,能够独立完成数据处理、算法实现和工具集成 -熟悉 LLM Agent、数学规划、约束规划…
工作职责
-深入科研和产业场景,将复杂需求转化为可求解、可执行、可验证的优化任务 -构建 Agent 可调用的数据接口、求解器、仿真器、checker 和自动评测环境 -结合 Agent、MIP/CP/SAT 和启发式算法,完成优化原型及 PoC -推动 Agent 自主完成问题分析、模型构建、算法生成、代码执行和结果迭代 -建立以可行性、解质量、运行效率、稳定性和业务 KPI 为核心的验证闭环 -将真实场景中的失败案例和有效策略沉淀为可复用的 Agent skill 与优化组件
-参与"难任务发现"研究:系统性构建与评测让前沿模型+harness 失效的任务族(长程优化、可持续迭代、强验证类问题等),建立可复现的 benchmark 与失败归因体系 -探索推理时搜索的 scaling 路径:并行采样、树搜索、进化搜索、verifier 引导搜索、多 agent 协作等机制在难任务上的算力-质量曲线,寻找"多花算力就能换来好轨迹"的scaling方法结构 -研究基于轨迹的学习:从搜索得到的高质量轨迹出发,探索拒绝采样蒸馏、agentic RL、自我改进循环、经验沉淀(skill/记忆)等把"搜到"变成"学会"的路径 -参与 agent harness 与评测系统的设计实现 -在真实工业决策场景(排产、调度、预测等)上验证方法的外部效度,推动研究结论落到可复现的系统
-研究面向布局布线、DRC 修复和 PPA 收敛等问题的自演化 Agent -将 EDA 任务构造成具备明确动作空间、评价指标和验证器的算法搜索环境 -构建“方案生成—代码修改—工具执行—结果验证—经验沉淀”的 Agent 闭环 -设计长期轨迹记忆和策略迁移机制,提升 Agent 在不同设计与任务间的泛化性和稳定性 -探索 Agent 与 EDA 工具、MIP/CP/SAT 求解器及启发式算法的协同 -将成果沉淀为新算法、Agent skill、代码模块、技术文档或研究论文
1. 后训练研究:深入参与模型对齐工作,重点研究多种后训练算法;探索结果奖励和过程奖励模型的构建,提升模型在复杂逻辑下的推理能力。 2. Agentic RL优化:针对复杂业务场景,优化 Agent 的任务规划、反思与执行能力;提升模型在长链路任务中的稳定性和成功率。 3. 前沿技术落地:跟踪业界前沿技术路线,负责相关算法的复现、调优及在业务场景中的工程化落地。
【团队介绍】 Accio是阿里巴巴国际数字商业集团阿里国际站内部孵化的一款战略级AI原生应用产品,Accio Work是阿里在海外落地的首个企业级AI Agent,通过持续探索Agent、Agent Harness、Post-training、RL、Memory等前沿技术,自研Agent模型、Agent系统,实现B2B AI Agent跨越式发展。我们拥有充足的计算资源(H100/B200 集群)、真实的大规模商业场景(覆盖海量活跃供应商与全球买家)、开放包容的研究氛围、高人才密度的团队指导。在这里,研究成果不仅能产出学术论文,还能直接作用于海量的真实B2B贸易场景。 【研究课题】 Agent模型后训练、Agentic RL、Agent Harness、Massive and Test-time Agnostic Agentic Post-training等等,推动Agent技术发展与落地效果的课题均可探索立项; 【岗位职责】(其一或多个均可) 1、Agentic RL 研究与训练: 设计面向异步长程场景的 RL 方案,包括合成数据构造、奖励建模与模型训练,利用分布式框架(VeRL 等)进行大规模调优,产出 Novelty 和实用性兼具的工作; 2、Agent核心能力建设与优化:包括但不限于自主规划(Planning)、多步推理(Reasoning)、工具/skill调用(Tool Use)、长短期记忆(Memory)及 RAG 增强。研究长程任务分解、执行监控、自主纠偏、主动通知等 Agent 关键能力,推动成果在 Accio 业务场景落地; 3、Agent评测体系构建:搭建面向长程异步任务的评测基准,覆盖任务时间跨度、多轮交互、并发协调等现有 benchmark 未充分涵盖的维度;构建端到端的Agent评测体系,构建生产力场景benchmark,推动Agent在business场景落地; 4、Agent大规模后训练: 参与构建针对 Agent 能力的训练数据及环境,利用分布式训练框架(如 Megatron-LM, verl)进行大规模模型调优; 5、复杂任务动态编排:设计并实现高扩展性的Multi-Agent协作框架(如Agent Swarm/Agent Team),支持将模糊的宏观目标递归拆解为原子任务; 6、Long-horizon运行设计:构建结合""工作记忆+全局知识库""的多级存储系统,解决Agent长期运行中的信息遗忘问题,建立跨Agent的共享上下文能力,设计Agent持续进化框架; 7、前沿追踪:Follow 最新的学术工作,例如复现 GAIA, BrowseComp, HLE 等最新测试集上的 SOTA 方案。