蚂蚁金服【Plan A】大模型Agentic RL算法工程师-百灵-27届
任职要求
1. 理论基础扎实: 拥有深厚的深度学习与非凸优化理论功底,具备从第一性原理(FirstPrinciples)对复杂问题进行数学建模和拆解的能力; 2. 架构深度理解: 深入掌握 Transformer 及其变体架构,熟悉 MoE(混合专家模型)机制及主流 LLM 的底层实现细节; 3. 后训练范式: 精通 SFT(监督微调)、RLHF(人类反馈强化学习)、DPO/PPO 等对齐算法,深刻理解Alignment(对齐)背后的数学原理与优化挑战; 4. Agentic 实战经验: 具备复杂 Agentic 系统(如 Tool-use, Reason…
工作职责
团队主要负责百灵Agentic 核心能力 的研发与迭代,构建出端到端解决复杂生产任务的智能体技术。团队既要提升模型在复杂任务规划、工具调用上的端到端表现;又要深入底层,解决训练吞吐、推理延迟、以及 Agentic 交互环境(Sandboxing)背后的资源调度与性能瓶颈问题。
Ling Team 聚焦百灵模型家族的核心算法创新。在本岗位下,你将主导百灵大模型在特定 Agent应用场景下的效果优化,构建下一代具备高度Agentic能力的模型,使其从单纯的文本生成器进化为能够解决复杂现实问题的智能体。
主要职责包括:
1. Agentic能力构建: 负责大模型在 Agent场景下的后训练(SFT/RLHF)算法研发,重点提升模型的复杂指令遵循、多步推理(Reasoning)、工具使用(Tool Use)及任务规划能力;
2. 训练范式创新: 探索并设计针对 Agent 场景的高效训练范式(如 Process Reward Models, Self-Play,Iterative Refinement),解决长链路任务中的误差累积和鲁棒性问题;
3. 数据策略与合成: 设计高质量的 Agentic 训练数据合成方案(Data Synthesis),通过构造复杂环境交互数据,驱动模型能力的Scaling;
4. 模型评估与分析: 建立针对 Agent 能力的系统性评估体系,通过严谨的实验分析(AblationStudy)定位模型短板,指导算法迭代方向;
5. 前沿技术落地: 紧密跟踪 MoE、Long Context 等前沿技术,并在复杂工程约束下,将算法创新转化为实际的模型性能提升。1. 评测体系设计与平台化落地:主导设计数据驱动的LLM/多模态/Agent评测体系,建设自动化评测分析能力,支持在平台上完成评测任务的适配、调度与规模化分析; 2. 评测洞察与缺陷定位:基于对抗性分析、错误归因、能力边界挖掘等方法,系统定位模型在金融、医疗、小程序/APP等场景的核心短板,推动形成“评测-反馈-优化”的技术闭环; 3. Benchmark与数据资产建设:负责评测数据采集、清洗、标注、版本管理与标准制定,构建高质量、多样化的Benchmark资产; 4. 前沿评测范式探索:追踪全球前沿Benchmark与评估技术,研究RLHF/DPO等对齐数据驱动的新评估范式,探索仿真环境、Agent链路评测等新方法,保持技术领先。
1. 评测体系设计与平台化落地:主导设计数据驱动的LLM/多模态/Agent评测体系,建设自动化评测分析能力,支持在平台上完成评测任务的适配、调度与规模化分析; 2. 评测洞察与缺陷定位:基于对抗性分析、错误归因、能力边界挖掘等方法,系统定位模型在金融、医疗、小程序/APP等场景的核心短板,推动形成“评测-反馈-优化”的技术闭环; 3. Benchmark与数据资产建设:负责评测数据采集、清洗、标注、版本管理与标准制定,构建高质量、多样化的Benchmark资产; 4. 前沿评测范式探索:追踪全球前沿Benchmark与评估技术,研究RLHF/DPO等对齐数据驱动的新评估范式,探索仿真环境、Agent链路评测等新方法,保持技术领先。
1. 核心模型研发:负责具身模型的全链路研发,包括数据处理、模型预训练、后训练优化及真机部署,确保模型在实际场景中的高效性和准确性; 2. 数据工程建设:主导大规模机器人数据集的采集、清洗、标注和管理工作,构建高质量的多模态数据pipeline,为模型预训练提供坚实基础; 3. 端到端模型训练:参与具身模型的预训练架构设计,并负责真机环境下的强化学习后训练,实现在线学习能力提升; 4. 前沿技术跟踪:持续跟踪具身智能领域的前沿进展(包括最新论文、开源项目等),快速验证并将先进技术落地到产品中,推动模型性能持续迭代。
1. 负责 ANN(Approximate Nearest Neighbor) 算法的设计和验证,结合软硬件实现大容量、高吞吐、高召回、低成本的向量检索算法,持续构建业界领先的产品竞争力; 2. 跟进 RAG/AIGC 的前沿技术研究,探索向量检索在 LLM 大模型场景中的应用; 3. 持续跟踪学术界与工业界主流的向量检索算法最新进展。 你将负责什么? 智能融合:设计图谱与向量的融合重排算法,让语义与事实互补,实现1+1>2的召回效果。 极致效率:优化亿级混合检索性能,攻克系统瓶颈,将端到端延迟压缩至毫秒级以支撑实时场景。 召回边界:设计创新召回策略,结合向量泛化与图谱推理,解决复杂、模糊查询下的知识发现难题。