通义Token Foundry-大模型算法专家-AI Coding
任职要求
1. 人工智能(AI)/ 软件工程(SE)相关方向的硕士 / 博士,有扎实大模型基础和丰富大模型训练经验。 2. 曾负责或作为核心同学参与大模型的训练(预训练、后训练),熟悉代码大模型训练…
工作职责
1. 负责Agentic Coding大模型(Agentic LLM for Software Engineering)的后训练(Mid-Train/SFT/RL)算法设计和训练研究等。 2. 打造面向真实软件开发的智能化全链路技术,包括但不限于Agentic Coding、Agent Teams 等技术。 3. 建设大模型训练的Harness体系,探索Auto Research相关技术在大模型后训练的应用。 4. 将上述技术在 Qoder、Lingma 及 CLI 等产品形态中进行大规模应用落地。
1. Agent模型后训练: 负责大模型在Agent场景下的后训练(Post-training)工作,提升模型在复杂Agent任务中的表现。 2. 强化学习与RL探索: 设计并优化基于强化学习(RL)的Agent训练框架,提升模型的长期规划能力、试错反思能力及工具调用准确率。 3. 核心能力构建: 针对Agent的核心能力进行专项模型训练与对齐优化。 4. 行业解决方案落地: 深入理解具体行业的业务痛点,将Agent模型能力与行业Know-how结合,设计并落地端到端的行业Agent解决方案。 5. 前沿技术追踪: 跟踪学术界和工业界在LLM Agent、RLHF、后训练领域的最新进展,将前沿技术转化为团队的工程与算法资产。
1. 负责 RLHF 全链路建设,包括 Reward Model 的设计、训练与迭代优化,推动 PPO / DPO / GRPO 等对齐算法的工程化落地。 2. 构建 Verifier、LLM as Judge、Rule 等为一体的 Reward System,优化多维度(如安全性、准确性、有用性、逻辑性、拟人度等)的偏好数据采集策略与训练方案。 3. 与 SFT、Pretrain 团队紧密协作,分析用户的 Badcase,将 RL 信号融入模型训练全流程,持续提升对话助手的用户体验。 4. 跟踪 Agentic RL 等前沿研究进展,并推动技术创新在基座大模型研发中的落地。
1. 高质量垂域数据工程:深入优化垂直领域(如文本内容审核)的高质量数据构建与迭代方法论,持续提升数据的质量、多样性与生产效率。 2. 可扩展后训练体系:探索适配领域特性的 SFT/RL 算法,构建高效、稳定、可扩展的垂域模型后训练范式,系统性提升模型能力。 3. 前沿技术研究与落地:探索推理模型前沿技术(如高效蒸馏、reward system、agentic RL、test-time learning 等)以及模型可解释性技术,沉淀技术成果和影响力,并推动大模型相关技术在行业场景中的转化与落地,提升领域模型竞争力,支撑业务持续增长。