logo of tongyi

通义Token Foundry-大模型算法专家-AI Coding

社招全职2年以上技术类-算法地点:北京 | 杭州状态:招聘

任职要求


1. 人工智能(AI)/ 软件工程(SE)相关方向的硕士 / 博士,有扎实大模型基础和丰富大模型训练经验。
2. 曾负责或作为核心同学参与大模型的训练(预训练、后训练),熟悉代码大模型训练…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


1. 负责Agentic Coding大模型(Agentic LLM for Software Engineering)的后训练(Mid-Train/SFT/RL)算法设计和训练研究等。
2. 打造面向真实软件开发的智能化全链路技术,包括但不限于Agentic Coding、Agent Teams 等技术。
3. 建设大模型训练的Harness体系,探索Auto Research相关技术在大模型后训练的应用。
4. 将上述技术在 Qoder、Lingma 及 CLI 等产品形态中进行大规模应用落地。
包括英文材料
大模型+
还有更多 •••
相关职位

logo of tongyi
社招1年以上技术类-算法

1. Agent模型后训练: 负责大模型在Agent场景下的后训练(Post-training)工作,提升模型在复杂Agent任务中的表现。 2. 强化学习与RL探索: 设计并优化基于强化学习(RL)的Agent训练框架,提升模型的长期规划能力、试错反思能力及工具调用准确率。 3. 核心能力构建: 针对Agent的核心能力进行专项模型训练与对齐优化。 4. 行业解决方案落地: 深入理解具体行业的业务痛点,将Agent模型能力与行业Know-how结合,设计并落地端到端的行业Agent解决方案。 5. 前沿技术追踪: 跟踪学术界和工业界在LLM Agent、RLHF、后训练领域的最新进展,将前沿技术转化为团队的工程与算法资产。

更新于 2026-07-08北京|杭州|上海
logo of tongyi
社招1年以上技术类-算法

1. 负责 RLHF 全链路建设,包括 Reward Model 的设计、训练与迭代优化,推动 PPO / DPO / GRPO 等对齐算法的工程化落地。 2. 构建 Verifier、LLM as Judge、Rule 等为一体的 Reward System,优化多维度(如安全性、准确性、有用性、逻辑性、拟人度等)的偏好数据采集策略与训练方案。 3. 与 SFT、Pretrain 团队紧密协作,分析用户的 Badcase,将 RL 信号融入模型训练全流程,持续提升对话助手的用户体验。 4. 跟踪 Agentic RL 等前沿研究进展,并推动技术创新在基座大模型研发中的落地。

更新于 2026-07-09北京|杭州
logo of tongyi
社招3年以上技术类-算法

1. 高质量垂域数据工程:深入优化垂直领域(如文本内容审核)的高质量数据构建与迭代方法论,持续提升数据的质量、多样性与生产效率。 2. 可扩展后训练体系:探索适配领域特性的 SFT/RL 算法,构建高效、稳定、可扩展的垂域模型后训练范式,系统性提升模型能力。 3. 前沿技术研究与落地:探索推理模型前沿技术(如高效蒸馏、reward system、agentic RL、test-time learning 等)以及模型可解释性技术,沉淀技术成果和影响力,并推动大模型相关技术在行业场景中的转化与落地,提升领域模型竞争力,支撑业务持续增长。

更新于 2026-07-17杭州
logo of tongyi
社招1年以上技术类-算法

1. 负责建设面向集团各业务线的大模型评测体系,涵盖通用能力评测与业务场景定制评测,优化基于 LLM-as-Judge、自动化评测模型训练、人工评估和用户行为数据的多维度评测框架,保障评测结果的全面性和可靠性。 2. 构建多维度评测指标体系(准确性、安全性、流畅度、一致性、业务指标等),覆盖 APP 对话助手及各业务线智能体场景。 3. 深度参与模型迭代过程中的评测驱动优化,建设完整的“数据→训练→评测→反馈”的高效数据飞轮。 4. 跟踪业界主流评测方法与 Benchmark 动态,持续优化内部评测体系。

更新于 2026-07-17北京|杭州