logo of antgroup

蚂蚁金服蚂蚁集团-Code Agent 后训练算法专家-健康事业群

社招全职5年以上技术类-算法地点:上海 | 杭州状态:招聘

工作描述


任职要求
1. 学历背景
硕士/博士学位,计算机科学、人工智能、软件工程、数学、自动        化或相关专业优先。
2. 编程与工程能力
具备扎实的编程功底与软件工程素养,精通 Python,熟悉 C/C++;对代码生成、程序分析、编译原理、软件测试等领域有系统性理解;能够独立构建和维护复杂的实验pipeline,具备良好的代码规范与工程落地能力。
3. 强化学习理论与实践
深入理解强化学习核心理论(PPO、GRPO、DPO 及其变体),能够从数学原理层面分析策略梯度估计的方差控制、KL散度约束、价值函数基线设计等关键问题;有将 RL 算法应用于语言模型后训练的实际经验,了解 RLHF/RLAIF 的完整技术栈。
4. 大语言模型后训练经验
熟悉大语言模型的 SFT → Reward Modeling → RL 全链路后训练流程,理解 Alignment、Instruction Following、Chain-of-Thought 等核心概念;有独立完成过至少一个完整后训练实验的经验,对训练过程中的常见问题(奖励坍缩、模式坍缩、过度优化等)有实际应对经验。
5. 分布式训练与系统优化
熟练掌握至少一种主流分布式训练框架(DeepSpeed、Megatron-LM、FSDP、veRL/OpenRLHF 等),理解数据并行、模型并行、流水线并行的原理与工程实现;具备在大规模 GPU 集群上进行算法调优与性能排障的实战经验。
6. 研究能力与学术素养
具备优秀的文献调研与前沿追踪能力,能够快速消化最新研究成果并转化为可落地的技术方案;在 NeurIPS、ICML、ICLR、ACL、EMNLP、ICSE、FSE 等顶级会议或期刊发表过相关高质量论文者优先。
…
登录查看完整工作描述
微信扫码,1秒登录

包括英文材料
学历+
Python+
C+
C+++
编译原理+
强化学习+
算法+
RLHF+
SFT+
FSDP+
还有更多 •••
相关职位

logo of tencent
社招2年以上微信支付技术

1.计算机、人工智能等相关专业硕士以上学历; 2.有大规模强化学习、大模型Code/Agent研发相关经验者优先; 3.具有扎实的深度学习算法基础,熟悉深度学习框架和分布式训练推理加速,有实操经验

更新于 2026-09-08上海
logo of meituan
校招核心本地商业-基

【岗位要求】 1、在Agentic RL、PRM或复杂代码推理等方向有深入研究 2、顶会论文发表(ACL/EMNLP/NeurIPS/ICLR/KDD等)者优先 3、GitHub高Star AI原生项

更新于 2026-06-03北京|上海
logo of meituan
实习核心本地商业-基

1、有好奇心,敢想敢做,学习能力强,能在复杂问题的深度思考与拆解能力; 2、在 Agentic RL、过程奖励(PRM)或复杂代码推理等方向有深入研究及顶会论文发表(ACL/EMNLP/NeurIPS

更新于 2026-04-03北京|上海
logo of deepseek
社招3年以上模型数据策略

【团队使命】 Code 定义了 Agent 的能力边界,是 Agent 和物理世界交互的纽带。理解需求、设计方案、实现、验证,在完整的问题解决过程中,每一步都要求精确可运行。Code 能力是模型在这一

北京