logo of antgroup

蚂蚁金服蚂蚁集团-Agent后训练工程师-杭州/上海

社招全职3年以上技术类-开发地点:上海 | 杭州状态:招聘

任职要求


1、有大模型后训练经验,SFT、DPO、GRPO等。
2、有智能体Tool调用、记忆压缩的优化经验。
3、熟练…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


业务背景
资金风控系统面临黑灰产的大量攻击。为了提升风控水位和用户体验,我们通过语言、多模和语音交互方式获得用户的交易背景信息,分析用户面临的风险,通过个性化推荐叫醒深度被骗用户。数据源包含千万级的文、图、音和结构化多模态数据。Agent方案涉及到多样性用户模拟、ProactiveChat、Multi-turnRL、长记忆压缩、多模态表征学习等AI难点。

职位描述
1、多样性用户模拟,用于训练、测试数据的生成以及多轮RL的轨迹生成。
2、APO技术,开源基座模型的复杂指令遵循能力有待提升,通过APO精简prompt。
3、多轮RL后训练,优化reward shaping以及轮次奖励方法提升RL稳定性。
4、欺诈叫醒手法素材库建设,利用举报案件库中通过算法聚类和图文生成方法建设有针对性的素材。
5、用户行为理解,通过用户行为和举报案件特征的表征匹配,实现个性化的素材推荐。
包括英文材料
大模型+
SFT+
智能体+
PyTorch+
还有更多 •••
相关职位

logo of alibaba
社招3年以上技术类-算法

Accio Work是阿里巴巴国际数字商业集团阿里国际站内部孵化的一款战略级AI原生应用产品,也是阿里在海外落地的首个企业级AI Agent,通过持续探索Agent、Agent HarnessRL、Memory、Reasoning等前沿技术,自研Agent模型、Agent系统,实现B2B AI Agent跨越式发展。 1、参与Accio Work模型训练与研发,包含而不限于Agent设计、Post-Training、RL等全链路建设; 2、负责AI Native专项能力建设,包括而不限于RAG System、Agent System、Agent Training-Function Call/Reasoning/Agentic RL/Proactive Agent/Tool-Use; 3、探索大模型前沿技术,持续迭代模型能力,落地Agent,推动Accio Work,持续迭代。

更新于 2026-07-23杭州
logo of alibaba
社招2年以上

加入我们,你将构建阿里集团企业级Agent平台后训练技术体系,支撑核心电商、零售、本地生活等丰富业务场景的AI方案效果持续提升,通过先进AI技术探索,持续提升业务效果迭代飞轮,发现新的业务机会! 具体你将会负责: 1. Agent效果优化体系建设 ○ 构建面向Agent平台的模型后训练技术体系,包括SFT(监督微调)、RLHF(基于人类反馈的强化学习)、DPO(直接偏好优化)等技术栈 ○ 设计并实施Agent效果持续优化的数据飞轮机制,实现模型能力的自动化迭代升级 2. 平台化能力建设 ○ 将复杂的后训练技术封装为平台化能力,降低业务方使用门槛 ○ 支持多种场景的Agent定制化优化,如对话理解、任务规划、工具调用等 3. 评测与对齐体系 ○ 建立Agent效果评测体系,包括自动化评测和人工评测 ○ 设计偏好学习和人类反馈收集机制,确保Agent行为符合业务预期

更新于 2026-07-17杭州
logo of antgroup
社招5年以上技术类-算法

1. Code Agent 强化学习训练体系设计与落地 负责大规模语言模型在后训练阶段(Post-Training)面向 Code Agent 场景的核心算法研发,设计端到端的 RL 训练流程,涵盖代码生成、代码编辑、调试修复、测试驱动开发等多环节 Agent 行为的策略学习,探索在超长代码上下文与多轮工具交互场景下的训练稳定性与样本效率。 2. 代码环境交互与多步决策优化 构建真实且可扩展的代码执行沙箱环境(Sandbox),支持 Agent 与编译器、终端、测试框架、版本控制系统等工具的闭环交互;研究多步代码推理与规划算法(如 Tree-of-Thought、Monte Carlo Tree Search 在代码任务中的适配),提升模型在跨文件编辑、大型仓库级代码理解与修改、复杂 Debug 链路上的决策质量。 3. 代码奖励信号设计与奖励模型构建 设计多层次、细粒度的代码奖励信号体系,融合可执行性验证(编译通过、测试用例通过率)、代码质量评估(可读性、效率、安全性)、需求对齐度等多维度反馈;研究如何利用自动化测试生成、变异测试(Mutation Testing)、静态分析工具等构建可靠的过程奖励模型(Process Reward Model),解决代码场景中奖励稀疏、奖励欺骗(Reward Hacking)以及部分可观测性等核心难题。 4. 泛化性与迁移能力提升 研究如何通过后训练阶段的课程学习(Curriculum Learning)、跨语言/跨领域任务混合训练、元学习(Meta-Learning)等策略,提升 Code Agent 在未见编程语言、未见框架、未见任务类型上的零样本与少样本泛化能力;探索代码推理能力向通用推理(数学、逻辑、科学问题)的正向迁移路径,推动模型整体 AGI 泛化水平。 5. 数据飞轮与自我进化机制 设计 Code Agent 的自我对弈与自我改进闭环:通过 Agent 自主探索生成高质量训练轨迹(Trajectory),结合拒绝采样(Rejection Sampling)、自我验证(Self-Verification)、自我修复(Self-Repair)等机制构建可持续的数据飞轮,实现模型能力的迭代自举(Bootstrapping),减少对人工标注数据的依赖。 6. 大规模分布式训练系统与工程协同 与基础架构团队紧密协作,针对 Code Agent 训练中环境交互延迟高、轨迹长度动态变化、Action Space 复杂等特点,设计并优化异步/同步混合的大规模分布式 RL 训练架构;解决长序列代码上下文下的显存瓶颈与吞吐效率问题,实现算法创新与系统性能的高效协同。

更新于 2026-07-08上海|杭州
logo of tencent
社招2年以上微信支付技术

1.负责Code和Agent相关数据构建与治理,构建高质量、多样化的Code/Agent训练数据集,搭建数据迭代闭环,通过数据飞轮持续优化数据质量; 2.负责Agent运行环境与训练环境的构建与优化,构建高可用、可扩展的Agent仿真环境,保障Agent训练、测试及落地的稳定性与高效性; 3.负责Agentic RL在Code/Agent场景的训练,参与Agentic RL Infra建设及优化、Agentic RL 算法优化,持续提升Agentic RL训练的效率和稳定性。

更新于 2026-06-10上海