蚂蚁金服蚂蚁集团-大语言模型后训练算法专家-杭州/上海/北京
任职要求
1. 硕士及以上学历,计算机科学或相关专业背景。 2. 具备大模型研发经验,在 Post-Training(如SFT、RL、OPD等)某一方向上有实操积累。 3. 算法与工程兼备。熟悉数据与训练策略,也了解主流训练和推理框架(如 Megatron、SGLang、vLLM等)。 4. 具备极强的“发现问题-分析问题-解…
工作职责
1. 负责包括 SFT(监督微调)、Model Merge(模型合并)、OPD(在线/离线知识蒸馏)以及 RL(强化学习)在内的后训练算法研发与优化,探索更高效、更稳定的新型训练范式。 2. 提升大模型在Reasoning、General Agent 以及Coding Agent等专项任务上的上限,构建具备深度思考和自主行动能力的基座模型。 3. 模型架构探索与优化,探索更高效更有效的模型架构。 4. 训练与推理效率的优化,如算子优化、显存优化等,实现高吞吐、低延迟的模型研发和落地。
1.专业领域智能体架构升级:负责面向金融、法务、医疗等专业领域的大模型智能体体系建设,利用 Agentic RAG 架构实现从基础检索问答到深度分析、专业研判与复杂任务执行的演进; 2.深度推理与规划:针对复杂专业任务指令,设计并实现基于推理类模型的任务拆解、多步规划(Planning)与流程编排策略,提升系统处理专业分析、跨文档归纳、决策支持等复杂问题的能力; 3.事实核查与结果可靠性:建立可靠的事实核查(Fact-checking)与结果校验机制,通过证据溯源、多源信息比对、结构化校验等手段,解决大模型在专业场景中的幻觉与失真问题,确保生成结果的真实性、严谨性与可追溯性; 4.前沿技术转化:探索推理类模型在专业领域 Agent 的落地,包括基于过程监督的思维链(CoT)优化、面向专业任务反馈的强化学习(RL)策略,以及搜索、数据分析、文件处理等多工具协同能力的持续演进。
1.深度参与混元大模型后训练(包括 SFT、RL )及模型合版的研发和相关算法策略研究,提升模型泛化性、能力边界和上限; 2.后训练策略和生产范式的研究,探索更加敏捷、普适和可扩展的训练范式,提升训练和生产效率; 3.相关前沿后训练技术方向探索,包括但不限于 Reasoning/Agentic 能力增强和 Scaling, RL/OPD 等收敛性和可扩展性研究; 4.将研究成果转化为实际的模型能力或生产效率,并撰写高水平技术报告或论文,提升技术影响力。
1.负责大语言模型后训练(Post-Training)阶段的核心技术研发,构建和优化高质量的奖励系统(Reward System),通过Reward Modeling (RM) 和强化学习(RL)算法持续提升模型在复杂指令遵循、逻辑推理及价值观对齐方面的能力; 2.深入研究和优化 RLHF 等后训练算法,提升模型训练的稳定性和最终效果; 3.负责大模型个性化(Personalization)与长期记忆(Memory)机制的算法研发,构建精准的“千人千面”用户建模体系,探索模型如何理解、提取、记忆并动态适应不同用户的长期偏好,持续提升个性化交互体验; 4.负责后训练阶段的数据合成与管理,设计高效的数据飞轮机制,利用SFT、Self-Instruct等技术合成高质量训练数据,并负责建立从用户多维反馈(User Feedback)到模型迭代的闭环信号建模体系; 5.负责后训练模型的全维度评测与分析,制定科学的评价指标,跟进前沿技术动态,将最新研究成果快速转化为业务价值。
简介:大语言模型后训练前沿算法研究包括但不限于: 1、对齐算法研发:包括 SFT 数据建设,指令微调等。构建高质量的训练数据,包括自动化数据清洗、合成数据生产、高质量 Prompt Engineering 等。优化模型复杂指令遵循、逻辑推理、创作写作、代码生成以及工具调用等能力,提升模型综合能力和用户体验。 2、人类偏好对齐:包括奖励模型、人类偏好对齐等前沿强化算法的探索和实践,提升模型在包括创意写作、对话风格以及模型内生安全对齐等人类偏好上的可控性,生成更符合人类价值观、逻辑习惯和审美偏好的内容。 3、跟踪并实现最新的后训练技术(如数据领域自动化配比、后训练机制设计和优化等)。