蚂蚁金服【Plan A】基模算法工程师-百灵-27届
任职要求
1. 扎实的深度学习与优化理论基础; 2. 深入理解 Transformer、MoE 与主流大模型架构; 3. 有大规模预训练或后训练实战经验; 4. 熟悉 SFT / RLHF / Alignment 等训练范式; 5. 能独立设计实验并进行严谨验证; 6. 能从第一性原理建模问题; 7. 对 scaling 与能力演化有系统性思考; 8. 能在复杂工程约束下做出算法决策。 加分项…
工作职责
Ling Team 聚焦百灵模型家族的核心算法创新。 我们关注的不只是 benchmark 指标,而是: 1.极限深度思考能力; 2.长程推理与规划能力; 3.Agentic 执行与真实世界决策; 4.在工业规模下可持续扩展的训练范式。 在万亿参数与百万亿 token 规模下,算法设计必须与系统规模协同演化。 本岗位将参与模型架构、预训练策略与强化学习范式的核心设计,推动模型能力边界的持续扩展。 我们寻找的不是只优化 loss 和 benchmark 的研究员,而是能参与定义下一代通用语言模型能力形态的人。 主要职责包括: 模型架构创新 1.设计与优化 Transformer / MoE / 混合 Attention 等架构; 2.探索高效计算结构与能力提升之间的 trade-off; 3.建模与验证 架构/超参/数据 Scaling Laws; 4.设计支持长上下文与深度思考的结构机制; 5.与系统团队协作完成架构级 co-design; 6.探索针对记忆机制的架构设计和训练方式。 超大规模预训练策略 1.设计大规模预训练目标,建立预训练模型能力的定量评估框架; 2.优化 optimizer、数据配比与编排策略; 3.构建 mid-training 与能力迁移机制; 4.在百万亿 token 规模下验证训练假设。 后训练与强化学习范式 1.优化基于 SFT / RLVR / Agentic RL / RLHF / distillation 的后训练范式; 2.构建“正确性 × 过程质量 × 信息密度”复合奖励机制; 3.优化 reasoning 与 tool-use 协同能力,实现周级别的长程工作能力; 4.推动强化学习在工业规模上的稳定训练; 5.设计 multi-agent RL 协同训练与工作范式。
1. 核心模型研发:负责具身模型的全链路研发,包括数据处理、模型预训练、后训练优化及真机部署,确保模型在实际场景中的高效性和准确性; 2. 数据工程建设:主导大规模机器人数据集的采集、清洗、标注和管理工作,构建高质量的多模态数据pipeline,为模型预训练提供坚实基础; 3. 端到端模型训练:参与具身模型的预训练架构设计,并负责真机环境下的强化学习后训练,实现在线学习能力提升; 4. 前沿技术跟踪:持续跟踪具身智能领域的前沿进展(包括最新论文、开源项目等),快速验证并将先进技术落地到产品中,推动模型性能持续迭代。
1. 负责 ANN(Approximate Nearest Neighbor) 算法的设计和验证,结合软硬件实现大容量、高吞吐、高召回、低成本的向量检索算法,持续构建业界领先的产品竞争力; 2. 跟进 RAG/AIGC 的前沿技术研究,探索向量检索在 LLM 大模型场景中的应用; 3. 持续跟踪学术界与工业界主流的向量检索算法最新进展。 你将负责什么? 智能融合:设计图谱与向量的融合重排算法,让语义与事实互补,实现1+1>2的召回效果。 极致效率:优化亿级混合检索性能,攻克系统瓶颈,将端到端延迟压缩至毫秒级以支撑实时场景。 召回边界:设计创新召回策略,结合向量泛化与图谱推理,解决复杂、模糊查询下的知识发现难题。
1. 负责 ANN(Approximate Nearest Neighbor) 算法的设计和验证,结合软硬件实现大容量、高吞吐、高召回、低成本的向量检索算法,持续构建业界领先的产品竞争力; 2. 跟进 RAG/AIGC 的前沿技术研究,探索向量检索在 LLM 大模型场景中的应用; 3. 持续跟踪学术界与工业界主流的向量检索算法最新进展。 你将负责什么? 智能融合:设计图谱与向量的融合重排算法,让语义与事实互补,实现1+1>2的召回效果。 极致效率:优化亿级混合检索性能,攻克系统瓶颈,将端到端延迟压缩至毫秒级以支撑实时场景。 召回边界:设计创新召回策略,结合向量泛化与图谱推理,解决复杂、模糊查询下的知识发现难题。
部门介绍: 蚂蚁AReaL会探索和构建高性能的 AI 自学习基础系统,让语言交互、智能体、具身智能等各类 AI场景都能基于这个基础系统走向高效的自我演进,迈向更高的智能水平。 职位描述: 1. 探索和研究新一代Agent Infra计算系统,寻求从训推并行到Agent Self-Evolution的系统创新,实现大规模多智能体交互场景下的极致Token Effiencicy; 2. 以“Agent+RL”范式构建新一代面向Agent Infra的强化学习框架,实现多轮交互、过程奖励、大规模模拟环境等,支持各类智能体和搜索场景学习能力提升; 3. 探索结合AI硬件下的Agent Runtime技术创新。