蚂蚁金服【蚂蚁星】AI Infra 训练引擎 / 训练框架研发工程师-27届
任职要求
1.熟悉 Python、C++ 中至少一种语言,具备良好的系统设计和工程实现能力; 2. 熟悉 PyTorch 训练机制,对分布式训练、并行策略、显存优化或高性能计算有实践经验; 3. 对 Megatron-LM、FSDP、verl 等框架中的一种或多种…
工作职责
部门介绍: 在万卡规模上,重新定义大模型训练基础设施。我们正在建设面向大模型时代的 AI Infra,支撑超大规模算力集群稳定运行,覆盖预训练、持续预训练、SFT、RL、MoE、多模态等多种训练场景。深入训练系统的核心:从分布式并行、通信优化、算子融合,到容错恢复、精度保障和资源调度,让百亿、千亿、万亿参数模型在大规模异构集群上真正做到——跑得起来、稳定收敛、极致高效。目前平台已支撑上万次大模型训练任务,训练任务规模持续增长。你将参与建设的每一项能力,都将在真实的万卡集群和核心业务模型上接受检验。 为什么加入我们:你面对的不是实验室级的小规模 Demo,而是:万卡级算力规模、真实的大模型训练负载、复杂的生产级硬件环境,以及仍有大量空白等待突破的训练系统。你可以在这里同时获得训练框架的技术深度、万卡集群的系统复杂度,以及与顶尖团队共同探索新模型、新架构的机会。成为下一代大模型训练基础设施的建设者。 职位描述: 1. 研发大模型训练引擎与训练框架,支持 CPT、SFT、RL、MoE、长上下文及多模态训练; 2. 深入 PyTorch、Megatron、FSDP、verl等训练体系,设计张量并行、流水并行、数据并行、专家并行等分布式方案; 3. 面向万卡级集群优化计算、通信、显存和存储效率,解决训练中的性能长尾、通信瓶颈和规模化稳定性问题; 4. 建设 Checkpoint、断点续训、故障自愈、弹性训练、精度比对和可观测能力,提高大规模训练成功率; 5. 适配多种 AI 芯片及异构算力平台,推动训练框架、通信库、算子与硬件之间的深度协同; 6. 深入 Algorithm-System Co-design,让新的模型结构和训练方法能够更快、更高效地落地。
我们是一支致力于突破人工智能系统与算法边界的前沿研发团队。团队聚焦于大规模语言模型(LLM)及新型架构范式(包括Diffusion LLM) 的高性能训练与推理优化,目标是在系统层(Systems Level)与算法层(Algorithmic Level) 同步创新,打造下一代智能计算基础设施。我们的研究覆盖分布式系统设计、推理框架优化、编译器加速等多个方向。 岗位职责: 1. 实现和优化用于大规模LLM(如Diffusion LLM)训练与推理的高性能计算系统; 2. 开发高效的分布式并行框架; 3. 开发和优化AI编译器; 4. AI for system的AI协同系统优化 5. 与算法团队协作,联动模型结构设计与系统性能共优化。
部门介绍: Fin-AI Lab / 财富 AI Lab 是面向金融场景打造的 AI Native 技术团队,聚焦大模型、Agentic Learning、Tool Use、复杂推理、金融数据理解与端到端 AGI 金融智能产品和系统建设。 团队的核心目标不是简单构建一个金融问答助手,而是围绕真实复杂金融场景,训练和构建能够完成长程、多步、可验证任务的大模型 Agent。我们关注大模型从“会回答”走向“会规划、会调用工具、会使用数据、会自我校验、会完成任务”的能力跃迁。 在金融场景下,Agent 面临更高的技术挑战:数据高度结构化与实时变化并存,任务链路长,工具体系复杂,事实性和严谨性要求高,推理过程需要可追踪、可验证、可控。因此,团队需要围绕 Agent 规划、工具调用、记忆、反思、执行环境、评测体系、强化学习与数据飞轮,系统性提升大模型在复杂金融任务中的能力上限。 职位描述: 1. 负责金融场景下大模型 Agent 算法体系建设,包括规划、工具调用、记忆、反思、执行控制等核心模块; 2. 构建 Agentic Learning 训练方案,包括 Agent 轨迹数据、过程监督、偏好数据、Reward Model 和强化学习目标设计; 3. 探索 SFT、DPO、PPO、GRPO、Process Reward、Outcome Reward 等方法在 Tool Use 和长程任务中的应用; 4. 设计金融 Agent Benchmark,建立评测驱动的模型和系统迭代机制; 5. 优化多工具调用链路,包括工具路由、参数生成、结果解析、调用链规划和异常恢复; 6. 建设金融任务执行环境,包括工具调用环境、模拟任务环境、自动评测环境和训练数据生成环境; 7. 跟踪 Agentic Learning、Tool Use、RL for LLM、Long-horizon Reasoning 等前沿方向,并推动技术落地。
部门介绍: Fin-AI Lab / 财富 AI Lab 是面向财富金融场景打造的 AI Native 技术团队,聚焦大模型、Agentic Learning、Tool Use、复杂推理、金融数据理解与端到端 AGI 金融智能产品和系统建设。 团队的核心目标不是简单构建一个金融问答助手,而是围绕真实复杂金融场景,训练和构建能够完成长程、多步、可验证任务的大模型 Agent。我们关注大模型从“会回答”走向“会规划、会调用工具、会使用数据、会自我校验、会完成任务”的能力跃迁。 在金融场景下,Agent 面临更高的技术挑战:数据高度结构化与实时变化并存,任务链路长,工具体系复杂,事实性和严谨性要求高,推理过程需要可追踪、可验证、可控。因此,团队需要围绕 Agent 规划、工具调用、记忆、反思、执行环境、评测体系、强化学习与数据飞轮,系统性提升大模型在复杂金融任务中的能力上限。 职位描述: 1. 负责财富金融场景下大语言模型的后训练体系建设,包括 SFT、Preference Learning、RLHF/RLAIF、DPO、PPO、GRPO 等方向的算法研究与落地; 2. 结合蚂小财、蚂蚁财富 App 等真实业务场景,设计高质量金融数据构建方案,包括数据洞察、数据清洗、数据合成、偏好数据构建、复杂任务标注、数据质量评估等; 3. 建设金融大模型评测与 Benchmark 体系,围绕专业性、严谨性、事实性、合规性、工具调用、多轮对话、复杂任务完成率等维度,定义模型能力提升路径; 4. 与 Agent、工程、产品、运营、投研供给团队紧密协作,推动模型能力在真实产品中的端到端落地,持续提升用户体验和业务指标; 5. 针对金融场景中的高频、复杂、长链路任务,优化模型的推理能力、指令遵从能力、工具调用能力和结构化表达能力; 6. 跟踪业界大模型后训练、Agent、金融 AI、数据合成、评测体系等方向的前沿技术,并结合业务场景完成技术验证和规模化落地; 7. 参与模型训练策略、实验设计、效果分析和迭代规划,推动团队形成以评测驱动、数据驱动、产品体验驱动的模型迭代闭环。
部门介绍: Fin-AI Lab / 财富 AI Lab 是面向金融场景打造的 AI Native 技术团队,聚焦大模型、Agentic Learning、Tool Use、复杂推理、金融数据理解与端到端 AGI 金融智能产品和系统建设。 团队的核心目标不是简单构建一个金融问答助手,而是围绕真实复杂金融场景,训练和构建能够完成长程、多步、可验证任务的大模型 Agent。我们关注大模型从“会回答”走向“会规划、会调用工具、会使用数据、会自我校验、会完成任务”的能力跃迁。 在金融场景下,Agent 面临更高的技术挑战:数据高度结构化与实时变化并存,任务链路长,工具体系复杂,事实性和严谨性要求高,推理过程需要可追踪、可验证、可控。因此,团队需要围绕 Agent 规划、工具调用、记忆、反思、执行环境、评测体系、强化学习与数据飞轮,系统性提升大模型在复杂金融任务中的能力上限。 职位描述: 1. 负责金融场景下大模型 Agent 工程框架的设计、开发和优化,支撑多工具、多步骤、长链路任务执行; 2. 参与 Agent 系统核心模块建设,包括任务规划、工具路由、函数调用、记忆管理、状态管理、异常恢复和结果校验等; 3. 负责 LLM 推理服务优化,探索并落地 KV Cache 优化、批处理、并发调度、量化、投机推理、模型路由等技术,提升推理效率和成本表现; 4. 基于 vLLM、SGLang、TensorRT-LLM、DeepSpeed、Ray 等框架,优化 Agent 线上服务的稳定性、吞吐、延迟和资源利用率; 5. 建设 Agent 评测与观测体系,包括任务成功率、工具调用准确率、延迟、成本、失败率、异常类型、链路追踪等指标; 6. 与算法团队协作,支持 Agentic Learning、SFT、RL、Reward Model 等训练链路所需的数据采集、轨迹生成、日志回放和实验平台建设; 7. 跟进大模型推理优化、Agent 框架、Tool Use、RL infra、模型服务化等方向的前沿技术,并推动在金融场景中落地。