logo of antgroup

蚂蚁金服蚂蚁集团-AI Infra 训练系统高级技术专家-上海

社招全职3年以上技术类-开发地点:上海状态:招聘

任职要求


1、具备扎实的计算机系统基础,在分布式系统、高性能计算、机器学习系统或计算机体系结构等方向有深入积累;
2、精通 PythonC++ 中至少一种语言,具备复杂系统架构设计和核心模块研发能力;
3、深入理解 PyTorch 运行机制,对自动微分、计算图、分布式通信、并行训练和显存管理有系统认识;
4、深入理解 Megatron-LM、FSDP、DeepSpeed、verl 等训练框架中的一种或多种,能够分析其核心架构与性能边界;
5、熟悉大规模分布式训练中的通信、计算、显存和存储瓶颈,能够完成跨层性能分析与优化;
6、熟悉 NCCL/HCCL、RDMA、集合通信算法、通信计算重叠或大规模网络拓扑;
7、具备复杂技术问题的抽象能力,能够…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


1、主导大模型训练引擎与训练框架的核心架构设计,定义关键技术路线和长期演进方向;
2、建设覆盖 CPT、SFT、RL、MoE、长上下文及多模态训练的统一训练体系;
3、设计和优化数据并行、张量并行、流水并行、序列并行、专家并行及多维混合并行策略;
4、面向万卡级集群,系统优化计算、通信、显存、存储和网络效率,持续提升端到端训练性能与扩展效率;
5、建设 Checkpoint、断点续训、故障恢复、弹性训练、精度保障、性能分析和可观测体系,提升长周期训练任务的可靠性;
6、推动训练框架、编译器、通信库、算子与多种 AI 芯片之间的深度协同;
7、与模型算法团队共同开展 Algorithm-System Co-design,支持新模型结构、新训练算法和新型并行范式快速落地;
8、识别并解决跨模型、框架、系统和硬件层的关键瓶颈,沉淀可复用的架构、标准与方法论;
9、发挥技术影响力,牵引复杂项目落地,并推动团队在训练系统核心方向形成长期能力。
包括英文材料
分布式系统+
机器学习+
Python+
C+++
系统设计+
PyTorch+
还有更多 •••
相关职位

logo of weride
校招其他

岗位简介 加入我们,你将参与国内头部自动驾驶公司万卡级GPU训练集群的构建与优化,直接支撑端到端自动驾驶大模型的训练迭代。在这里,你会深入PyTorch编译器、CUDA Kernel、NCCL通信库的最底层,解决千卡训练中的线性度瓶颈、显存墙和故障快速定位等硬核挑战。 分布式训练框架开发:参与大规模分布式训练任务的调度、编排与执行框架开发,支持数据并行、模型并行、流水线并行及混合并行策略。 训练性能极致优化:基于 PyTorch 2.x / Torch Compile / Triton 进行训练性能分析与优化,探索 FP8 混合精度、自定义 CUDA 算子、通信计算重叠等前沿加速方案。 训练稳定性保障:构建训练故障自动检测与恢复机制(慢节点定位、RDMA 异常检测、Checkpoint 智能管理),保障千卡任务长期稳定运行。 数据与存储优化:优化海量训练数据(视频、点云、图像)的预处理 Pipeline 与存储读取性能,降低数据加载对GPU利用率的影响。 GPU 集群资源调度:参与基于 Kubernetes 的 GPU 虚拟化与调度平台建设,提升集群资源利用率与任务并发度。

更新于 2026-07-07深圳|广州|北京
logo of antgroup
校招2027届蚂蚁星

部门介绍: 在万卡规模上,重新定义大模型训练基础设施。我们正在建设面向大模型时代的 AI Infra,支撑超大规模算力集群稳定运行,覆盖预训练、持续预训练、SFT、RL、MoE、多模态等多种训练场景。深入训练系统的核心:从分布式并行、通信优化、算子融合,到容错恢复、精度保障和资源调度,让百亿、千亿、万亿参数模型在大规模异构集群上真正做到——跑得起来、稳定收敛、极致高效。目前平台已支撑上万次大模型训练任务,训练任务规模持续增长。你将参与建设的每一项能力,都将在真实的万卡集群和核心业务模型上接受检验。 为什么加入我们:你面对的不是实验室级的小规模 Demo,而是:万卡级算力规模、真实的大模型训练负载、复杂的生产级硬件环境,以及仍有大量空白等待突破的训练系统。你可以在这里同时获得训练框架的技术深度、万卡集群的系统复杂度,以及与顶尖团队共同探索新模型、新架构的机会。成为下一代大模型训练基础设施的建设者。 职位描述: 1. 研发大模型训练引擎与训练框架,支持 CPT、SFT、RL、MoE、长上下文及多模态训练; 2. 深入 PyTorch、Megatron、FSDP、verl等训练体系,设计张量并行、流水并行、数据并行、专家并行等分布式方案; 3. 面向万卡级集群优化计算、通信、显存和存储效率,解决训练中的性能长尾、通信瓶颈和规模化稳定性问题; 4. 建设 Checkpoint、断点续训、故障自愈、弹性训练、精度比对和可观测能力,提高大规模训练成功率; 5. 适配多种 AI 芯片及异构算力平台,推动训练框架、通信库、算子与硬件之间的深度协同; 6. 深入 Algorithm-System Co-design,让新的模型结构和训练方法能够更快、更高效地落地。

更新于 2026-07-28北京|上海|杭州
logo of kuaishou
社招3-5年J0012

1、负责大数据方向Flink&Spark on K8S的关键能力建设,包括:Spark 高吞吐调度、Flink 极致负载均衡、Spark 计算 Offload 至 GPU 的调度支持、大数据作业资源弹性调度等; 2、负责大模型训练的ETTR(端到端训练启动时间)优化与 MFU(模型计算利用率)提升的关键技术能力建设,包括:GPU容器冷/热快速启停技术、模型服务初始化阶段的数据预加载与加速技术等。

更新于 2025-11-14北京
logo of alibaba
社招2年以上技术类-算法

1、支撑模型团队使用 Megatron 进行大规模分布式训练,处理 tensor parallel、pipeline parallel、data parallel、expert parallel、sequence/context parallel 等并行策略相关问题; 2、支撑模型团队使用 SGLang 进行高吞吐推理和 rollout,优化 batching、KV cache、prefill/decode 调度、长上下文稳定性和在线训练链路; 3、设计和实现面向更大模型规模的 post-training infra,降低训练资源成本,提高实验迭代效率和系统稳定性; 4、建设 profiling、benchmark、monitoring 和 debugging 工具,提升训练吞吐、GPU utilization、rollout 稳定性和故障定位效率; 5、与研究员和模型工程师紧密合作,把新的训练想法快速落地成可复现、可扩展、可长期维护的系统能力。

更新于 2026-07-21杭州