logo of antgroup

蚂蚁金服蚂蚁集团-AI Infra 训练系统高级技术专家-上海

社招全职3年以上技术类-开发地点:上海状态:招聘

工作描述


任职要求
1、具备扎实的计算机系统基础,在分布式系统、高性能计算、机器学习系统或计算机体系结构等方向有深入积累;
2、精通 PythonC++ 中至少一种语言,具备复杂系统架构设计和核心模块研发能力;
3、深入理解 PyTorch 运行机制,对自动微分、计算图、分布式通信、并行训练和显存管理有系统认识;
4、深入理解 Megatron-LM、FSDP、DeepSpeed、verl 等训练框架中的一种或多种,能够分析其核心架构与性能边界;
5、熟悉大规模分布式训练中的通信、计算、显存和存储瓶颈,能够完成跨层性能分析与优化;
6、熟悉 NCCL/HCCL、RDMA、集合通信算法、通信计算重叠或大规模网络拓扑;
7、具备复杂技术问题的抽象能力,能够从局部现象识别系统性根因,并形成可演进的解决方案;
8、具备较强…
登录查看完整工作描述
微信扫码,1秒登录

包括英文材料
分布式系统+
机器学习+
Python+
C+++
系统设计+
PyTorch+
还有更多 •••
相关职位

logo of weride
校招

岗位简介 加入我们,你将参与国内头部自动驾驶公司万卡级GPU训练集群的构建与优化,直接支撑端到端自动驾驶大模型的训练迭代。在这里,你会深入PyTorch编译器、CUDA Kernel、NCCL通信库的

更新于 2026-07-07深圳|广州|北京
logo of antgroup
校招2027届蚂蚁星

1.熟悉 Python、C++ 中至少一种语言,具备良好的系统设计和工程实现能力; 2. 熟悉 PyTorch 训练机制,对分布式训练、并行策略、显存优化或高性能计算有实践经验; 3. 对 Megat

更新于 2026-07-28北京|上海|杭州
logo of alibaba
社招2年以上技术类-算法

Qualifications 1、扎实的工程能力,熟悉 Python,最好熟悉一种系统语言或高性能计算相关语言,例如 C++、CUDA、Rust 或 Go; 2、熟悉 PyTorch 生态,理解大模型

更新于 2026-09-21杭州|北京|上海
logo of alibaba
社招3年以上技术类-开发

1、熟练掌握 linux 环境下的 C++/Python 语言,有大规模机器学习经验优先至少掌握一种机器学习框架(Tensorflow,Pytorch 或其他自研框架)。 2、理解 GPU 硬件架构,

更新于 2026-07-20杭州