logo of alibaba

阿里巴巴阿里国际站/Alibaba.com-AI Infra大模型训练/分布式训练工程师(后训练/RL)-Accio Work

社招全职2年以上技术类-算法地点:杭州状态:招聘

工作描述


Qualifications
1、扎实的工程能力,熟悉 Python,最好熟悉一种系统语言或高性能计算相关语言,例如 C++CUDARustGo;
2、熟悉 PyTorch 生态,理解大模型训练的基本流程,包括 forward/backward、optimizer、checkpoint、activation checkpointing、mixed precision 等;
3、有分布式系统或大规模训练经验,理解 GPU 集群、NCCL、通信开销、显存瓶颈、吞吐优化和故障恢复;
4、对 Megatron、DeepSpeed、FSDP、SGLang、vLLM、TensorRT-LLM、Ray 等训练或推理系统中的至少一类有实际使用或开发经验;
5、理解大模型 post-training 的基本范式,例如 SFT、DPO、P…
登录查看完整工作描述
微信扫码,1秒登录

包括英文材料
Python+
C+++
CUDA+
Rust+
Go+
PyTorch+
大模型+
分布式系统+
NCCL+
还有更多 •••
相关职位

logo of alibaba
社招3年以上技术类-开发

1、有扎实的工程算法基础,精通数据结构和常用算法,熟练掌握各种编译、调试、性能分析工具; 2、有极佳的工程实现能力,精通Java、Go、Python之一; 3、有调度系统开发经验者优先,有MLOps系

更新于 2026-08-27北京|杭州
logo of alibaba
社招3年以上技术-基础平台

1. 工程与算法基础:计算机相关专业背景,有极佳的工程实现能力,精通 C/C++ 与 Python;具备扎实的数据结构与算法功底,熟练掌握 GDB / Nsight 等调试与性能分析工具。 2. 大规

更新于 2026-08-15北京|杭州
logo of alibaba
社招2年以上

1.熟悉Megatron/PyTorch等框架的基本的训练流程; 2.掌握GPU/NPU等工作原理、常见操作命令,至少熟练掌握一种编程语言:CUDA或Python中的一种或多种,具备扎实的工程能力和调

更新于 2025-12-15杭州
logo of tencent
社招3年以上企业微信SaaS

1.熟悉 C/C++、CUDA 或 Triton 编程,有 GPU 算子开发或性能优化经验; 2.熟悉 NVIDIA GPU 架构,理解 SM、Warp、Tensor Core、Shared Mem

更新于 2026-06-12广州