logo of weride

文远知行AI Infra训练平台工程师【2027届校招】

校招全职地点:深圳 | 广州 | 北京 | 上海状态:招聘

工作描述


岗位简介
加入我们,你将参与国内头部自动驾驶公司万卡级GPU训练集群的构建与优化,直接支撑端到端自动驾驶大模型的训练迭代。在这里,你会深入PyTorch编译器、CUDA Kernel、NCCL通信库的最底层,解决千卡训练中的线性度瓶颈、显存墙和故障快速定位等硬核挑战。
岗位职责
分布式训练框架开发:参与大规模分布式训练任务的调度、编排与执行框架开发,支持数据并行、模型并行、流水线并行及混合并行策略。
训练性能极致优化:基于 PyTorch 2.x / Torch Compile / Triton 进行训练性能分析与优化,探索 FP8 混合精度、自定义 CUDA 算子、通信计算重叠等前沿加…
登录查看完整工作描述
微信扫码,1秒登录

包括英文材料
学历+
Python+
C+++
深度学习+
PyTorch+
FSDP+
Megatron+
缓存+
还有更多 •••
相关职位

logo of alibaba
社招3年以上技术-基础平台

1、有扎实的工程算法基础,精通数据结构和常用算法,熟练掌握各种编译、调试、性能分析工具; 2、有极佳的工程实现能力,精通Java、Go、Python之一; 3、有调度系统开发经验者优先,有MLOps系

更新于 2026-09-16北京|杭州
logo of alibaba
社招2年以上

1.熟悉Megatron/PyTorch等框架的基本的训练流程; 2.掌握GPU/NPU等工作原理、常见操作命令,至少熟练掌握一种编程语言:CUDA或Python中的一种或多种,具备扎实的工程能力和调

更新于 2025-12-15杭州
logo of antgroup
校招2027届蚂蚁星

1.熟悉 Python、C++ 中至少一种语言,具备良好的系统设计和工程实现能力; 2. 熟悉 PyTorch 训练机制,对分布式训练、并行策略、显存优化或高性能计算有实践经验; 3. 对 Megat

更新于 2026-07-28北京|上海|杭州
logo of antgroup
社招3年以上技术类-开发

1、具备扎实的计算机系统基础,在分布式系统、高性能计算、机器学习系统或计算机体系结构等方向有深入积累; 2、精通 Python、C++ 中至少一种语言,具备复杂系统架构设计和核心模块研发能力; 3、深

更新于 2026-07-29上海