深度求索高性能算子/通信/编译器工程师
社招全职AI 核心系统研发地点:北京 | 杭州状态:招聘
任职要求
1.熟悉 C++ 等编程语言,熟练掌握 Git 等工具。 2.对细节有较高关注,对性能优化有较高热情,眼界广阔,同时对代码有品味的追求。 3.良好的中文沟通能力。 【加分项】(不强制要求,也充分欢迎有热情的白纸同学加入) 1.有过 CUDA 或 Ascend C 算子编写经验,熟悉 CUTLASS、DeepGEMM 等算子库,熟练掌握 PTX ISA、Ascend C API 并深入理解 memory model 和硬件体系结构。 2.熟悉主流深度学习分布式通信库(如 NCCL、HCCL、NVSHMEM 和 DeepEP 等)的底层实现原理,具备丰富的性能调优与故障排查经验。 3.深入理解 RD…
登录查看完整任职要求
微信扫码,1秒登录
工作职责
【团队使命】 我们构建 AGI 与物理芯片之间的最后一层软件,为训练推理框架和研究员提供高性能的计算算子、集合通信和领域编译器,同时也是模型设计和硬件 co-design 的桥梁。 团队的唯一标准:硬件的物理极限。我们不和任何 baseline 或者其他实现比较性能差异,只关心当前设计和实现距离理论上限还有多远,对每一个 cycle 和每一瓦功耗有着近乎偏执的追求。 我们为上层框架和研究员提供稳定的接口,使底层的高性能实现以使用友好、可靠且可维护的方式融入整个系统。 加入我们,你将同时深入 NVIDIA GPU 和 Ascend NPU 等国产硬件,从指令集、内存模型、编译栈到大规模互联,系统性地掌握多种硬件体系。我们不在意你是否有相关背景 —— 我们会尽可能提供必要的指导,但需要的是你对细节的严谨和对性能优化的热情。 【岗位类别】:实习/全职 1.针对 GPU/NPU 等架构,使用 CUDA、Ascend C 和 TileLang,设计、实现并长期维护 GEMM、Attention 以及其他算子。 2.针对不同通信场景和网络架构,设计、实现并长期维护通信算子(如 DeepEP 中的 EP、CP/DP、Engram、PP),同时持续对 NCCL/HCCL 等主流集合通信库进行调优和排障。 3.参与面向深度学习的 DSL 编译器(如 TileLang 等)的研发,负责设计面向新一代硬件的编译优化,并围绕内部实际的新模型、新算子和性能优化的需求扩展 DSL/IR/CodeGen 的能力,并在保持接口的简洁和可维护性的同时尽可能提升性能。 4.紧贴模型结构和算法演进,和框架同学、研究员共同为新思路设计硬件友好的模型结构和算法,并对真实训练/推理负载持续进行性能分析。
包括英文材料
C+++
https://www.learncpp.com/
LearnCpp.com is a free website devoted to teaching you how to program in modern C++.
https://www.youtube.com/watch?v=ZzaPdXTrSb8
Git+
https://www.youtube.com/watch?v=rH3zE7VlIMs
Learn Git from start to finished in this full course written by ThePrimeagen.
CUDA+
https://developer.nvidia.com/blog/even-easier-introduction-cuda/
This post is a super simple introduction to CUDA, the popular parallel computing platform and programming model from NVIDIA.
https://www.youtube.com/watch?v=86FAWCzIe_4
Lean how to program with Nvidia CUDA and leverage GPUs for high-performance computing and deep learning.
C+
https://www.freecodecamp.org/chinese/news/the-c-beginners-handbook/
本手册遵循二八定律。你将在 20% 的时间内学习 80% 的 C 编程语言。
https://www.youtube.com/watch?v=87SH2Cn0s9A
https://www.youtube.com/watch?v=KJgsSFOSQv0
This course will give you a full introduction into all of the core concepts in the C programming language.
https://www.youtube.com/watch?v=PaPN51Mm5qQ
In this complete C programming course, Dr. Charles Severance (aka Dr. Chuck) will help you understand computer architecture and low-level programming with the help of the classic C Programming language book written by Brian Kernighan and Dennis Ritchie.
深度学习+
https://d2l.ai/
Interactive deep learning book with code, math, and discussions.
NCCL+
https://developer.nvidia.com/nccl
The NVIDIA Collective Communication Library (NCCL) implements multi-GPU and multi-node communication primitives optimized for NVIDIA GPUs and networking.
还有更多 •••
相关职位
校招程序&技术类
1.针对大模型训练、强化学习、推理场景,负责GPU kernel开发与调优 2.深入分析GPU/主流AI芯片的硬件架构特性,设计并实现高性能算子、算法和相关组件 3.保持关注行业前沿技术,且有能力和热情开展创新研究
上海|北京
社招程序&技术类
1.针对大模型训练、强化学习、推理场景,负责GPU kernel开发与调优; 2.深入分析GPU/主流AI芯片的硬件架构特性,设计并实现高性能算子、算法和相关组件; 3.保持关注行业前沿技术,且有能力和热情开展创新研究;
上海|北京
社招2年以上核心本地商业-基
1. 参与超大规模的 AI 大模型训练、推理平台建设,聚焦大模型场景高性能算子、模块研发。 2. 负责研发大模型场景下“高性能训推算子模块”,提升大模型平台MFU/MBU。具体包括:a) 基于AI硬件深度理解,针对美团大模型场景研发创新性高性能模块;b) 协同框架算法设计研发平台训推技术方案;c) 调研分析业界最前沿技术方案,等等。 3. 参与搜广推场景模型训练推理核心模块研发,手段包括且不限于:AI编译器,DSL,专家级优化。
更新于 2026-05-28北京|上海