logo of deepseek

深度求索高性能算子/通信/编译器工程师

社招全职AI 核心系统研发地点:北京 | 杭州状态:招聘

任职要求


1.熟悉 C++ 等编程语言,熟练掌握 Git 等工具。
2.对细节有较高关注,对性能优化有较高热情,眼界广阔,同时对代码有品味的追求。
3.良好的中文沟通能力。

【加分项】(不强制要求,也充分欢迎有热情的白纸同学加入)
1.有过 CUDA 或 Ascend C 算子编写经验,熟悉 CUTLASS、DeepGEMM 等算子库,熟练掌握 PTX ISA、Ascend C API 并深入理解 memory model 和硬件体系结构。
2.熟悉主流深度学习分布式通信库(如 NCCL、HCCL、NVSHMEM 和 DeepEP 等)的底层实现原理,具备丰富的性能调优与故障排查经验。
3.深入理解 RD…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


【团队使命】
我们构建 AGI 与物理芯片之间的最后一层软件,为训练推理框架和研究员提供高性能的计算算子、集合通信和领域编译器,同时也是模型设计和硬件 co-design 的桥梁。
团队的唯一标准:硬件的物理极限。我们不和任何 baseline 或者其他实现比较性能差异,只关心当前设计和实现距离理论上限还有多远,对每一个 cycle 和每一瓦功耗有着近乎偏执的追求。
我们为上层框架和研究员提供稳定的接口,使底层的高性能实现以使用友好、可靠且可维护的方式融入整个系统。
加入我们,你将同时深入 NVIDIA GPU 和 Ascend NPU 等国产硬件,从指令集、内存模型、编译栈到大规模互联,系统性地掌握多种硬件体系。我们不在意你是否有相关背景 —— 我们会尽可能提供必要的指导,但需要的是你对细节的严谨和对性能优化的热情。
【岗位类别】:实习/全职


1.针对 GPU/NPU 等架构,使用 CUDA、Ascend C 和 TileLang,设计、实现并长期维护 GEMM、Attention 以及其他算子。
2.针对不同通信场景和网络架构,设计、实现并长期维护通信算子(如 DeepEP 中的 EP、CP/DP、Engram、PP),同时持续对 NCCL/HCCL 等主流集合通信库进行调优和排障。
3.参与面向深度学习的 DSL 编译器(如 TileLang 等)的研发,负责设计面向新一代硬件的编译优化,并围绕内部实际的新模型、新算子和性能优化的需求扩展 DSL/IR/CodeGen 的能力,并在保持接口的简洁和可维护性的同时尽可能提升性能。
4.紧贴模型结构和算法演进,和框架同学、研究员共同为新思路设计硬件友好的模型结构和算法,并对真实训练/推理负载持续进行性能分析。
包括英文材料
C+++
Git+
CUDA+
C+
深度学习+
NCCL+
还有更多 •••
相关职位

logo of mihoyo
校招程序&技术类

1.针对大模型训练、强化学习、推理场景,负责GPU kernel开发与调优 2.深入分析GPU/主流AI芯片的硬件架构特性,设计并实现高性能算子、算法和相关组件 3.保持关注行业前沿技术,且有能力和热情开展创新研究

上海|北京
logo of mihoyo
社招程序&技术类

1.针对大模型训练、强化学习、推理场景,负责GPU kernel开发与调优; 2.深入分析GPU/主流AI芯片的硬件架构特性,设计并实现高性能算子、算法和相关组件; 3.保持关注行业前沿技术,且有能力和热情开展创新研究;

上海|北京
logo of meituan
社招2年以上核心本地商业-基

1. 参与超大规模的 AI 大模型训练、推理平台建设,聚焦大模型场景高性能算子、模块研发。 2. 负责研发大模型场景下“高性能训推算子模块”,提升大模型平台MFU/MBU。具体包括:a) 基于AI硬件深度理解,针对美团大模型场景研发创新性高性能模块;b) 协同框架算法设计研发平台训推技术方案;c) 调研分析业界最前沿技术方案,等等。 3. 参与搜广推场景模型训练推理核心模块研发,手段包括且不限于:AI编译器,DSL,专家级优化。

更新于 2026-05-28北京|上海
logo of mihoyo
实习程序&技术类

1.针对大模型训练、强化学习、推理场景,负责GPU kernel开发与调优; 2.深入分析GPU/主流AI芯片的硬件架构特性,设计并实现高性能算子、算法和相关组件; 3.保持关注行业前沿技术,且有能力和热情开展创新研究;

北京