logo of deepseek

深度求索超算集群研发工程师

社招全职AI 核心系统研发地点:北京 | 杭州状态:招聘

工作描述


【团队使命】
在 AI 时代,超算集群就是把电力转换为智能的引擎。它是通向 AGI 的坚实底座。
从万卡集群去往数十万卡的路上,丛生着系统复杂度的荆棘。我们的目标,是跑满所有计算资源,榨干每一份算力。这牵涉着异构算力的调度权衡、全系统栈的性能调优、超大规模网络的互联承载,以此探索下一代集群的更优架构。
每一层设计都需要我们从第一性原理出发,重新审视,重新思考。让每一瓦电力都尽可能多地转换为有效算力,让每一次模型训练和推理都扎根于极致高效的算力底座之上。
【岗位类别】:实习/全职

【工作职责】
你将根据团队目标和个人专长,参与以下关键领域中的一个或多个方向的架构设计与工程实现:
集群调度方向
1.负责异构集群的训推一体平台开发,解决 CPU/GPU/NPU 等资源的抽象、池化与拓扑感知,提高易用性。
2.持续优化调度算法,在任务优先级、系统吞吐、排队延迟与资源利用率之间取得均衡。
高性能网络方向
1.负责 AI 超算集群网络的拓扑设计、路由策略、多路径负载均衡和拥塞控制,深入研究 RDMA(RoCEv2 / InfiniBand)协议栈,与通信算子、存储团队配合,提供来自高性能网络的最优底层支撑。
2.排查各种基础组件在大规模训练和推理任务的故障,进行问题定位和调优。
3.从集群视角(CPU/GPU/网网络/操作系统),分析大规模并行系统中的性能抖动、长尾延迟以及快慢节点等系统性问题,支…
登录查看完整工作描述
微信扫码,1秒登录

包括英文材料
C+
C+++
Rust+
Python+
分布式系统+
高可用+
还有更多 •••
相关职位

logo of deepseek
实习全职

1. 本科及以上学历,计算机、电子、通信、自动化或相关专业优先。 2. 具备 Linux 服务器运维经验,熟悉集群环境下的系统管理、故障排查与性能分析。 3. 熟悉 GPU/AI 加速卡服务器、RDM

更新于 2026-05-22杭州
logo of hello
社招软研类

• 本科及以上学历,计算机、自动化、软件工程或相关专业。 • 熟悉至少一种编程语言:Python、Go、C++ 或 Java。 • 对 AI、分布式系统或云原生技术有兴趣,有相关课程或项目经验优先

更新于 2025-12-11北京|上海
logo of hello
社招算法

• 本科及以上学历,计算机、人工智能、软件工程、数学或相关专业。 • 熟练使用 Python,熟悉 PyTorch,理解模型训练流程、DataLoader 与分布式训练原理。 • 具备基本数据结构

更新于 2025-12-15上海
logo of eleme
社招3年以上技术类-开发

1.计算机科学、软件工程、人工智能等相关专业,3年以上工程化开发经验(含1年以上 RL 或深度学习基础设施相关经验); 2.熟练掌握 Python编程,具备扎实的工程编码能力,熟悉 C/C++ 者优先

更新于 2026-04-02杭州