logo of deepseek

深度求索AI 算力集群性能与可靠性工程师

社招全职运维地点:杭州状态:招聘

工作描述


任职要求
【团队使命】
AGI 时代的竞争,本质上也是大规模算力系统性能与可靠性的竞争。这里不是简单地维护机器,而是在参与建设 AGI 时代的核心基础设施。团队的价值,是让巨大而复杂的 AI 超算集群成为稳定可靠的生产力,让模型的每一次训练和推理都建立在坚实可靠的算力底座之上。
【岗位类别】:实习/全职

【我们在找什么样的人】
如果你对实现AGI这件事有强烈的兴趣和好奇心——不是因为风口热,而是你真的觉得"造出通用人工智能"是这个时代最值得投入的事情——那我们想认识你。
我们不太在意你过去有没有运维经验,也不太在意你是不是科班出身。我们在意的是: 当一个复杂问题摆在面前,边界模糊、文档缺失、没人知道答案的时候,你是退缩等别人解决,还是兴奋地冲上去拆解它、搞定它?
如果你现在不会GPU调度、不懂Kubernetes、没写过监控脚本——没关系。AGI本身就是人类从未走过的新路,没有人"有经验"。我们愿意和有热情、有潜力的人一起,从零到一建设AGI时代的基础设施。

【你将要面对的挑战】
这不是一个"按手册操作"的岗位。你会面对很多前人从未走过、文档也没写过的事情:
1.守护"吞金兽"——让十万卡集群像一台电脑一样稳定:AI超算集群里满是最前沿的加速卡、服务器和超节点,它们是大规模模型训练的命脉。你负责这些基础设施的全生命周期管理——从日常巡检、硬件维修,到故障定位与硬件置换。
(1)大模型训练动辄数周,十万张卡中的任何一张掉线、任何一个节点宕机,都可能让海量算力白白蒸发。而在十万卡的规模下,硬件故障不是"万一"会发生的事,而是"每时每刻"都在发生的事——你面对的不是"是否会坏",而是"坏了之后怎么办"。
(2)你的核心目标只有两个:持续缩短MTTR(平均故障恢复时间),以及每次故障都交出根因分析,而不是一句"重启就好了"。
(3)我们不在意你现在能不能背出某型号GPU的故障代码表,但我们要求你:面对一张"卡掉了"的模糊现象,知道从哪里开始查、怎么一步步逼近真相。 在十万卡规模下,这种能力不是锦上添花,是生死线。
2.让新算力"开箱即巅峰"——高质量交付每一批资源:新一代计算资源到货不是插上电就能用的。你需要独立完成新节点的基线检查、性能调优与生产验证,确保每一台新上线的机器都以最佳状态投入战斗。在十万卡集群中,新节点交付是持续进行的,每一批的质量都直接影响整体算力输出。
(1)你要回答的问题是:"这批新卡的理论峰值是多少?我们实际跑到了多少?差距来自硬件、驱动、网络还是配置?"
(2)我们不考你"会用什么工具做benchmark",而是在意你能不能设计一套验证流程,让"性能是否达标"这件事有数据可依、有标准可判。
3…
登录查看完整工作描述
微信扫码,1秒登录

包括英文材料
Kubernetes+
脚本+
大模型+
性能调优+
NCCL+
Prometheus+
Ansible+
还有更多 •••
相关职位

logo of aliyun
社招5年以上

1. 拥有5年以上大规模分布式系统设计及研发经验,独立负责过包含多模块的业务子系统,包括接口定义、架构设计及关键分布式问题的技术方案细化等工作。 2. 编程基本功扎实,熟悉数据结构和算法,熟练掌握Go

更新于 2026-08-31北京|杭州
logo of aliyun
社招5年以上云智能集团

1. 拥有5年以上大规模分布式系统设计及研发经验,独立负责过包含多模块的业务子系统,包括接口定义、架构设计及关键分布式问题的技术方案细化等工作。 2. 编程基本功扎实,熟悉数据结构和算法,熟练掌握Go

更新于 2025-11-26北京|杭州
logo of aliyun
社招5年以上云智能集团

1. 拥有5年以上大规模分布式系统设计及研发经验,独立负责过包含多模块的业务子系统,包括接口定义、架构设计及关键分布式问题的技术方案细化等工作。 2. 编程基本功扎实,熟悉数据结构和算法,熟练掌握Go

更新于 2025-11-27北京|杭州
logo of aliyun
社招5年以上云智能集团

1. 拥有5年以上大规模分布式系统设计及研发经验,独立负责过包含多模块的业务子系统,包括接口定义、架构设计及关键分布式问题的技术方案细化等工作。 2. 编程基本功扎实,熟悉数据结构和算法,熟练掌握Go

更新于 2026-01-05北京|杭州