logo of deepseek

深度求索AI 算力集群性能与可靠性工程师

社招全职运维地点:杭州状态:招聘

任职要求


【团队使命】
AGI 时代的竞争,本质上也是大规模算力系统性能与可靠性的竞争。这里不是简单地维护机器,而是在参与建设 AGI 时代的核心基础设施。团队的价值,是让巨大而复杂的 AI 超算集群成为稳定可靠的生产力,让模型的每一次训练和推理都建立在坚实可靠的算力底座之上。
【岗位类别】:实习/全职

【我们在找什么样的人】
如果你对实现AGI这件事有强烈的兴趣和好奇心——不是因为风口热,而是你真的觉得"造出通用人工智能"是这个时代最值得投入的事情——那我们想认识你。
我们不太在意你过去有没有运维经验,也不太在意你是不是科班出身。我们在意的是: 当一个复杂问题摆在面前,边界模糊、文档缺失、没人知道答案的时候,你是退缩等别人解决,还是兴奋地冲上去拆解它、搞定它?
如果你现在不会GPU调度、不懂Kubernetes、没写过监控脚本——没关系。AGI本身就是人类从未走过的新路,没有人"有经验"。我们愿意和有热情、有潜力的人一起,从零到一建设AGI时代的基础设施。

【你将要面对的挑战】
这不是一个"按手册操作"的岗位。你会面对很多前人从未走过、文档也没写过的事情:
1.守护"吞金兽"——让十万卡集群像一台电脑一样稳定:AI超算集群里满是最前沿的加速卡、服务器和超节点,它们是大规模模型训练的命脉。你负责这些基础设施的全生命周期管理——从日常巡检、硬件维修,到故障定位与硬件置换。
(1)大模型训练动辄数周,十万张卡中的任何一张掉线、任何一个节点宕机,都可能让海量算力白白蒸发。而在十万卡的规模下,硬件故障不是"万一"会发生的事,而是"每时每刻"都在发生的事——你面对的不是"是否会坏",而是"坏了之后怎么办"。
(2)你的核心目标只有两个:持续缩短MTTR(平均故障恢复时间),以及每次故障都交出根因分析,而不是一句"重启就好了"。
(3)我们不在意你现在能不能背出某型号GPU的故障代码表,但我们要求你:面对一张"卡掉了"的模糊现象,知道从哪里开始查、怎么一步步逼近真相。 在十万卡规模下,这种能力不是锦上添花,是生死线。
2.让新算力"开箱即巅峰"——高质量交付每一批资源:新一代计算资源到货不是插上电就能用的。你需要独立完成新节点的基线检查、性能调优与生产验证,确保每一台新上线的机器都以最佳状态投入战斗。在十万卡集群中,新节点交付是持续进行的,每一批的质量都直接影响整体算力输出。
(1)你要回答的问题是:"这批新卡的理论峰值是多少?我们实际跑到了多少?差距来自硬件、驱动、网络还是配置?"
(2)我们不考你"会用什么工具做benchmark",而是在意你能不能设计一套验证流程,让"性能是否达标"这件事有数据可依、有标准可判。
3.把"黑盒"变透明——让集群健康实时可见:十万卡级的大模型训练是一个巨大的黑盒,规模越大,透明度越重要。你负责建设和优化面向AI超算集群的监控、告警与可观测性体系,让这个黑盒被彻底打开。
(1)每一帧GPU利用率的波动、每一次NCCL通信的延迟抖动、每一次checkpoint保存的耗时变化,都必须在你的视野之内——而在十万卡规模下,这些信号的数量级是前所未有的,你需要懂得降噪,知道哪些告警值得看、哪些可以忽略。
(2)我们要的不是"把Prometheus装起来就行"。我们要的是:当集群即将出问题的时候,告警先于业务投诉到达;当问题发生后,你能快速回答"为什么"。
(3)我们不问你用过哪些监控工具,而是问:如果只给你3个核心指标来判断集群整体健康度,你选哪三个?为什么选它们?
4.用自动化替代人工——让集群自己救自己:十万卡集群的运维不能靠堆人。当故障发生的频率远超人工响应的速度,唯一的出路是让机器自己修复自己。你需要构建自动化运维工具链,把常见故障的诊断和修复固化成代码,让集群具备故障自愈能力。
(1)目标很朴素:让值班工程师不再被半夜的报警电话吵醒。 在十万卡规模下,如果每张卡每年发生一次故障,平均每天就有近三百个故障需要处理——没有任何团队能靠人工扛住这个量级。
(2)我们不问"你用Ansible还是S…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


包括英文材料
Kubernetes+
脚本+
大模型+
性能调优+
NCCL+
Prometheus+
Ansible+
还有更多 •••
相关职位

logo of aliyun
社招5年以上云智能集团

1. 建设灵骏集群监管控系统核心能力,不断提升客户在云上使用灵骏智算集群产品的自动化、智能化程度。 2. 建设满足业务场景和数据合规要求的智算集群库存管理体系,结合节点调度、性能分析、故障自动化处理、租户运维功能等核心体系能力,持续提升灵骏智算集群产品竞争力。 3. 建设智算集群和管控系统自身高可用体系,如智算集群健康检测、节点与集群异常快速处置体系、管控组件故障自动定位、自动恢复、自适应容灾、云原生技术实施及落地等,保障业务持续可用、保障线上系统稳定性。 4. 建设异构算力统一管理及资源调度系统,持续智算集群资源利用率、降低计算成本。 5. 持续跟踪AI智算、云原生及智能运维领域新技术,结合业务场景进行创新。 6. 该职位涉及值班响应的职责,在服务级别协议(SLA)时间内做出对客响应,推动客户问题的解决,改善客户体验。

更新于 2025-11-26北京|杭州
logo of aliyun
社招5年以上云智能集团

1. 建设灵骏集群监管控系统核心能力,不断提升客户在云上使用灵骏智算集群产品的自动化、智能化程度。 2. 建设满足业务场景和数据合规要求的智算集群库存管理体系,结合节点调度、性能分析、故障自动化处理、租户运维功能等核心体系能力,持续提升灵骏智算集群产品竞争力。 3. 建设智算集群和管控系统自身高可用体系,如智算集群健康检测、节点与集群异常快速处置体系、管控组件故障自动定位、自动恢复、自适应容灾、云原生技术实施及落地等,保障业务持续可用、保障线上系统稳定性。 4. 建设异构算力统一管理及资源调度系统,持续智算集群资源利用率、降低计算成本。 5. 持续跟踪AI智算、云原生及智能运维领域新技术,结合业务场景进行创新。 6. 该职位涉及值班响应的职责,在服务级别协议(SLA)时间内做出对客响应,推动客户问题的解决,改善客户体验。

更新于 2025-11-27北京|杭州
logo of aliyun
社招5年以上云智能集团

1. 建设灵骏集群监管控系统核心能力,不断提升客户在云上使用灵骏智算集群产品的自动化、智能化程度。 2. 建设满足业务场景和数据合规要求的智算集群库存管理体系,结合节点调度、性能分析、故障自动化处理、租户运维功能等核心体系能力,持续提升灵骏智算集群产品竞争力。 3. 建设智算集群和管控系统自身高可用体系,如智算集群健康检测、节点与集群异常快速处置体系、管控组件故障自动定位、自动恢复、自适应容灾、云原生技术实施及落地等,保障业务持续可用、保障线上系统稳定性。 4. 建设异构算力统一管理及资源调度系统,持续智算集群资源利用率、降低计算成本。 5. 持续跟踪AI智算、云原生及智能运维领域新技术,结合业务场景进行创新。 6. 该职位涉及值班响应的职责,在服务级别协议(SLA)时间内做出对客响应,推动客户问题的解决,改善客户体验。

更新于 2026-01-05北京|杭州
logo of digitalchina
社招

1、负责“商汤”AI算力Token、接口调用Token、授权Token产品的销售与推广,完成个人及团队月度、季度销售指标; 2、开发企业及个人客户资源,通过线上线下渠道拓展新客户,挖掘客户Token用量及采购需求; 3、为客户讲解Token算力规格、计费模式、使用场景、套餐政策,提供专业咨询与方案匹配; 4、跟进客户咨询、报价、谈判、下单、充值及续约全流程,促成成交及复购; 5、维护老客户关系,定期回访,跟进消耗用量,推动增购、续费及转介绍; 6、收集市场同行价格、政策及客户需求反馈,整理销售数据、客户台账,定期提交工作报表; 7、遵守公司业务合规规则,规范业务沟通及成交流程,把控合作风险; 8、配合团队完成市场推广、活动宣发、渠道分销等相关销售工作。

更新于 2026-07-13深圳