深度求索AI 算力集群性能与可靠性工程师
社招全职运维地点:杭州状态:招聘
工作描述
任职要求 【团队使命】 AGI 时代的竞争,本质上也是大规模算力系统性能与可靠性的竞争。这里不是简单地维护机器,而是在参与建设 AGI 时代的核心基础设施。团队的价值,是让巨大而复杂的 AI 超算集群成为稳定可靠的生产力,让模型的每一次训练和推理都建立在坚实可靠的算力底座之上。 【岗位类别】:实习/全职 【我们在找什么样的人】 如果你对实现AGI这件事有强烈的兴趣和好奇心——不是因为风口热,而是你真的觉得"造出通用人工智能"是这个时代最值得投入的事情——那我们想认识你。 我们不太在意你过去有没有运维经验,也不太在意你是不是科班出身。我们在意的是: 当一个复杂问题摆在面前,边界模糊、文档缺失、没人知道答案的时候,你是退缩等别人解决,还是兴奋地冲上去拆解它、搞定它? 如果你现在不会GPU调度、不懂Kubernetes、没写过监控脚本——没关系。AGI本身就是人类从未走过的新路,没有人"有经验"。我们愿意和有热情、有潜力的人一起,从零到一建设AGI时代的基础设施。 【你将要面对的挑战】 这不是一个"按手册操作"的岗位。你会面对很多前人从未走过、文档也没写过的事情: 1.守护"吞金兽"——让十万卡集群像一台电脑一样稳定:AI超算集群里满是最前沿的加速卡、服务器和超节点,它们是大规模模型训练的命脉。你负责这些基础设施的全生命周期管理——从日常巡检、硬件维修,到故障定位与硬件置换。 (1)大模型训练动辄数周,十万张卡中的任何一张掉线、任何一个节点宕机,都可能让海量算力白白蒸发。而在十万卡的规模下,硬件故障不是"万一"会发生的事,而是"每时每刻"都在发生的事——你面对的不是"是否会坏",而是"坏了之后怎么办"。 (2)你的核心目标只有两个:持续缩短MTTR(平均故障恢复时间),以及每次故障都交出根因分析,而不是一句"重启就好了"。 (3)我们不在意你现在能不能背出某型号GPU的故障代码表,但我们要求你:面对一张"卡掉了"的模糊现象,知道从哪里开始查、怎么一步步逼近真相。 在十万卡规模下,这种能力不是锦上添花,是生死线。 2.让新算力"开箱即巅峰"——高质量交付每一批资源:新一代计算资源到货不是插上电就能用的。你需要独立完成新节点的基线检查、性能调优与生产验证,确保每一台新上线的机器都以最佳状态投入战斗。在十万卡集群中,新节点交付是持续进行的,每一批的质量都直接影响整体算力输出。 (1)你要回答的问题是:"这批新卡的理论峰值是多少?我们实际跑到了多少?差距来自硬件、驱动、网络还是配置?" (2)我们不考你"会用什么工具做benchmark",而是在意你能不能设计一套验证流程,让"性能是否达标"这件事有数据可依、有标准可判。 3…
登录查看完整工作描述
微信扫码,1秒登录
包括英文材料
Kubernetes+
https://kubernetes.io/docs/tutorials/kubernetes-basics/
This tutorial provides a walkthrough of the basics of the Kubernetes cluster orchestration system.
https://kubernetes.io/zh-cn/docs/tutorials/kubernetes-basics/
本教程介绍 Kubernetes 集群编排系统的基础知识。每个模块包含关于 Kubernetes 主要特性和概念的一些背景信息,还包括一个在线教程供你学习。
https://www.youtube.com/watch?v=s_o8dwzRlu4
Hands-On Kubernetes Tutorial | Learn Kubernetes in 1 Hour - Kubernetes Course for Beginners
https://www.youtube.com/watch?v=X48VuDVv0do
Full Kubernetes Tutorial | Kubernetes Course | Hands-on course with a lot of demos
脚本+
[英文] Scripting language
https://en.wikipedia.org/wiki/Scripting_language
https://zhuanlan.zhihu.com/p/571097954
一个脚本通常是解释执行而非编译。脚本语言通常都有简单、易学、易用的特性,目的就是希望能让程序员快速完成程序的编写工作。
大模型+
https://www.youtube.com/watch?v=xZDB1naRUlk
You will build projects with LLMs that will enable you to create dynamic interfaces, interact with vast amounts of text data, and even empower LLMs with the capability to browse the internet for research papers.
https://www.youtube.com/watch?v=zjkBMFhNj_g
性能调优+
https://goperf.dev/
The Go App Optimization Guide is a series of in-depth, technical articles for developers who want to get more performance out of their Go code without relying on guesswork or cargo cult patterns.
https://web.dev/learn/performance
This course is designed for those new to web performance, a vital aspect of the user experience.
https://www.ibm.com/think/insights/application-performance-optimization
Application performance is not just a simple concern for most organizations; it’s a critical factor in their business’s success.
https://www.oreilly.com/library/view/optimizing-java/9781492039259/
Performance tuning is an experimental science, but that doesn’t mean engineers should resort to guesswork and folklore to get the job done.
NCCL+
https://developer.nvidia.com/nccl
The NVIDIA Collective Communication Library (NCCL) implements multi-GPU and multi-node communication primitives optimized for NVIDIA GPUs and networking.
Prometheus+
https://grafana.com/docs/grafana/latest/getting-started/get-started-grafana-prometheus/
Prometheus is an open source monitoring system for which Grafana provides out-of-the-box support.
https://prometheus.io/docs/tutorials/getting_started/
Prometheus is a system monitoring and alerting system.
Ansible+
https://docs.ansible.com/ansible/latest/getting_started/index.html
Ansible automates the management of remote systems and controls their desired state.
还有更多 •••
相关职位
社招5年以上
1. 拥有5年以上大规模分布式系统设计及研发经验,独立负责过包含多模块的业务子系统,包括接口定义、架构设计及关键分布式问题的技术方案细化等工作。 2. 编程基本功扎实,熟悉数据结构和算法,熟练掌握Go
更新于 2026-08-31北京|杭州
社招5年以上云智能集团
1. 拥有5年以上大规模分布式系统设计及研发经验,独立负责过包含多模块的业务子系统,包括接口定义、架构设计及关键分布式问题的技术方案细化等工作。 2. 编程基本功扎实,熟悉数据结构和算法,熟练掌握Go
更新于 2025-11-26北京|杭州
社招5年以上云智能集团
1. 拥有5年以上大规模分布式系统设计及研发经验,独立负责过包含多模块的业务子系统,包括接口定义、架构设计及关键分布式问题的技术方案细化等工作。 2. 编程基本功扎实,熟悉数据结构和算法,熟练掌握Go
更新于 2025-11-27北京|杭州