阿里云阿里云智能-AI Infra SRE 专家-杭州
社招全职5年以上地点:杭州状态:招聘♡ 收藏
工作描述
任职要求 1、5年以上互联网、云计算或大规模基础设施相关经验,具有大型 GPU 集群、AI 训练平台或高性能计算平台建设经验。 2、深入理解 Linux、分布式系统、计算、网络和存储体系,具备复杂故障的跨层分析及性能优化能力;深入掌握 Kubernetes、Slurm、LSF 等调度系统,理解 GPU 资源调度、拓扑感知、任务容错和大规模集群治理。 3、熟悉 GPU、RDMA/RoCE/InfiniBand、NCCL、高性能存储等技术,能够分析训练任务稳定性、通信性能及软硬件协同问题。 4、具备较强的软件工程和平台架构能力,能够主导自动化运维、自愈系统或稳定性平台建设。有成…
登录查看完整工作描述
微信扫码,1秒登录
包括英文材料
Linux+
https://ryanstutorials.net/linuxtutorial/
Ok, so you want to learn how to use the Bash command line interface (terminal) on Unix/Linux.
https://ubuntu.com/tutorials/command-line-for-beginners
The Linux command line is a text interface to your computer.
https://www.youtube.com/watch?v=6WatcfENsOU
In this Linux crash course, you will learn the fundamental skills and tools you need to become a proficient Linux system administrator.
https://www.youtube.com/watch?v=v392lEyM29A
Never fear the command line again, make it fear you.
https://www.youtube.com/watch?v=ZtqBQ68cfJc
分布式系统+
https://www.distributedsystemscourse.com/
The home page of a free online class in distributed systems.
https://www.youtube.com/watch?v=7VbL89mKK3M&list=PLOE1GTZ5ouRPbpTnrZ3Wqjamfwn_Q5Y9A
还有更多 •••
相关职位
社招3年以上广告(数据计算平
1.计算机、软件工程、网络工程等相关专业本科及以上学历,具备 3 年及以上大型互联网或 AI Infra 运维 / SRE 经验; 2.熟悉 Linux 操作系统原理,具备扎实的网络、存储、系统调优
更新于 2026-09-01深圳
社招3年以上技术类/Tech
职位描述 负责月之暗面大规模 GPU 训练与推理集群的稳定性保障,支撑业务 7×24 高可用运行; 负责 Kubernetes 及云原生周边系统(监控、日志、镜像分发、存储)的运维保障与平台化工具开发
更新于 2026-05-28深圳|北京
社招3年以上
1、3年及以上互联网、云计算或数据中心基础设施运维经验,具有 GPU 集群、AI 训练平台或大规模计算集群经验者优先。 2、熟悉 Linux 操作系统、TCP/IP等基础技术,具备较强的系统、网络和性
更新于 2026-10-09杭州