logo of aliyun

阿里云阿里云智能-AI Infra SRE 专家-杭州

社招全职5年以上地点:杭州状态:招聘♡ 收藏

工作描述


任职要求
1、5年以上互联网、云计算或大规模基础设施相关经验,具有大型 GPU 集群、AI 训练平台或高性能计算平台建设经验。
2、深入理解 Linux、分布式系统、计算、网络和存储体系,具备复杂故障的跨层分析及性能优化能力;深入掌握 Kubernetes、Slurm、LSF 等调度系统,理解 GPU 资源调度、拓扑感知、任务容错和大规模集群治理。
3、熟悉 GPU、RDMA/RoCE/InfiniBand、NCCL、高性能存储等技术,能够分析训练任务稳定性、通信性能及软硬件协同问题。
4、具备较强的软件工程和平台架构能力,能够主导自动化运维、自愈系统或稳定性平台建设。有成…
登录查看完整工作描述
微信扫码,1秒登录

包括英文材料
Linux+
分布式系统+
还有更多 •••
相关职位

logo of tencent
社招3年以上广告(数据计算平

1.计算机、软件工程、网络工程等相关专业本科及以上学历,具备 3 年及以上大型互联网或 AI Infra 运维 / SRE 经验; 2.熟悉 Linux 操作系统原理,具备扎实的网络、存储、系统调优

更新于 2026-09-01深圳
logo of moonshot
社招3年以上技术类/Tech

职位描述 负责月之暗面大规模 GPU 训练与推理集群的稳定性保障,支撑业务 7×24 高可用运行; 负责 Kubernetes 及云原生周边系统(监控、日志、镜像分发、存储)的运维保障与平台化工具开发

更新于 2026-05-28深圳|北京
logo of aliyun
社招3年以上

1、3年及以上互联网、云计算或数据中心基础设施运维经验,具有 GPU 集群、AI 训练平台或大规模计算集群经验者优先。 2、熟悉 Linux 操作系统、TCP/IP等基础技术,具备较强的系统、网络和性

更新于 2026-10-09杭州
logo of ctrip
社招1年以上住宿业务AI &

职位描述参与推荐系统 GPU 推理引擎的研发工作,支撑生成式推荐、排序、召回等业务场景的在线推理服务落地。参与 CUDA 算子开发与优化,包括算子融合、量化(INT8/FP8)、Tensor Core

更新于 2026-08-31上海