logo of aliyun

阿里云阿里云智能-AI Infra 高级 SRE-杭州

社招全职3年以上地点:杭州状态:招聘♡ 收藏

工作描述


任职要求
1、3年及以上互联网、云计算或数据中心基础设施运维经验,具有 GPU 集群、AI 训练平台或大规模计算集群经验者优先。
2、熟悉 Linux 操作系统、TCP/IP等基础技术,具备较强的系统、网络和性能问题排查能力;熟悉 Kubernetes、Slurm、LSF 等一种或多种集群调度系统,了解容器运行时、资源调度和任务生命周期管理。
3、了解 GPU、RDMA/RoCE/InfiniBand、高性能存储等 AI 基础设施关键技术,能够定位常见软硬件故障。
4、掌握 Python、Shell…
登录查看完整工作描述
微信扫码,1秒登录

包括英文材料
Linux+
TCP/IP+
Kubernetes+
还有更多 •••
相关职位

logo of huawei
社招1年以上研发族

技能要求: 1、掌握基本的预训练模型的原理、分布式训练、推理及微调技术等,并掌握相关实现及优化方案,有模型训练、推理应用经验者优先; 2、有容器应用开发、分布式作业性能优化、集合通信性能评估优化经历者

更新于 2026-04-23上海
logo of huawei
社招3年以上研发族

语言要求: 简体中文 教育背景要求: 本科及以上 技能要求: 1、熟悉GCC/LLVM/JDK/Go等一种或多种编译器架构; 2、熟悉基本的workload性能分析方法和工具,如PMU/SPE/C

更新于 2026-04-23杭州
logo of alibaba
社招2年以上

【我们期待这样的你】 基础扎实:计算机相关专业背景,拥有深厚的 C++ 功底,精通数据结构、算法及操作系统原理(内存管理、多线程、锁机制)。 专项特长(满足以下任一方向即可,不必全能): 推理优化方向

更新于 2026-09-20北京
logo of tencent
社招3年以上视频号短视频技术

1.本科以及以上学历,计算机相关专业,3年及以上工程经验; 2.熟悉Linux 开发环境、熟悉C/C++编程语言,熟练掌握常用算法和数据结构; 3.AI Coding思路清晰; 4.有AI训练和

更新于 2026-09-20深圳