logo of minimax

MiniMaxAI infra-主机研发工程师

社招全职基础架构地点:北京 | 上海状态:招聘

工作描述


一、岗位定位
  参与建设支撑大模型训练与推理的主机基础设施,将大规模 GPU 服务器打造为可编程、可观测、可诊断、可自愈的标准化计算节点,持续提升 AI 集群的稳定性、资源利用率和扩展效率。
二、你将负责
  1. 设计和研发 GPU 主机管理控制面,实现节点状态管理、配置下发、故障诊断、自动恢复和交付验收。
  2. 打通物理硬件、Linux 操作系统、容器与资源调度平台,推动主机能力标准化、平台化。
  3. 深入 GPU、CPU、内存、网络和存储等关键链路,定位并解决复杂的稳定性与性能问题。
  4. 建设面向大规模节点的监控、故障决策和自动化运维体系,降低人工维护成本。
  …
登录查看完整工作描述
微信扫码,1秒登录

包括英文材料
大模型+
Linux+
学历+
Go+
Python+
C+
还有更多 •••
相关职位

logo of ctrip
社招1年以上住宿业务AI &

职位描述参与推荐系统 GPU 推理引擎的研发工作,支撑生成式推荐、排序、召回等业务场景的在线推理服务落地。参与 CUDA 算子开发与优化,包括算子融合、量化(INT8/FP8)、Tensor Core

更新于 2026-08-31上海
logo of tencent
社招5年以上运营管理(运营管

1.2年以上相关开发经验,熟悉Go/C++/Python/Java等至少两门语言; 2.有TensorFlow、Pytorch使用或者优化经验,有机器学习平台开发经验优先; 3.了解GPU、CUD

更新于 2026-06-16深圳
logo of ke
校招研发类

1、硕士及以上学历,毕业时间:2025年9月-2026年8月,计算机、软件工程、人工智能、云计算或相关专业; 2、熟练掌握Go语言,具备清晰的代码结构、良好的编码习惯和严谨的逻辑思维; 3、熟悉常见的

更新于 2026-03-10北京
logo of unitree
社招

1. 具备千卡级 GPU 集群训练实践,熟悉⼤模型训练中的常⻅问题与系统级解决⽅案; 2. 熟练掌握 DDP / FSDP 等分布式机制底层原理; 3. 熟练运⽤ DeepSpeed、Megatron

更新于 2026-04-22杭州