米哈游服务器运维工程师(GPU方向)
任职要求
- 计算机科学与技术、电子工程、通信工程等计算机相关专业,本科及以上学历 - 3 年以上 GPU 服务器运维经验 - 熟悉主流 GPU 体系(NVLink / NVSwitch / Fabric Manager / SXM / HBM / DCGM) - 熟悉 IPMI、Redfish、BMC 等远程管理协议 - 熟悉 BIOS / UE…
工作职责
1. GPU 服务器的故障诊断、故障恢复、报修跟进与 RMA 流程对接 2. 机器上架压测与集群初始交付性能压测(NCCL allreduce、HBM、网卡、磁盘等基线) 3. 服务器固件与驱动批量变更(BIOS、BMC、网卡固件、GPU 驱动、Fabric Manager)的灰度发布与回滚 4. 厂商工具链(DCGM、Nsight、Fabric Manager 工具等)调研与平台集成 5. 异构 AI 加速卡的硬件层适配,包括 device plugin 接入、健康检测、固件管理 6. BMC / BIOS 参数调优 7. 与驻场团队、GPU 及 OEM 厂商的工单对接
1. 高性能服务器与计算集群部署维护:负责设计、部署和维护支持AI/ML工作负载的高性能服务器和计算集群,确保其稳定性和高效性; 2. 服务器运维与应急处理:负责服务器的架构规划、运行维护、日常变更、资产管理、紧急事件应急处理等工作; 3. 分布式训练环境优化:优化分布式训练环境(如Kubernetes、Slurm集群),提升资源利用率与任务调度效率; 4. 服务器性能优化:优化服务器性能,确保高效处理大规模数据集和复杂模型训练任务; 5. AI团队协同支持:与AI团队合作,提供硬件和基础设施支持,满足AI模型训练和推理需求; 6. 架构设计与技术评估:主导或参与系统架构设计、部署、运维等相关工作,研究和评估新技术应用,并推动适合的技术落地; 7. 基础设施标准化与自动化:负责基础设施的标准化、工具化、自动化,服从上级主管安排的其他工作。
1、负责服务器稳定性治理、资源成本优化、交付效率提升相关工作,构建高效的服务器运维体系; 2、负责软硬件(服务器、操作系统)运行数据监控分析(性能、容量、事件等),构建服务器故障预测、诊断、定位、修复一体化方案; 3、负责服务器自动化运维系统的设计与开发工作,实现端到端的闭环自动化能力,包括测试、装机、验收、监控、故障处置等全模块自动化; 4、负责服务器软硬件安装、配置调试、故障处理等工作的执行指导和运维手册编写工作,能够快速准确的推动和协调内外部资源解决问题配合项目达成目标; 5、负责服务器运维技术调研和可行性验证工作,探索运维自动化和智能化的技术和方向。

1. 负责成本运营平台、服务器工单交付平台、配件管理平台、故障工单平台等服务器运维管理系统的前后端开发与功能实现 2. 负责现有运维平台的性能优化、功能迭代及线上部署工作,保障系统稳定高效运行 3. 负责服务器运维操作的 API 封装与标准化开发,构建统一的运维自动化接口体系 4. 参与服务器硬件管理相关核心功能设计与开发,包括 BMC/BIOS 远程管理、硬件状态实时监控、驱动固件批量升级、硬件故障智能诊断等模块 5. 结合服务器硬件测试与验证经验,优化运维平台的硬件兼容性检测、性能指标采集和故障预警能力,可以开发自动化测试脚本 6. 参与硬件搭载软件相关的应用测试模型设计,提升平台对不同硬件配置的适配性
1、负责服务器硬件售后服务体系建设工作,包括:售后制度流程,运维平台建设、备品备件管理、物流运输管理,硬件采购相关的技术规范等; 2、负责服务器硬件维护工作,对服务器可用性负责、服务器硬件相关投诉、故障等紧急事件的应急处置工作; 3、负责服务器硬件的监控告警优化、分析服务器各类硬件的运行数据,构建服务器故障诊断、分级、预测、修复一体化方案; 4、负责GPU服务器硬件监控、诊断、维修、维护等工作,洞察GPU硬件技术趋势,行业内前沿技术的研究、探索; 5、负责自动化运维、监控等运维,运维平台技术的调研和可行性验证,探索运维自动化和智能化的技术和方向。