影石服务器运维实习生
任职要求
职位要求 1.负责IT运维基础环境配置变更及配置优化调整; 2.负责基础架构IT支撑,包括但不限于硬件服务器,虚拟化服务器,存储服务器; 3.负责日常IT资源交付,根据IT运维规范初始化资源配置…
工作职责
职位描述 1.负责IT运维基础环境配置变更及配置优化调整; 2.负责基础架构IT支撑,包括但不限于硬件,软件,AI大模型; 3.负责日常IT资源交付,根据IT运维规范初始化资源配置并对接需求部门交付资源; 4.协助服务器组其他人员进行研发部门IT需求收集,需求整理。
1、负责公司服务器硬件与系统运维,建设服务器自动化运维方案,参与相关工具、系统设计与开发,提高服务器硬件与系统运维效率; 2、参与服务器硬件的测试评估、软硬件性能优化以及新硬件相关技术的研究与引入 。

服务器运维专家-IDC运维 1)制定CPU、GPU服务器和关键部件的硬件测试选型标准、研发测试用例和工具,输出新硬件选型报告,支持新旧硬件升级汰换; 2)统筹服务器虚拟小组,完成新硬件选型的综合评估,管理服务器机型和部件AVL 清单,支撑采购决策的规范性与前瞻性; 3)结合国家政策、行业趋势及业务需求,推动国产化硬件的测试验证与灰度落地,加速技术自主可控进程; 4)建立行业信息监测与反馈机制,及时输出市场行情与技术动态分析,为硬件采购提供成本优化与风险预警建议; 5)负责新硬件到货验收报告输出及共性硬件故障隐患的排查处理,形成从准入到运维的闭环质量管理能力。
1. 高性能服务器与计算集群部署维护:负责设计、部署和维护支持AI/ML工作负载的高性能服务器和计算集群,确保其稳定性和高效性; 2. 服务器运维与应急处理:负责服务器的架构规划、运行维护、日常变更、资产管理、紧急事件应急处理等工作; 3. 分布式训练环境优化:优化分布式训练环境(如Kubernetes、Slurm集群),提升资源利用率与任务调度效率; 4. 服务器性能优化:优化服务器性能,确保高效处理大规模数据集和复杂模型训练任务; 5. AI团队协同支持:与AI团队合作,提供硬件和基础设施支持,满足AI模型训练和推理需求; 6. 架构设计与技术评估:主导或参与系统架构设计、部署、运维等相关工作,研究和评估新技术应用,并推动适合的技术落地; 7. 基础设施标准化与自动化:负责基础设施的标准化、工具化、自动化,服从上级主管安排的其他工作。
1、负责服务器稳定性治理、资源成本优化、交付效率提升相关工作,构建高效的服务器运维体系; 2、负责软硬件(服务器、操作系统)运行数据监控分析(性能、容量、事件等),构建服务器故障预测、诊断、定位、修复一体化方案; 3、负责服务器自动化运维系统的设计与开发工作,实现端到端的闭环自动化能力,包括测试、装机、验收、监控、故障处置等全模块自动化; 4、负责服务器软硬件安装、配置调试、故障处理等工作的执行指导和运维手册编写工作,能够快速准确的推动和协调内外部资源解决问题配合项目达成目标; 5、负责服务器运维技术调研和可行性验证工作,探索运维自动化和智能化的技术和方向。