哔哩哔哩服务器运维实习生【2027届】
任职要求
1、计算机或相关专业本科或以上学历,对服务器硬件与系统有浓厚的兴趣。 2、熟悉X86平台架构,有良好、全面的计算机软硬件知识,对CPU、内存、储存、GPU等相关硬件和技术有较深入的研究。 3、熟悉Linux操作系统基本原理并熟练掌握常见Linux发行版,能够…
工作职责
1、负责公司服务器硬件与系统运维,建设服务器自动化运维方案,参与相关工具、系统设计与开发,提高服务器硬件与系统运维效率; 2、参与服务器硬件的测试评估、软硬件性能优化以及新硬件相关技术的研究与引入 。

服务器运维专家-IDC运维 1)制定CPU、GPU服务器和关键部件的硬件测试选型标准、研发测试用例和工具,输出新硬件选型报告,支持新旧硬件升级汰换; 2)统筹服务器虚拟小组,完成新硬件选型的综合评估,管理服务器机型和部件AVL 清单,支撑采购决策的规范性与前瞻性; 3)结合国家政策、行业趋势及业务需求,推动国产化硬件的测试验证与灰度落地,加速技术自主可控进程; 4)建立行业信息监测与反馈机制,及时输出市场行情与技术动态分析,为硬件采购提供成本优化与风险预警建议; 5)负责新硬件到货验收报告输出及共性硬件故障隐患的排查处理,形成从准入到运维的闭环质量管理能力。
1. 高性能服务器与计算集群部署维护:负责设计、部署和维护支持AI/ML工作负载的高性能服务器和计算集群,确保其稳定性和高效性; 2. 服务器运维与应急处理:负责服务器的架构规划、运行维护、日常变更、资产管理、紧急事件应急处理等工作; 3. 分布式训练环境优化:优化分布式训练环境(如Kubernetes、Slurm集群),提升资源利用率与任务调度效率; 4. 服务器性能优化:优化服务器性能,确保高效处理大规模数据集和复杂模型训练任务; 5. AI团队协同支持:与AI团队合作,提供硬件和基础设施支持,满足AI模型训练和推理需求; 6. 架构设计与技术评估:主导或参与系统架构设计、部署、运维等相关工作,研究和评估新技术应用,并推动适合的技术落地; 7. 基础设施标准化与自动化:负责基础设施的标准化、工具化、自动化,服从上级主管安排的其他工作。
1、负责服务器稳定性治理、资源成本优化、交付效率提升相关工作,构建高效的服务器运维体系; 2、负责软硬件(服务器、操作系统)运行数据监控分析(性能、容量、事件等),构建服务器故障预测、诊断、定位、修复一体化方案; 3、负责服务器自动化运维系统的设计与开发工作,实现端到端的闭环自动化能力,包括测试、装机、验收、监控、故障处置等全模块自动化; 4、负责服务器软硬件安装、配置调试、故障处理等工作的执行指导和运维手册编写工作,能够快速准确的推动和协调内外部资源解决问题配合项目达成目标; 5、负责服务器运维技术调研和可行性验证工作,探索运维自动化和智能化的技术和方向。
1、负责产品的硬件设计交付,实现产品化,对产品端到端交付质量运维负责,辅助并督导上游ODM/OEM开展设计和质量运维保障工作; 2、对标业界标杆,引入先进质量运维管理方法,并制定相关产品的全流程质量运维管控方案并主导实施,开展供应商质量审核、质量体系评估、运维能力管理,确保改善措施的有效实施; 3、主导分析解决和预防重大产品质量运维问题,主导产品质量问题分析、定位及质量问题的处理与预防; 4、负责大规模服务器从交付到退役的全生命周期运维工作,包括新机型导入(NPI)、操作系统安装、维修、硬件监控、硬件重构、服务器管理等运维自动化系统架构、设计、研发,确保交付质量与效率满足SLA要求; 5、参与制定服务器可靠性标准及平台建设,负责风险应急处置,保障系统稳定性,提升业务的安全性与可持续性; 6、持续跟踪硬件相关领域的技术发展趋势,结合对阿里业务应用场景的深入分析,并推动相关技术的产品化实现。