阿里云阿里云智能-运维技术专家-AI&MaaS方向-杭州
任职要求
1. 专业背景:计算机、软件工程、人工智能等相关专业,具备扎实的计算机科学基础,对云计算或 AI 大模型方向有浓厚的兴趣和持续的技术积累。 2. 技术栈能力:3 年以上云计算或 AI 基础设施运维、SRE、稳定性保障相关经验。技术栈聚焦以下一个或多个领域: ● 运维技术栈:深入理解 Kubernetes 等云原生基础设施,熟悉监控、告警、变更、容灾等 SRE 工具链,具备存储、网络、数据库等云计算产品运维经验 ● AI 技术栈:熟悉大语言模型(LLM)与 Agent 技术,有将其应用于自动化运维、故障诊断或系统分析的实践经验;了解 GPU 集群管理、模型推理服务架构者优先 3. 系统性解决问题能力:具备清晰的分析逻辑与全局思维,能针对复杂系统行为识别潜在风险与异常模式;善于从系统设计与工程机制角度提出创造性的解决思路,推动问题根除与持续改进。 4. …
工作职责
部门介绍 云智能集团承载着阿里巴巴集团在人工智能与云计算领域的核心技术与业务创新,致力于构建面向全球的企业级 MaaS(Model as a Service)平台。随着大模型技术的快速发展,MaaS 已成为云计算服务的重要形态,涵盖模型推理服务、模型训练集群、AI 基础设施、向量数据库等核心产品矩阵。 GOC(Global Operations Center)团队承担着 MaaS 平台生产环境的稳定性保障与服务连续性使命。我们面临的挑战包括: 1. GPU 基础设施稳定性:万卡级 GPU 集群的高可用管理、故障隔离与容灾调度 2. 模型服务高可用:大模型推理服务 99.99% 可用性保障,毫秒级响应 SLA 3. AI-Native 运维体系:构建智能化运维能力,实现故障自愈、智能诊断与预测性维护 4. 大规模活动保障:支撑双 11、重要客户上线、模型发布会等关键时期的服务稳定性 5. 数据安全与合规:保障客户模型资产、训练数据、推理请求的数据可靠性与合规性 岗位职责 1. 稳定性体系建设与度量:建立并完善 MaaS 平台稳定性规范、标准与流程体系,覆盖健壮性架构、研发质量、发布变更、生产环境运行管理等方面,制定稳定性度量指标并持续度量改进,将稳定性要求贯彻到平台技术研发全链路。 2. 故障全生命周期管理:负责 MaaS 平台技术类故障的全流程管理,包括应急响应、协同调度、故障定位、恢复处置与复盘改进;执行值班响应职责,在 SLA 时间内完成对客响应,持续优化故障管理体系的质量与效率。 3. 推动稳定性架构治理战役:主导推进 MaaS 平台稳定性架构治理重大战役,包括全栈容灾、变更灰度、应急 1-5-10、资损防控、GPU 故障隔离等,通过技术与管理结合的体系化手段将稳定性风险快速持续收敛。 4. MaaS 运维保障解决方案落地:设计并落地 MaaS 业务的运维保障解决方案,涵盖线上问题管理、全链路监控管理、生产变更管理、故障容灾演练等方向;沉淀运维最佳实践,形成面向云用户的标准运维保障方案,持续优化落地效果。 5. 客户活动稳定性保障:主导客户大型活动的稳定性保障工作,包括重要模型发布、业务大促(如双 11)、行业峰会等关键时期的全方位保障,确保客户业务连续运行与体验。
1、负责产品的硬件设计交付,实现产品化,对产品端到端交付质量运维负责,辅助并督导上游ODM/OEM开展设计和质量运维保障工作; 2、对标业界标杆,引入先进质量运维管理方法,并制定相关产品的全流程质量运维管控方案并主导实施,开展供应商质量审核、质量体系评估、运维能力管理,确保改善措施的有效实施; 3、主导分析解决和预防重大产品质量运维问题,主导产品质量问题分析、定位及质量问题的处理与预防; 4、负责大规模服务器从交付到退役的全生命周期运维工作,包括新机型导入(NPI)、操作系统安装、维修、硬件监控、硬件重构、服务器管理等运维自动化系统架构、设计、研发,确保交付质量与效率满足SLA要求; 5、参与制定服务器可靠性标准及平台建设,负责风险应急处置,保障系统稳定性,提升业务的安全性与可持续性; 6、持续跟踪硬件相关领域的技术发展趋势,结合对阿里业务应用场景的深入分析,并推动相关技术的产品化实现。
1. 负责面向高持久性、高可用、高性能的云上块存储服务 EBS 的先进支撑底座系统的设计与开发,支撑千万级云盘实例、日均百万亿级别 I/O 请求的分布式存储系统,持续增强其可观测性、可诊断性与可运维性; 2. 构建面向高性能分布式存储的智能可观测体系,在传统监控与诊断基础上融合 AI 异常检测与诊断能力,实现故障的早期预警与精准定界; 3. 建设故障快速恢复与预防体系,通过平台工程策略与 AI 智能决策,实现故障的分钟级恢复乃至主动预防,持续降低系统 MTTR; 4. 设计覆盖全链路的稳定性技术体系,制定面向高持久性、高可用、高性能复杂场景的稳定性保障策略与标准; 5. 长期追踪工业界与学术界前沿技术(如面向时序数据的基础大模型、先进混沌工程实践等),主导技术预研与规模化落地,驱动团队技术持续演进。
1. 负责阿里云全球IDC机房基础设施运维技术管理,制定并持续优化IDC基础设施运维标准、流程、质量分析模型,提升运维专业化水平,实现对IDC稳定性管理的技术、管理覆盖。 2. 负责阿里云全球IDC运维自控专业线能力建立,协助一线运维团队建立自控专业梯队。 3. 阿里云全球IDC稳定性事件应急响应,支撑一线运维进行自控系统应急故障处理。 4. 主导阿里云全球IDC运维稳定性飞检,识别自控系统架构风险,协助一线运维团队推动风险闭环。 5. 进行IDC自控及数字化技术探索,建立自控专业运维的数字化、自动化、AIOps能力。 6. 整合运维技术优化需求,对接研发、设计等团队完成需求落地;参与IDC自控新技术、新架构升级的评估,输出运维视角的评估建议。
1、日常运维 • 负责数据中心基础设施日常运维及管理工作,制定数据中心基础设施运维策略与运维计划,保障设施稳定性,均衡考虑运维质量、效率、成本及安全。 • 通过基础设施数字化运维管理,提高机房管控能力和兜底能力,保障维修及时率、风险闭环率等各项指标达标。 2、安全合规 • 落实数据中心内所有岗位的安全生产要求,推动数据中心在环保、消防、职业健康、法务、廉正等方面的合规运营,防止出现人员/设备的重大责任事故、行政处罚/责令整改等被动监管事件。 • 识别安全合规风险,建立并完善风险管理机制,负责重大事件的上报和跟踪处理。 • 建立属地资源网络管理,推动与属地政府关系的全方位深化,为属地稳定安全合规运营提供坚实保障。 3、优化改进 • 负责所辖数据中心的基础设施运维工作优化,制定/梳理阿里IDC运维管理制度、操作手册、应急管理流程和应急操作预案。 • 负责阿里IDC能效优化工作,实现机房高效运行。 4、技术支撑 • 负责数据中心运维侧技术管理,能带领团队通过技术管理为数据中心设计、设备选型等技术迭代提供技术支撑。 5、团队管理 • 负责数据中心运维团队的日常管理、考核、人才梯队建设、能力培养,规划数据中心运维人员技术培训工作,提升运维团队服务水平。 • 建立与运营商、上级主管等部门间顺畅的沟通渠道,防止出现数据中心运营风险,确保阿里运营策略要求合规落地。