阿里巴巴基础设施与稳定性工程-AI算力资源运营-杭州
任职要求
• 技术基础:本科及以上学历,计算机相关专业,或具备软件开发、系统运维、资源运营等技术岗位工作经验,能理解技术架构和基本的系统性能指标。 • AI算力领域经验:有AI行业解决方案、GPU/算力资源管理、推理服务运营、技术支持等相关工作经验。了解大模型(MaaS)业务模式和推理算力基本特性(如Token计费、并发控制等),具备算力成本和容量的估算意识。…
工作职责
• 需求对接与方案交付:作为集团AI业务算力需求的核心对接人,深入理解业务场景,将模型部署需求转化为算力规格(TPM、MU等)和SLO性能指标,输出可落地的需求应答和交付方案。协调应用团队、推理引擎团队与SRE团队,组织方案评审、跟进交付进度,确保服务保质保量上线。 • 资源效能分析与治理:建立AI算力资源的效能监控体系,围绕GPU利用率等核心指标进行数据分析,识别资源浪费和瓶颈场景,推动治理方案落地执行。跟踪核心业务推理性能表现,发现偏差时协同引擎团队调优,保障业务侧感知的推理速度与稳定性。 • 服务流程与标准化建设:建立并持续优化集团内部算力服务流程,沉淀标准化的需求受理、方案评审、交付验收规范。结合服务过程中的共性问题,利用AI Agent或自动化工具提升服务效率,沉淀最佳实践。
我们是专注于大模型服务平台的技术团队,我们的核心业务是提供高效稳定的大模型推理服务API,帮助各行各业轻松利用大模型的强大能力,正在寻找一位有实力的Site Reliability Engineer (SRE) 加入我们,共同打造更可到的大模型服务平台。 负责AI基础设施算力资源的规划、运营管理与精细化数据体系建设。通过系统化、数据化方法提升GPU资源利用率、周转率与成本效益,保障AI训练/推理任务的高效稳定运行,支撑业务快速发展。 【工作职责】 1.大模型服务和平台的稳定性保障与体系建设:负责大模型相关核心业务系统和模型服务的稳定性建设工作,提升业务可用性与可靠性; 2.高并发流量治理:高并发场景下的流量治理方案设计与实施,包括熔断、限流、降级等容灾策略,确保业务弹性与鲁棒性; 3.GPU算力资源规划与运营管理:包含不限于优化GPU资源配置模型,平衡计算性能与成本,推动资源采购决策与部署策略落地,优化GPU资源配置模型,平衡计算性能与成本,推动资源采购决策与部署策略落地; 4.运维流程优化和自动化:推动运维自动化与平台化建设,提升研发效率; 5.架构高可用建设:业务系统稳定性架构方案的设计与实施,推动高可用架构落地,规避系统性风险; 6.应急响应:响应系统故障,快速诊断并恢复服务,分析原因并提出预防性改进措施;
团队介绍 加入AI算力数据与Agent小组,这是直接决定集团AI算力如何被"看见、管好、用好"的核心团队。从每一张GPU卡的产能效率到TPM容量规划、资源交付、供需匹配,实现从资源到售卖的全链路数据打通,并通过数据与Agent驱动的智能洞察支撑MaaS业务增长和管理层经营决策。 方向一:AI算力数据链路建设(数据工程背景) • 建设训练/推理(百炼、通义)两侧TPM与资源数据的采集、治理、建模和指标体系 • 设计标准化数仓,打通资源分配、交付、使用全链路数据口径 • 为MaaS经规管理、财务成本分析、BI、销控系统提供可信数据支撑 • 推动数据Agentic化,让Agent可自动查询、分析和推理算力数据 方向二:算力智能洞察与优化模型(算法工程背景) • 建立TPM容量规划模型与算力画像,支撑供需匹配和弹性交付智能决策 • 构建GPU/CPU/TPM利用率优化算法,实现全局卡型×模型最优匹配 • 开发智能流量管控与限流策略,保障运行时SLA(TTFT、TPOT、错误率) • 结合Agent实现算力优化决策自动化执行闭环
构建面向大规模AI集群的GPU微架构采集、性能剖析与优化决策系统,建设集群的性能分析、瓶颈定位、故障诊断等核心能力。 1. 针对NVIDIA、AMD、国产GPGPU等多厂商芯片,设计并实现规模化、无侵入的kernel级采集工具链和微架构指标体系; 2. 构建AI continuous profiling系统,将GPU kernel数据与算子执行、框架调度、通信原语、CPU性能、高性能通信性能相关联,为全栈性能优化提供量化的性能瓶颈数据和画像系统; 3. 结合理论 Roofline 分析与 simulation 方法,融合线上 profiling 数据,建设集群范围的软硬件配合与关键性能瓶颈分析体系,支撑AI训练与推理典型负载下的系统级优化; 4. 跟踪主流GPU架构演进,参与AI基础设施规划与设计,结合生产应用画像,支撑多元GPU/AI ASIC芯片的适配与优化,构建异构硬件性能的全链路量化分析模型,面向scale-up等未来AI硬件架构演进,建立硬件性能建模与TCO评估能力,形成数据驱动的决策支撑。