阿里巴巴基础设施与稳定性工程-SRE-AI算力资源池GPU方向
任职要求
1.计算机科学、软件工程或相关领域本科及以上学历,硕士优先。具备5年以上的云服务或站点稳定性工作经验,有AI Infra经验者优先; 2.熟悉AI基础设施架构、服务器硬件(如CPU/GPU芯片微架构)、网络协议(TCP/IP、RDMA、InfiniBand),对公共云服务平台(如 阿里云、AWS、Azure等)有深入理解和实战经验; 3.熟练掌握Kubernetes及云原生架构及技术原理,有大规模生产集群的部署、调优及故障解决经验; 4.对于AIGC或LLM有了解和实际开发经验者优先;有开源生态建设相关经验者优先; 5.熟悉至少一种编程语言(如…
工作职责
我们是专注于大模型服务平台的技术团队,我们的核心业务是提供高效稳定的大模型推理服务API,帮助各行各业轻松利用大模型的强大能力,正在寻找一位有实力的Site Reliability Engineer (SRE) 加入我们,共同打造更可到的大模型服务平台。 负责AI基础设施算力资源的规划、运营管理与精细化数据体系建设。通过系统化、数据化方法提升GPU资源利用率、周转率与成本效益,保障AI训练/推理任务的高效稳定运行,支撑业务快速发展。 【工作职责】 1.大模型服务和平台的稳定性保障与体系建设:负责大模型相关核心业务系统和模型服务的稳定性建设工作,提升业务可用性与可靠性; 2.高并发流量治理:高并发场景下的流量治理方案设计与实施,包括熔断、限流、降级等容灾策略,确保业务弹性与鲁棒性; 3.GPU算力资源规划与运营管理:包含不限于优化GPU资源配置模型,平衡计算性能与成本,推动资源采购决策与部署策略落地,优化GPU资源配置模型,平衡计算性能与成本,推动资源采购决策与部署策略落地; 4.运维流程优化和自动化:推动运维自动化与平台化建设,提升研发效率; 5.架构高可用建设:业务系统稳定性架构方案的设计与实施,推动高可用架构落地,规避系统性风险; 6.应急响应:响应系统故障,快速诊断并恢复服务,分析原因并提出预防性改进措施;
核心职责 1、稳定性架构设计与治理 ● 主导集团级稳定性保障体系的顶层设计与演进,覆盖从代码变更、配置发布、弹性调度到基础设施的端到端生命周期,建立可度量、可治理的稳定性基线。 ● 构建并推行集团统一的容灾架构标准与治理框架,确保架构方案在设计、实施、验证与日常运营中闭环落地。 2、核心领域技术深耕 ● 容灾与高可用体系: 主导从同城双活、异地多活到单元化架构的演进,构建以混沌工程为代表的常态化、自动化演练验证平台,确保容灾方案的真实有效性。 ● 基础设施稳定性: 深入数据中心与网络基础设施,建立全链路的可观测性与快速恢复能力,能够精准诊断并根治网络拓扑、路由协议、专线质量等引发的全局性问题。 ● 资源与容量运营: 深入理解计算、存储、网络等资源的成本-效率-稳定性三角模型,设计并推动精细化的资源调度、容量规划与成本优化方案,实现极致的资源效率。 3、组织与文化影响力 ● 推动稳定性文化的落地,构建科学的度量指标体系(如MTTR、变更成功率、故障根因分布等),并推动指标体系回归工程本质,避免其成为组织绩效博弈的工具。
构建面向大规模AI集群的GPU微架构采集、性能剖析与优化决策系统,建设集群的性能分析、瓶颈定位、故障诊断等核心能力。 1. 针对NVIDIA、AMD、国产GPGPU等多厂商芯片,设计并实现规模化、无侵入的kernel级采集工具链和微架构指标体系; 2. 构建AI continuous profiling系统,将GPU kernel数据与算子执行、框架调度、通信原语、CPU性能、高性能通信性能相关联,为全栈性能优化提供量化的性能瓶颈数据和画像系统; 3. 结合理论 Roofline 分析与 simulation 方法,融合线上 profiling 数据,建设集群范围的软硬件配合与关键性能瓶颈分析体系,支撑AI训练与推理典型负载下的系统级优化; 4. 跟踪主流GPU架构演进,参与AI基础设施规划与设计,结合生产应用画像,支撑多元GPU/AI ASIC芯片的适配与优化,构建异构硬件性能的全链路量化分析模型,面向scale-up等未来AI硬件架构演进,建立硬件性能建模与TCO评估能力,形成数据驱动的决策支撑。
负责集团多种大模型的基础训推性能优化,聚焦异构GPU的高性能算子库、通信库的开发和优化,提升计算、通信的并行效率,设计并实现高效的并行计算策略、分布式推理方案等。面向集团多变的大模型训推场景,提炼核心的优化方法,探索通用的编译优化方案,跟进前沿技术,并将优化能力集成到自研/开源大模型推理/训练框架/编译器,推动优化方案在实际业务场景中的落地,持续创新构建业界领先的AI Infra。
我们关注并负责建设高效、稳定的AI基础设施,为超大规模的分布式训练/推理提供低延迟、高吞吐以及高性价比的I/O链路优化及分布式存储方案。 1. 集团十万卡级别的混合云AI基础设施内的I/O链路优化,支撑大模型、搜推广等训练推理场景的海量小文件及超大吞吐读写等I/O需求; 2. 紧密结合集团基础设施,探索存算分离、存算一网等网络架构下优异的存储架构,以及跨DC的存储同步与全球数据编排; 3. 探索面向transformer模型架构(LLM\多模态等)的kv-cache大容量、超低延迟的存储与缓存设计,通过RDMA、多级缓存等技术,与计算引擎联合CoDesign,探索下一代“以存代算”和“以存强算”的I/O模式;