logo of alibaba

阿里巴巴基础设施与稳定性工程-Dev Infra 数据架构师-研发基础设施

社招全职5年以上地点:杭州状态:招聘

任职要求


1. 本科及以上学历,5 年以上研发基础设施、数据平台或复杂分布式系统经验,具备大型系统架构设计与落地能力。
2. 具备团队管理经验,能够进行技术规划、目标拆解、项目管理和人才培养,带领团队持续交付复杂项目。
3. 深入理解 DevOps 体系,熟悉代码、构建、CI/CD、环境、发布、可观测及故障治理等研发运维基础设施。
4. 精通 …
登录查看完整任职要求
微信扫码,1秒登录

工作职责


1. 负责 Dev Infra 整体架构与数据体系建设,打通需求、研发、测试、交付、运维及 Agent 运行的完整链路。
2. 深入研发基础设施架构,推动代码托管、构建、CI/CD、环境、发布、可观测和故障治理等 DevOps 体系演进。
3. 负责团队建设与管理,制定技术规划和业务目标,完成任务拆解、资源协调、交付管理及核心人才培养。
4. 建设研发运维数据体系,统一需求、代码、变更、测试、发布、监控和故障等领域的数据模型、标准与接口。
5. 设计 Agent 运行与信号体系,覆盖 Session、Task、Tool、Context、Environment、HITL、运行轨迹、反馈和 Reward。
6. 协同研发平台、业务 Agent 和模型团队,建设从数据采集、加工治理到训练、评测和反馈优化的完整闭环。
包括英文材料
学历+
分布式系统+
系统设计+
DevOps+
CI+
CD+
还有更多 •••
相关职位

logo of alibaba
社招3年以上技术类-开发

构建面向大规模AI集群的GPU微架构采集、性能剖析与优化决策系统,建设集群的性能分析、瓶颈定位、故障诊断等核心能力。 1. 针对NVIDIA、AMD、国产GPGPU等多厂商芯片,设计并实现规模化、无侵入的kernel级采集工具链和微架构指标体系; 2. 构建AI continuous profiling系统,将GPU kernel数据与算子执行、框架调度、通信原语、CPU性能、高性能通信性能相关联,为全栈性能优化提供量化的性能瓶颈数据和画像系统; 3. 结合理论 Roofline 分析与 simulation 方法,融合线上 profiling 数据,建设集群范围的软硬件配合与关键性能瓶颈分析体系,支撑AI训练与推理典型负载下的系统级优化; 4. 跟踪主流GPU架构演进,参与AI基础设施规划与设计,结合生产应用画像,支撑多元GPU/AI ASIC芯片的适配与优化,构建异构硬件性能的全链路量化分析模型,面向scale-up等未来AI硬件架构演进,建立硬件性能建模与TCO评估能力,形成数据驱动的决策支撑。

更新于 2026-06-16杭州
logo of alibaba
社招3年以上技术-基础平台

负责集团多种大模型的基础训推性能优化,聚焦异构GPU的高性能算子库、通信库的开发和优化,提升计算、通信的并行效率,设计并实现高效的并行计算策略、分布式推理方案等。面向集团多变的大模型训推场景,提炼核心的优化方法,探索通用的编译优化方案,跟进前沿技术,并将优化能力集成到自研/开源大模型推理/训练框架/编译器,推动优化方案在实际业务场景中的落地,持续创新构建业界领先的AI Infra。

更新于 2026-08-04北京|杭州
logo of alibaba
社招3年以上技术类-开发

我们关注并负责建设高效、稳定的AI基础设施,为超大规模的分布式训练/推理提供低延迟、高吞吐以及高性价比的I/O链路优化及分布式存储方案。 1. 集团十万卡级别的混合云AI基础设施内的I/O链路优化,支撑大模型、搜推广等训练推理场景的海量小文件及超大吞吐读写等I/O需求; 2. 紧密结合集团基础设施,探索存算分离、存算一网等网络架构下优异的存储架构,以及跨DC的存储同步与全球数据编排; 3. 探索面向transformer模型架构(LLM\多模态等)的kv-cache大容量、超低延迟的存储与缓存设计,通过RDMA、多级缓存等技术,与计算引擎联合CoDesign,探索下一代“以存代算”和“以存强算”的I/O模式;

更新于 2026-06-25北京|杭州
logo of alibaba
社招3年以上技术类-数据

团队介绍 加入AI算力数据与Agent小组,这是直接决定集团AI算力如何被"看见、管好、用好"的核心团队。从每一张GPU卡的产能效率到TPM容量规划、资源交付、供需匹配,实现从资源到售卖的全链路数据打通,并通过数据与Agent驱动的智能洞察支撑MaaS业务增长和管理层经营决策。 方向一:AI算力数据链路建设(数据工程背景) • 建设训练/推理(百炼、通义)两侧TPM与资源数据的采集、治理、建模和指标体系 • 设计标准化数仓,打通资源分配、交付、使用全链路数据口径 • 为MaaS经规管理、财务成本分析、BI、销控系统提供可信数据支撑 • 推动数据Agentic化,让Agent可自动查询、分析和推理算力数据 方向二:算力智能洞察与优化模型(算法工程背景) • 建立TPM容量规划模型与算力画像,支撑供需匹配和弹性交付智能决策 • 构建GPU/CPU/TPM利用率优化算法,实现全局卡型×模型最优匹配 • 开发智能流量管控与限流策略,保障运行时SLA(TTFT、TPOT、错误率) • 结合Agent实现算力优化决策自动化执行闭环

更新于 2026-07-30杭州