logo of alibaba

阿里巴巴基础设施与稳定性工程-产品专家-Agent Infra 产品经理

社招全职3年以上产品类-平台型地点:杭州状态:招聘

任职要求


基本要求:
1.本科及以上学历,计算机科学、软件工程、人工智能、自然语言处理或相关专业背景。
2.3年以上产品经理经验,具备以下至少一项领域经验:
    1)研发协作/信息处理/数据治理类产品
    2)开发者工具/研发效能平台/AI辅助编程类产品
    3)可观测/运维监控/中间件/基础设施类产品
3.理解软件开发生命周期,理解TDD、CI/CD、DevOps、GitOps、SDD等工程实践。
4.熟悉AINatvie的开发模式,了解AlAgent及主流框架,了解大模型在软件工程的能力边界及主流工具。
5.具备良好的数据分析能力,能通过数据发现痛点、验证假设、驱动决策。

产品思维要求:
1.具备“识别问题→定义产品→迭代交付”的完整产品思维闭环
2.具备领域抽象与结构化思维能力,能将模糊的技术趋势…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


围绕软件工程过程,建设「让所有AlAgent产品可靠运行」的基础设施产品,定义Agent基础设施产品的全生命周期,设计让Agent“快、稳、准"的
底层产品体系,支撑数十万开发者在Al-Native时代的软件工程实践。
1.负责AgentInfra的产品规划,围绕产品分析、软件交付、可测试性、技术风险控制、协作效率、研发资产管理等定义关键产品能力。
2.以VibeCoding的方式利用AI工具,一体化传统PD、交互、前端角色,快速迭代验证产品思考并转化为产品力。
3.结合Al发展趋势,持续追踪先进的Agent产品及HarnessEngineering等工程实践演进,确保产品技术路线的先进性。
4.保持平台的开放性,服务于多样化的业务场景与Agent军团业态,放大作用域。
5.建立有效的产品跟踪体系,持续验证并优化产品对技术产能的实际贡献,形成完整的价值闭环。
包括英文材料
学历+
NLP+
数据治理+
DevOps+
中间件+
还有更多 •••
相关职位

logo of aligenie
社招3年以上产品类-平台型

围绕软件工程过程,建设「让所有AlAgent产品可靠运行」的基础设施产品,定义Agent基础设施产品的全生命周期,设计让Agent“快、稳、准"的 底层产品体系,支撑数十万开发者在Al-Native时代的软件工程实践。 1.负责AgentInfra的产品规划,围绕产品分析、软件交付、可测试性、技术风险控制、协作效率、研发资产管理等定义关键产品能力。 2.以VibeCoding的方式利用AI工具,一体化传统PD、交互、前端角色,快速迭代验证产品思考并转化为产品力。 3.结合Al发展趋势,持续追踪先进的Agent产品及HarnessEngineering等工程实践演进,确保产品技术路线的先进性。 4.保持平台的开放性,服务于多样化的业务场景与Agent军团业态,放大作用域。 5.建立有效的产品跟踪体系,持续验证并优化产品对技术产能的实际贡献,形成完整的价值闭环。

更新于 2026-04-03杭州
logo of alibaba
社招3年以上技术类-开发

构建面向大规模AI集群的GPU微架构采集、性能剖析与优化决策系统,建设集群的性能分析、瓶颈定位、故障诊断等核心能力。 1. 针对NVIDIA、AMD、国产GPGPU等多厂商芯片,设计并实现规模化、无侵入的kernel级采集工具链和微架构指标体系; 2. 构建AI continuous profiling系统,将GPU kernel数据与算子执行、框架调度、通信原语、CPU性能、高性能通信性能相关联,为全栈性能优化提供量化的性能瓶颈数据和画像系统; 3. 结合理论 Roofline 分析与 simulation 方法,融合线上 profiling 数据,建设集群范围的软硬件配合与关键性能瓶颈分析体系,支撑AI训练与推理典型负载下的系统级优化; 4. 跟踪主流GPU架构演进,参与AI基础设施规划与设计,结合生产应用画像,支撑多元GPU/AI ASIC芯片的适配与优化,构建异构硬件性能的全链路量化分析模型,面向scale-up等未来AI硬件架构演进,建立硬件性能建模与TCO评估能力,形成数据驱动的决策支撑。

更新于 2026-06-16杭州
logo of alibaba
社招3年以上技术-基础平台

负责集团多种大模型的基础训推性能优化,聚焦异构GPU的高性能算子库、通信库的开发和优化,提升计算、通信的并行效率,设计并实现高效的并行计算策略、分布式推理方案等。面向集团多变的大模型训推场景,提炼核心的优化方法,探索通用的编译优化方案,跟进前沿技术,并将优化能力集成到自研/开源大模型推理/训练框架/编译器,推动优化方案在实际业务场景中的落地,持续创新构建业界领先的AI Infra。

更新于 2026-08-04北京|杭州
logo of alibaba
社招3年以上技术类-开发

我们关注并负责建设高效、稳定的AI基础设施,为超大规模的分布式训练/推理提供低延迟、高吞吐以及高性价比的I/O链路优化及分布式存储方案。 1. 集团十万卡级别的混合云AI基础设施内的I/O链路优化,支撑大模型、搜推广等训练推理场景的海量小文件及超大吞吐读写等I/O需求; 2. 紧密结合集团基础设施,探索存算分离、存算一网等网络架构下优异的存储架构,以及跨DC的存储同步与全球数据编排; 3. 探索面向transformer模型架构(LLM\多模态等)的kv-cache大容量、超低延迟的存储与缓存设计,通过RDMA、多级缓存等技术,与计算引擎联合CoDesign,探索下一代“以存代算”和“以存强算”的I/O模式;

更新于 2026-06-25北京|杭州