logo of aliyun

阿里云阿里云智能-AI智算解决方案架构师-海外业务

社招全职3年以上云智能集团地点:北京 | 杭州状态:招聘

任职要求


1、3年以上工作经历,具备AI、高性能计算或云计算基础设施相关经验,对大模型训练/推理的底层技术栈有深刻理解。
2、精通主流云平台的IaaSPaaS层服务,特别是计算、网络和存储。 具备云原生应用的设计和部署经验,能够设计和实现基于云的高可用性和高扩展性的AI智算集群解决方案。
3、精通分布式计算架构(如Hadoop、Docker、Kubernetes、Serverless等容器和云原生技术),深入了解GPU/TPU/DPU计算和高性能网络原理(RoCE和IB),具有实际优化集群计算及网络资源的经验。
4…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


1、深入理解阿里云AI智算集群的技术原理、架构和使用场景,根据客户需求,设计并实施高性能、可扩展的AI基础设施解决方案,核心聚焦于大模型的训练与推理场景,促进商业化合作达成。 
2、具备良好的架构思维,能够从稳定性、高性能、易用性、可用性、可运维性等方面综合考虑,基于阿里云IaaS和PaaS的全栈AI基础设施,确保从算力、网络、存储的极致优化,持续为客户提供高质量AI基础设施服务。
3、面向国际市场,总结分析AI智算发展趋势/市场竟争格局,主动挖掘行业数据和客户商机,建立可复制的行业解决方案,与产研团队紧密配合,推动产品能力和营收持续增长。
4、具备需求拆解和整合的能力,成为对内外部AI智算技术的传播者,能够将复杂的AI基础设施技术转化为清晰的商业价值,成为客户和内部团队信赖的技术顾问。
5、作为领域专家参与客户Workshop、市场洞察等活动,并在行业峰会、技术沙龙等市场活动中进行阿里云AI智算技术传播和分享。
包括英文材料
大模型+
IaaS+
PaaS+
还有更多 •••
相关职位

logo of aliyun
社招5年以上云智能集团

1、深入理解客户业务需求,帮助客户选择适合其业务场景的技术路径和产品组合,利用AI技术知识、架构方法、咨询技能来影响客户技术决策 2、与客户合作进行模型训练、推理和模型应用等POC,含展示功能、调整模型、优化模型性能、测试分析、Agent搭建、模型调用等内容 3、依据客户需求和技术研判,推动产研部门持续优化产品,助力提升产品竞争力,同时沉淀最佳实践,以及脚本、模板、参考架构等可复用的技术资产 4、持续跟踪行业动态和技术趋势,并与产品团队协作,打造创新的人工智能(大模型、智算、一体机等)解决方案 5、支持市场活动,作为领域专家参与市场洞察、行业标准、市场排名报告、白皮书撰写等活动,并在行业峰会、技术沙龙等市场活动中进行技术传播和分享

更新于 2025-10-11北京|杭州|上海
logo of aliyun
社招3年以上云智能集团

需求分析与场景识别 了解一个或多个领域的业务知识,能够跟客户有效沟通和洞察真实需求,并识别出可以使用人工智能技术的场景 技术判断与解决方案 理解机器学习、深度学习、大模型的基本原理, 能够基于客户的需求,基于云+AI的产品设计出适合的解决方案,具备智能体开发demo的能力, 并可以向客户的业务/技术决策人阐述阿里云产品和解决方案的优势,以影响客户的技术选型决策 产品需求反馈与优化 依据市场/客户需求、技术动态,结合技术研判向产研部门反馈大模型应用解决方案及Agent工具等的优化建议,推动技术创新和解决方案的迭代升级,提升产品市场竞争力和市场占有率 市场敏感与扩展复制 挖掘可复制、可规模化、符合市场逻辑的大模型解决方案,通过客户案例的落地对成功实践进行总结归纳完成从0到1;并对内部团队及客户进行知识和项目分享,促进从1到N的复制

更新于 2025-10-28北京
logo of aliyun
社招5年以上云智能集团

1. 建设灵骏集群监管控系统核心能力,不断提升客户在云上使用灵骏智算集群产品的自动化、智能化程度。 2. 建设满足业务场景和数据合规要求的智算集群库存管理体系,结合节点调度、性能分析、故障自动化处理、租户运维功能等核心体系能力,持续提升灵骏智算集群产品竞争力。 3. 建设智算集群和管控系统自身高可用体系,如智算集群健康检测、节点与集群异常快速处置体系、管控组件故障自动定位、自动恢复、自适应容灾、云原生技术实施及落地等,保障业务持续可用、保障线上系统稳定性。 4. 建设异构算力统一管理及资源调度系统,持续智算集群资源利用率、降低计算成本。 5. 持续跟踪AI智算、云原生及智能运维领域新技术,结合业务场景进行创新。 6. 该职位涉及值班响应的职责,在服务级别协议(SLA)时间内做出对客响应,推动客户问题的解决,改善客户体验。

更新于 2025-11-26北京|杭州
logo of aliyun
社招5年以上云智能集团

1. 建设灵骏集群监管控系统核心能力,不断提升客户在云上使用灵骏智算集群产品的自动化、智能化程度。 2. 建设满足业务场景和数据合规要求的智算集群库存管理体系,结合节点调度、性能分析、故障自动化处理、租户运维功能等核心体系能力,持续提升灵骏智算集群产品竞争力。 3. 建设智算集群和管控系统自身高可用体系,如智算集群健康检测、节点与集群异常快速处置体系、管控组件故障自动定位、自动恢复、自适应容灾、云原生技术实施及落地等,保障业务持续可用、保障线上系统稳定性。 4. 建设异构算力统一管理及资源调度系统,持续智算集群资源利用率、降低计算成本。 5. 持续跟踪AI智算、云原生及智能运维领域新技术,结合业务场景进行创新。 6. 该职位涉及值班响应的职责,在服务级别协议(SLA)时间内做出对客响应,推动客户问题的解决,改善客户体验。

更新于 2025-11-27北京|杭州