阿里云阿里云智能-AI基础设施解决方案架构师-杭州
任职要求
1、计算机或通信相关专业本科毕业,有ICT行业的售前或售后三年以上经验。有云基础设施相关从业经验优先,有大型数据中心(大于五千台服务器规模)项目经验者优先。 2、熟悉基础设施相关基础知识,包括网络、IDC、服务器等,同时有网络加IDC技术专长者优先。…
工作职责
1.负责云计算领域新业务形态的基础设施解决方案,引导业务获得低成本、高效率、高质量的技术资源。 2.负责 AI 基础设施解决方案的制定并推动交付落地,包括网络、服务器、IDC等专业维度的集成交付。 3.负责新业务导入的机制设计与标准制定,结合业务演进趋势优化交付流程体系。 4.负责协同业务、技术与资源的平衡发展与演进,确保解决方案的准确性、经济性和可持续性。
AI升级战略的核心架构设计者与变革推动者,肩负两大战略目标:实现研发效能的指数级(10X)跃迁,以及驱动十万级存量应用向 AI 原生架构的演进。您的工作将直接影响公司数万名开发者的工作方式和效率。 I. 核心职责领域 1. AI 解决方案架构设计与治理 (Strategic Output) 设计可复用 AI 应用架构,确保架构具备高安全性、高性能、高可观测性和良好的成本控制。 制定 AI 研发接入规范,涵盖从开发到部署的端到端标准。 输出标准化架构图、数据流图、部署模型等技术资产。 2. 研发效能 AI 化攻坚与指标驱动 (10X Efficiency Focus) 主导研发场景(前端、后端、测试)的AI提效项目落地,串联上下游流程,形成最佳实践。 优化关键体验指标:重点攻克 Prompt 工程、上下文管理、响应延迟等LLM应用的核心挑战。 构建提效评估体系,通过关键指标(如 AI ROI)验证和驱动解决方案的业务价值。 3. 规模化演进与工程化落地 (Scaling and Governance) 设计 AI 应用在过渡期和终态的协作形态,制定大规模应用向 AI 原生架构的演进策略。 将成功的 AI 模式封装为 SDK / CLI / IDE 插件等工具,降低业务团队接入门槛。 与产品生态深度合作,规模化推进集团研发过程的全面变革。 4. 技术布道与方法论输出 (Enablement and Knowledge) 编写《AI 解决方案架构指南》《典型场景白皮书》等体系化方法论。 输出实施手册、Checklist、FAQ 等可复制资产,赋能业务团队。 组织**“最佳实践分享会”**,建设 AI 最佳实践工程对接平台,支持业务团队完成架构评估与改造。
1、AI云原生解决方案设计: 1)结合客户AI工作流(如大模型训练/推理、自动驾驶仿真、视频分析等),设计基于IaaS的云原生架构方案,优化模型训练/推理的性能、成本与可靠性; 2)主导AI专用加速方案(如混合精度训练、模型量化、分布式推理)的架构选型与落地,推动框架层与基础设施层的协同优化; 2、客户需求分析与价值传递: 1)深入调研客户AI应用场景,提炼核心痛点(如训练周期长、推理延迟高、资源成本高等),输出技术可行性报告; 2)通过技术白皮书、架构设计图、POC验证等方式,向客户展示IaaS平台在AI场景下的性能优势(如训练速度提升、推理成本降低等); 3、跨团队协作与生态整合: 1)与研发团队协同定义技术实现路径,推动算子优化、框架适配等需求落地; 2)联合产品经理规划解决方案路标,确保技术方案与商业策略对齐; 3)整合ISV、AI框架社区资源,构建AI云原生解决方案生态; 4、行业趋势与市场分析: 1)跟踪AI云原生技术发展(如Kubernetes原生AI、推理加速),输出行业洞察报告; 2)对标市场AI云服务,制定差异化竞争策略。
MiMo 大模型团队正在寻找熟悉 sandbox、容器化和云原生基础设施的研发工程师,一起建设面向大规模强化学习训练的基础设施能力。 随着大模型 Agent 和代码能力训练进入大规模 RL 阶段,我们需要构建稳定、安全、可扩展的任务执行环境。你将参与设计和实现 sandbox 执行系统、容器调度平台、训练任务环境、隔离与资源管理机制,为大规模 Agent 任务、代码执行任务和 RL 训练提供底层 infra 支撑。 工作职责 1. 设计和建设面向 RL 训练的 sandbox 执行环境,支持代码运行、工具调用、浏览器自动化、文件系统操作、网络访问控制等能力。 2. 基于 Docker、Kubernetes 等技术,构建可大规模调度的容器化任务运行平台,支持高并发、多租户、可观测、可恢复的训练任务执行。 3. 参与大规模 RL 训练 infra 的 scaling,包括任务分发、资源调度、环境复用、状态隔离、失败恢复、日志采集和性能优化。 4. 建设安全隔离机制,降低模型生成代码、Agent 工具调用和自动化执行带来的安全风险,包括权限控制、系统调用限制、网络隔离、资源限额等。 5. 与模型训练、Agent 框架、数据和评测团队合作,将训练任务需求转化为稳定可用的执行环境和平台能力。 6. 分析大规模训练过程中的系统瓶颈和故障问题,持续优化调度效率、资源利用率、任务吞吐和环境稳定性。 7. 参与内部平台工具建设,包括任务管理、运行监控、日志查询、环境调试、指标看板和自动化运维能力。

1、整合 GPU/CPU 算力、存储(如 CPFS)、网络(如 RDMA/InfiniBand)、供应链流转等多维度数据,构建资源使用率、成本结构与供需分析模型,输出可落地的优化建议; 2、整合资源效能和业务性能指标(如MFU、TPM、TPOT、GPU 利用率等),建立资源效能评估模型,量化资源投入与业务产出之间的关系,为资源规划与采购决策提供数据支撑; 3、负责 AI Infra 资源数仓的数据链路设计与建设,覆盖数据采集、清洗、加工、存储与服务全流程,保障资源数据的准确性、一致性与时效性; 4、构建并维护资源数据可视化平台,开发资源热力图、利用率趋势、成本分摊仪表盘等,支撑日常运营与管理层决策; 5、与资源运营、财务、研发等团队紧密协作,搭建资源生命周期关键指标看板,定期输出资源效能分析报告,支撑资源采购与部署策略落地。