阿里云阿里云智能-AI基础设施解决方案架构师-智算解决方案
任职要求
职位要求: 1、本科以上学历,有人工智能、计算机、大数据、电子信息等相关专业背景。 2、5年以上云计算、AI基础设施或高性能计算相关领域的解决方案规划、设计、交付等工作经验,能够持续学习并善于提出问题和解决思路。 3、拥有LLM、VLM、开源机器学习和深度学习框架、数值编程框架(例如 Pandas、MATLAB)的经验,有一定的代码能力。 4、良好的方案产出和沟通宣讲能力,能够很好完成面向客户中高层的方案汇报,及重大市场活动中的方案/技术分享。 5、有AI基础设施的核心组件,包括算力平台、容器…
工作职责
1、深入理解客户业务需求,帮助客户选择适合其业务场景的技术路径和产品组合,利用AI技术知识、架构方法、咨询技能来影响客户技术决策。 2、与客户合作进行模型选择、训练、推理和模型应用等PoC,验证软硬件产品的性能、兼容性、稳定性、安全性等方面。 3、依据客户需求和技术研判,推动产研部门持续优化和提升产品竞争力,同时沉淀最佳实践,以及脚本、模板、参考架构等可复用的技术资产。 4、持续跟踪行业动态和技术趋势,并与产品团队协作,打造创新的人工智能(大模型、服务器、超节点、智算平台、大模型应用平台等)解决方案。 5、支持市场活动,作为领域专家参与市场洞察、行业标准、市场排名报告、白皮书撰写等活动,并在行业峰会、技术沙龙等市场活动中进行技术传播和分享。
1.负责云计算领域新业务形态的基础设施解决方案,引导业务获得低成本、高效率、高质量的技术资源。 2.负责 AI 基础设施解决方案的制定并推动交付落地,包括网络、服务器、IDC等专业维度的集成交付。 3.负责新业务导入的机制设计与标准制定,结合业务演进趋势优化交付流程体系。 4.负责协同业务、技术与资源的平衡发展与演进,确保解决方案的准确性、经济性和可持续性。
AI升级战略的核心架构设计者与变革推动者,肩负两大战略目标:实现研发效能的指数级(10X)跃迁,以及驱动十万级存量应用向 AI 原生架构的演进。您的工作将直接影响公司数万名开发者的工作方式和效率。 I. 核心职责领域 1. AI 解决方案架构设计与治理 (Strategic Output) 设计可复用 AI 应用架构,确保架构具备高安全性、高性能、高可观测性和良好的成本控制。 制定 AI 研发接入规范,涵盖从开发到部署的端到端标准。 输出标准化架构图、数据流图、部署模型等技术资产。 2. 研发效能 AI 化攻坚与指标驱动 (10X Efficiency Focus) 主导研发场景(前端、后端、测试)的AI提效项目落地,串联上下游流程,形成最佳实践。 优化关键体验指标:重点攻克 Prompt 工程、上下文管理、响应延迟等LLM应用的核心挑战。 构建提效评估体系,通过关键指标(如 AI ROI)验证和驱动解决方案的业务价值。 3. 规模化演进与工程化落地 (Scaling and Governance) 设计 AI 应用在过渡期和终态的协作形态,制定大规模应用向 AI 原生架构的演进策略。 将成功的 AI 模式封装为 SDK / CLI / IDE 插件等工具,降低业务团队接入门槛。 与产品生态深度合作,规模化推进集团研发过程的全面变革。 4. 技术布道与方法论输出 (Enablement and Knowledge) 编写《AI 解决方案架构指南》《典型场景白皮书》等体系化方法论。 输出实施手册、Checklist、FAQ 等可复制资产,赋能业务团队。 组织**“最佳实践分享会”**,建设 AI 最佳实践工程对接平台,支持业务团队完成架构评估与改造。
1、AI云原生解决方案设计: 1)结合客户AI工作流(如大模型训练/推理、自动驾驶仿真、视频分析等),设计基于IaaS的云原生架构方案,优化模型训练/推理的性能、成本与可靠性; 2)主导AI专用加速方案(如混合精度训练、模型量化、分布式推理)的架构选型与落地,推动框架层与基础设施层的协同优化; 2、客户需求分析与价值传递: 1)深入调研客户AI应用场景,提炼核心痛点(如训练周期长、推理延迟高、资源成本高等),输出技术可行性报告; 2)通过技术白皮书、架构设计图、POC验证等方式,向客户展示IaaS平台在AI场景下的性能优势(如训练速度提升、推理成本降低等); 3、跨团队协作与生态整合: 1)与研发团队协同定义技术实现路径,推动算子优化、框架适配等需求落地; 2)联合产品经理规划解决方案路标,确保技术方案与商业策略对齐; 3)整合ISV、AI框架社区资源,构建AI云原生解决方案生态; 4、行业趋势与市场分析: 1)跟踪AI云原生技术发展(如Kubernetes原生AI、推理加速),输出行业洞察报告; 2)对标市场AI云服务,制定差异化竞争策略。
MiMo 大模型团队正在寻找熟悉 sandbox、容器化和云原生基础设施的研发工程师,一起建设面向大规模强化学习训练的基础设施能力。 随着大模型 Agent 和代码能力训练进入大规模 RL 阶段,我们需要构建稳定、安全、可扩展的任务执行环境。你将参与设计和实现 sandbox 执行系统、容器调度平台、训练任务环境、隔离与资源管理机制,为大规模 Agent 任务、代码执行任务和 RL 训练提供底层 infra 支撑。 工作职责 1. 设计和建设面向 RL 训练的 sandbox 执行环境,支持代码运行、工具调用、浏览器自动化、文件系统操作、网络访问控制等能力。 2. 基于 Docker、Kubernetes 等技术,构建可大规模调度的容器化任务运行平台,支持高并发、多租户、可观测、可恢复的训练任务执行。 3. 参与大规模 RL 训练 infra 的 scaling,包括任务分发、资源调度、环境复用、状态隔离、失败恢复、日志采集和性能优化。 4. 建设安全隔离机制,降低模型生成代码、Agent 工具调用和自动化执行带来的安全风险,包括权限控制、系统调用限制、网络隔离、资源限额等。 5. 与模型训练、Agent 框架、数据和评测团队合作,将训练任务需求转化为稳定可用的执行环境和平台能力。 6. 分析大规模训练过程中的系统瓶颈和故障问题,持续优化调度效率、资源利用率、任务吞吐和环境稳定性。 7. 参与内部平台工具建设,包括任务管理、运行监控、日志查询、环境调试、指标看板和自动化运维能力。