阿里巴巴基础设施与稳定性工程-Agent Infra 架构师-研发基础设施
任职要求
1. 本科及以上学历,5 年以上后端、基础架构或平台研发经验,具备复杂系统架构设计与生产落地经验。 2. 精通 Java、Go、Rust、C++、Python、TypeScript 中至少一门语言,具备关键模块设计和一线编码能力。 3. 深入理解分布式系统,熟悉存储、缓存、消息、调度、一致性、容错及高可用等核心机制。 4. 熟悉云原生与 PaaS 架…
工作职责
1. 负责 Agent 托管 PaaS 的整体架构设计与演进,明确系统边界、核心领域模型、技术标准和长期演进路线。 2. 横向协同 Sandbox、身份安全、网关、存储、可观测、研发交付及业务 Agent 团队,推动跨系统方案达成一致并落地。 3. 建设大规模会话与状态管理能力,解决长任务、流式交互、并发控制、断线恢复、会话迁移和回放等复杂问题。 4. 负责 Agent 安全与可靠性架构,建设复合身份、最小权限、凭证托管、故障隔离、容灾降级和 SLO 体系。 5. 推动模型、CLI、MCP、A2A、Skills、Sandbox 等能力通过统一协议和 API 接入,降低业务 Agent 的托管成本。 6. 主导关键技术方案与架构评审,通过核心代码、技术标准和最佳实践解决跨团队复杂问题,提升平台整体一致性。
作为技术负责人,主导集团 AI 基础设施与稳定性领域核心系统的设计与开发。围绕两大方向展开工作:AIOps 智能运维——建设风险左移、故障事前检测及智能诊断恢复能力;AI 可观测——设计面向 AI 全栈(大模型推理、Agent 编排、RAG 管线、工具调用链路)的可观测体系,让 AI 系统本身"可监控、可调试、可度量"。 1. AI 全栈 Tracing:设计并落地覆盖 LLM 推理、Agent 编排、Tool-use 调用的端到端 Trace 体系,兼容社区开放标准并参与 OpenTelemetry 标准的设计; 2. 质量与安全度量:建设 AI 系统的核心度量体系,包括但不限于 Agent 性能和任务完成率等,驱动 AI 系统的持续质量改进,并建设 AI 场景专属的异常检测与根因归因能力; 3. AIOps 智能运维:基于大模型和 AI Agent 技术,建设覆盖风险左移(存量风险扫描、代码变更结构化分析、依赖拓扑治理)、事前检测(历史故障模式匹配、SOP 完备性推理)、故障诊断与快恢的全链路智能运维能力,打通变更上下文、服务拓扑、容量基线、SOP 知识图谱等多源数据底座,降低 MTTR。
1、阿里集团核心中间件演进,负责微服务应用服务框架、消息、软负载等核心中间件的设计、开发与运维 2、参与超大规模的底层核心技术的设计和实现,为阿里集团全域业务提供高质量的中间件基础服务 3、参与 AI 原生中间件产品建设,设计并研发面向生产级 AI Agent 场景,构建中间件领域 AI Friendly 的产品能力 4、持续优化提升中间件核心系统的稳定性和运维效率,完善中间件体系架构,满足全集团日益复杂的各类业务需求
1. 围绕 Agent 自主可信交付,负责 Aone 交付相关系统的重构与演进,建设 Agent 友好的端到端可信发布能力。 2. 负责合规发布能力建设,推动现有发布系统完成合规化改造与交付,保障发布过程满足安全与合规要求。 3. 探索 AI 在交付领域的工程化应用,建设面向 AI Agent 的发布基础设施与工具能力,推动发布分析、风险检查、异常诊断和变更验证等环节的智能化升级。
围绕软件工程过程,建设「让所有AlAgent产品可靠运行」的基础设施产品,定义Agent基础设施产品的全生命周期,设计让Agent“快、稳、准"的 底层产品体系,支撑数十万开发者在Al-Native时代的软件工程实践。 1.负责AgentInfra的产品规划,围绕产品分析、软件交付、可测试性、技术风险控制、协作效率、研发资产管理等定义关键产品能力。 2.以VibeCoding的方式利用AI工具,一体化传统PD、交互、前端角色,快速迭代验证产品思考并转化为产品力。 3.结合Al发展趋势,持续追踪先进的Agent产品及HarnessEngineering等工程实践演进,确保产品技术路线的先进性。 4.保持平台的开放性,服务于多样化的业务场景与Agent军团业态,放大作用域。 5.建立有效的产品跟踪体系,持续验证并优化产品对技术产能的实际贡献,形成完整的价值闭环。