阿里云阿里云智能-AIOps Agent 研发专家-ABM 平台研发
任职要求
1. 计算机相关专业本科及以上学历,扎实的计算机基础(操作系统、计算机网络、数据结构、数据库、分布式系统),具备较为丰富的后端 / 平台 / SRE / 基础设施研发经验;5年及以上相关经验。 2. AI 工程化能力:具备大模型、RAG、Agent、工具调用、AI Coding 等 AI 工程化落地经验,理解 Agent 在复杂系统中的任务拆解、工具执行、上下文管理、权限控制、结果校验、失败兜底、效果评估等关键工程问题。 3. 运维平台研发经验:有运维平台、SRE 平台、稳定性平台、自动化运维工具或基础设施平台研发经验,熟悉监控告警、日志分析、故障诊断、发布变更、容量治理、巡检治理、自动化处置中的一个或多个领域…
工作职责
我们正在招聘 AIOps Agent 研发专家,作为核心研发参与阿里云计算平台下的运维平台 Agent 体系的架构设计与系统实现,服务阿里云计算平台产品,把传统工具化、流程化的运维能力研发升级为 AI Native 的平台化、自动化、自主化产品。 工作职责: 1. 负责运维平台 Agent 工程链路研发,让 Agent 在真实运维场景下做到稳定可控、可观测、可治理。 2. 基于大模型、RAG 与自动化编排,端到端研发异常处置、机器自愈、变更风险拦截、Context 底座等,把目前碎片化、流程化的运维能力重构为完整的 Agent 协同产品。 3. GitOps × IaC 变更能力建设:负责 GitOps x Iac 的变更能力建设,覆盖应用与基础设施资源,保障不同产品形态下的统一管控模型与大规模变更场景下的稳定性,并具备 Agent 协同执行的能力。 4. 中台 AI 自主开发能力研发:研发可供 AI 自主行动的中台与 SRE 服务环境,推动中台需求开发与交付向 AI Native 模式演进,让 AI 在真实工程语境下安全完成闭环并保证可审计、可回滚。 5. 平台关键能力研发与稳定性保障:承接运维平台的关键模块的设计、开发、演进与稳定性治理,保障关键服务可用性、监控覆盖与交付质量,并按横向项目节奏推进代码合一、独立部署等研发要求。 6. 与 SRE、算法团队一起,协同识别效率瓶颈与稳定性风险,主导 AI Native 工程方法与研发范式在团队内沉淀。

我们正在招聘 AIOps Agent 研发专家,作为核心研发参与阿里云计算平台下的运维平台 Agent 体系的架构设计与系统实现,服务阿里云计算平台产品,把传统工具化、流程化的运维能力研发升级为 AI Native 的平台化、自动化、自主化产品。 工作职责: 1. 负责运维平台 Agent 工程链路研发,让 Agent 在真实运维场景下做到稳定可控、可观测、可治理。 2. 基于大模型、RAG 与自动化编排,端到端研发异常处置、机器自愈、变更风险拦截、Context 底座等,把目前碎片化、流程化的运维能力重构为完整的 Agent 协同产品。 3. GitOps × IaC 变更能力建设:负责 GitOps x Iac 的变更能力建设,覆盖应用与基础设施资源,保障不同产品形态下的统一管控模型与大规模变更场景下的稳定性,并具备 Agent 协同执行的能力。 4. 中台 AI 自主开发能力研发:研发可供 AI 自主行动的中台与 SRE 服务环境,推动中台需求开发与交付向 AI Native 模式演进,让 AI 在真实工程语境下安全完成闭环并保证可审计、可回滚。 5. 平台关键能力研发与稳定性保障:承接运维平台的关键模块的设计、开发、演进与稳定性治理,保障关键服务可用性、监控覆盖与交付质量,并按横向项目节奏推进代码合一、独立部署等研发要求。 6. 与 SRE、算法团队一起,协同识别效率瓶颈与稳定性风险,主导 AI Native 工程方法与研发范式在团队内沉淀。
主导集团稳定性领域核心系统的设计与开发,重点建设风险左移和故障事前检测能力,覆盖从变更前存量风险扫描、变更时自动检测到运行态防御的全链路风险治理体系,并结合 AI 大模型提升故障全生命周期各环节的智能化水平。 ● 风险左移与事前检测体系建设:主导设计变更前存量风险扫描(如容量基线监控、静态代码质量扫描、依赖拓扑治理、隐性健康度巡检等)的技术方案,将风险发现从"事中排查和事后复盘"前移至"事前拦截" ● AI 驱动的风险检测引擎:基于大模型和 AI Agent 技术,建设智能化风险检测能力,包括但不限于:代码变更 Diff + AST 调用链的结构化风险分析、历史故障模式的向量化检索与自动匹配、SOP 完备性的 LLM 推理引擎等 ● 风险检测数据底座建设:设计并落地风险检测所需的数据资产体系,打通变更上下文(Diff、配置值、发布计划)、服务依赖拓扑、容量基线、SOP 知识图谱等多源数据,解决"信息不可达"导致风险无法识别的核心瓶颈 ● 故障诊断与快恢能力建设:通过历史故障结构化分析,沉淀故障排查、定位和恢复的标准 SOP,结合 AI 建设故障自动诊断与智能恢复能力,降低 MTTR 系统架构与工程卓越:持续优化系统高可用架构、性能调优、全链路监控与容灾预案,解决高并发、低延迟、高可靠性等复杂技术挑战
1、负责大数据计算、存储引擎的稳定性、成本和效率方向工作,包括风险管理、变更管控、成本治理、性能优化、运维运营效率提升等。 2、深入理解上述平台的架构及其支撑的业务(搜推、广告、风控、AI等),帮助业务在稳定性、成本、效率等方向上做更好的架构设计,对生产问题进行诊断和优化,帮助不断提升数据+AI业务的价值。 3、负责大数据PaaS平台和AI Agent建设。探索和落地大数据领域Agent和AIOps技术风险领域的前沿技术和应用场景,包括智能问答、推理分析、容量规划、数据治理、业务诊断、风险预测等,并落地到业务场景,不断推动服务能力升级。
我们正在招聘运维开发工程师,负责阿里云大数据&AI平台的售后智能答疑体系和客户体感稳定性体系建设,从用户服务专家的视角来处理超大规模大数据平台承载的用户问题和重保需求,持续提升运维效率,为产品稳定性和服务口碑树立持续贡献力量 该岗位以大数据&AI产品售后答疑工作为业务基础,一方面深度参与共建Agent架构下的智能答疑能力,围绕问题自助答疑、自助诊断和产品改进项提炼等核心场景进行自动化能力建设;另一方面深度参与客户体感稳定性体系和重保能力建设,在对产品架构和稳定性场景深入掌握的基础上,提炼客户实例级稳定性指标,为客户提供更前置的主动隐患发现与重保服务能力 你将与TAM、研发、SRE、平台工程、算法和产品团队协作,推动传统答疑和排查能力向智能化演进,支撑阿里云大数据&AI平台业务高速发展,共建业界一流的智能服务专家团队 工作职责: 1. 负责阿里云大数据&AI产品的售后L3答疑和服务工作,承接前方服务团队的升级工单处理和用户疑难问题排查;组织和提供大客户钉群服务能力,对头部/重要客户进行业务保障;接收客户需求提供业务巡检、大促护航、产品改进推动等重保能力交付 2. 参与基于Agent的智能答疑体系建设,结合大模型、RAG、Skills、Harness engineer等技术能力,落地根因定位、异常检测、SOP执行和运维问答等AI化运维能力 3. 参与客户体感稳定性系统建设,协同产研SRE建立实例级可用率指标,定义客户级体感可用率标准,构建细粒度封网、变更后置、主动巡检和风险发现预防等重保能力,推动客户问题发现与主动服务链路落地,为产品提供更强的增值能力 4. 负责售后支持外包团队的管理,包括答疑提效、人员培养和成本管理等职责