logo of alibaba

阿里巴巴AIOps工程实习生

实习兼职阿里巴巴日常实习生地点:杭州状态:招聘

任职要求


1、计算机、软件、数学或相关专业本科及以上学历,对 AI 在运维领域的应用有浓厚兴趣;
2、熟练掌握 Python,具备良好的代码规范,熟悉常用数据结构算法;
3、了解基本的机器学习概念(如分类、聚类、回归),对时间序列分析或 NLP 有初步了解者优先;
4、对 LLM 有浓厚兴趣,了…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


1、参与告警降噪、收敛策略的开发,协助实现关键指标的智能异常检测,减少无效告警干扰;
2、基于日志、监控数据及调用链信息,协助构建故障根因分析(RCA)模型,提升问题定位效率;
3、结合大语言模型(LLM)技术,参与运维知识库问答、日志智能解读等功能的开发与优化,打造交互式运维 Copilot;
4、负责运维数据的清洗、预处理及特征工程,协助完成算法模型的训练、评估及基础工程化落地。
包括英文材料
学历+
Python+
数据结构+
算法+
机器学习+
还有更多 •••
相关职位

logo of bytedance
社招A60070

1、构建全景网络可观测性平台:打造覆盖物理和虚拟网络的Streaming Telemetry数据管道,整合GNMI、NETCONF、IPFIX/NetFlow、SNMP等多源数据,为AIOps提供高质量、高时效性的数据基石; 2、研发智能诊断与根因分析系统:应用机器学习与深度学习算法,对海量网络指标、日志、事件进行异常检测、关联分析与智能降噪,快速定位从光模块、交换机硬件、协议邻居到应用层流量的全链路故障根因; 3、探索LLM与Agent的创新应用: 1)智能运维助理:构建基于RAG(检索增强生成)的运维对话机器人,使其能理解自然语言问题,自动查询知识库与监控数据,提供精准的故障排查指引和网络状态报告;2)自动化修复与智能Runbook:训练运维Agent,使其能够安全、可控地调用网络工具与API;基于对故障场景的理解,自主生成、推荐甚至执行修复方案与应急预案(Runbook); 4、建设容量与风险预测能力:基于历史数据和业务增长模型,预测网络容量瓶颈、高风险链路与“亚健康”设备,驱动主动扩容和预防性维护; 5、打造坚如磐石的工程体系:遵循最佳工程实践,设计和开发高可用、可扩展的AIOps平台与服务;保障从数据采集、模型训练、在线推理到自动化闭环全流程的稳定性和性能。

更新于 2026-03-17北京
logo of alibaba
社招2年以上

主导集团稳定性领域核心系统的设计与开发,重点建设风险左移和故障事前检测能力,覆盖从变更前存量风险扫描、变更时自动检测到运行态防御的全链路风险治理体系,并结合 AI 大模型提升故障全生命周期各环节的智能化水平。 ● 风险左移与事前检测体系建设:主导设计变更前存量风险扫描(如容量基线监控、静态代码质量扫描、依赖拓扑治理、隐性健康度巡检等)的技术方案,将风险发现从"事中排查和事后复盘"前移至"事前拦截" ● AI 驱动的风险检测引擎:基于大模型和 AI Agent 技术,建设智能化风险检测能力,包括但不限于:代码变更 Diff + AST 调用链的结构化风险分析、历史故障模式的向量化检索与自动匹配、SOP 完备性的 LLM 推理引擎等 ● 风险检测数据底座建设:设计并落地风险检测所需的数据资产体系,打通变更上下文(Diff、配置值、发布计划)、服务依赖拓扑、容量基线、SOP 知识图谱等多源数据,解决"信息不可达"导致风险无法识别的核心瓶颈 ● 故障诊断与快恢能力建设:通过历史故障结构化分析,沉淀故障排查、定位和恢复的标准 SOP,结合 AI 建设故障自动诊断与智能恢复能力,降低 MTTR 系统架构与工程卓越:持续优化系统高可用架构、性能调优、全链路监控与容灾预案,解决高并发、低延迟、高可靠性等复杂技术挑战

更新于 2026-06-29杭州
logo of aliyun
社招5年以上云智能集团

我们正在招聘运维开发工程师,负责阿里云大数据&AI平台的售后智能答疑体系和客户体感稳定性体系建设,从用户服务专家的视角来处理超大规模大数据平台承载的用户问题和重保需求,持续提升运维效率,为产品稳定性和服务口碑树立持续贡献力量 该岗位以大数据&AI产品售后答疑工作为业务基础,一方面深度参与共建Agent架构下的智能答疑能力,围绕问题自助答疑、自助诊断和产品改进项提炼等核心场景进行自动化能力建设;另一方面深度参与客户体感稳定性体系和重保能力建设,在对产品架构和稳定性场景深入掌握的基础上,提炼客户实例级稳定性指标,为客户提供更前置的主动隐患发现与重保服务能力 你将与TAM、研发、SRE、平台工程、算法和产品团队协作,推动传统答疑和排查能力向智能化演进,支撑阿里云大数据&AI平台业务高速发展,共建业界一流的智能服务专家团队 工作职责: 1. 负责阿里云大数据&AI产品的售后L3答疑和服务工作,承接前方服务团队的升级工单处理和用户疑难问题排查;组织和提供大客户钉群服务能力,对头部/重要客户进行业务保障;接收客户需求提供业务巡检、大促护航、产品改进推动等重保能力交付 2. 参与基于Agent的智能答疑体系建设,结合大模型、RAG、Skills、Harness engineer等技术能力,落地根因定位、异常检测、SOP执行和运维问答等AI化运维能力 3. 参与客户体感稳定性系统建设,协同产研SRE建立实例级可用率指标,定义客户级体感可用率标准,构建细粒度封网、变更后置、主动巡检和风险发现预防等重保能力,推动客户问题发现与主动服务链路落地,为产品提供更强的增值能力 4. 负责售后支持外包团队的管理,包括答疑提效、人员培养和成本管理等职责

更新于 2026-06-11杭州
logo of aligenie
社招5年以上

我们正在招聘运维开发工程师,负责阿里云大数据&AI平台的售后智能答疑体系和客户体感稳定性体系建设,从用户服务专家的视角来处理超大规模大数据平台承载的用户问题和重保需求,持续提升运维效率,为产品稳定性和服务口碑树立持续贡献力量 该岗位以大数据&AI产品售后答疑工作为业务基础,一方面深度参与共建Agent架构下的智能答疑能力,围绕问题自助答疑、自助诊断和产品改进项提炼等核心场景进行自动化能力建设;另一方面深度参与客户体感稳定性体系和重保能力建设,在对产品架构和稳定性场景深入掌握的基础上,提炼客户实例级稳定性指标,为客户提供更前置的主动隐患发现与重保服务能力 你将与TAM、研发、SRE、平台工程、算法和产品团队协作,推动传统答疑和排查能力向智能化演进,支撑阿里云大数据&AI平台业务高速发展,共建业界一流的智能服务专家团队 工作职责: 1. 负责阿里云大数据&AI产品的售后L3答疑和服务工作,承接前方服务团队的升级工单处理和用户疑难问题排查;组织和提供大客户钉群服务能力,对头部/重要客户进行业务保障;接收客户需求提供业务巡检、大促护航、产品改进推动等重保能力交付 2. 参与基于Agent的智能答疑体系建设,结合大模型、RAG、Skills、Harness engineer等技术能力,落地根因定位、异常检测、SOP执行和运维问答等AI化运维能力 3. 参与客户体感稳定性系统建设,协同产研SRE建立实例级可用率指标,定义客户级体感可用率标准,构建细粒度封网、变更后置、主动巡检和风险发现预防等重保能力,推动客户问题发现与主动服务链路落地,为产品提供更强的增值能力 4. 负责售后支持外包团队的管理,包括答疑提效、人员培养和成本管理等职责

更新于 2026-06-11杭州