阿里云阿里云智能-AIOps 前端技术专家-杭州
任职要求
1、扎实的前端技术基础:精通 JavaScript/TypeScript,熟悉 React/Vue 等主流框架,掌握现代 Web 构建体系(Vite/Webpack); 2、全栈开发能力:熟悉 Node.js/Bun/Python 开发,有 Serverless(如 阿里云FC、Cloudflare Workers、AWS Lambda)实战经验者优先; 3、对 AI 技术有热情与实践:了解 LLM、Prompt …
工作职责
1、AI 应用可观测 建设,从应用监控到应用评估,深入 AI 原生应用效果; 2、AI 应用数据平台 建设,含 行为数据 x AI 创新探索,为用户体验监控破局,提升产品价值和客户黏性; 3、深度参与 AI 能力的工程化落地,包括模型调用、Prompt 工程、AI 应用验证/评估、AI Agent 等技术方案; 4、解决 复杂技术问题,进行体验优化、性能优化和稳定性改进。
ByteIntern:面向2027届毕业生(2026年9月-2027年8月期间毕业),为符合岗位要求的同学提供转正机会。 团队介绍:字节跳动APM(Application Performance Management) 团队负责公司所有服务端、移动端、 前端、 跨端产品的稳定性和性能质量监控保障,构建业界领先的可观测性基础设施,结合机器学习智能化,提供一站式平台覆盖字节跳动各业务线的排障、监控和稳定性提升等需求。 1、负责AIOps领域算法和解决方案设计实现,包括时序分析、日志挖掘、故障预测、根因关联推断和智能决策等; 2、AIOps智能运维领域先进技术和创新解决方案能力构建; 3、针对AIOps领域充分利用LLM优势,包括模型微调、RAG、Agent相关算法等。
1、参与告警降噪、收敛策略的开发,协助实现关键指标的智能异常检测,减少无效告警干扰; 2、基于日志、监控数据及调用链信息,协助构建故障根因分析(RCA)模型,提升问题定位效率; 3、结合大语言模型(LLM)技术,参与运维知识库问答、日志智能解读等功能的开发与优化,打造交互式运维 Copilot; 4、负责运维数据的清洗、预处理及特征工程,协助完成算法模型的训练、评估及基础工程化落地。
1、构建全景网络可观测性平台:打造覆盖物理和虚拟网络的Streaming Telemetry数据管道,整合GNMI、NETCONF、IPFIX/NetFlow、SNMP等多源数据,为AIOps提供高质量、高时效性的数据基石; 2、研发智能诊断与根因分析系统:应用机器学习与深度学习算法,对海量网络指标、日志、事件进行异常检测、关联分析与智能降噪,快速定位从光模块、交换机硬件、协议邻居到应用层流量的全链路故障根因; 3、探索LLM与Agent的创新应用: 1)智能运维助理:构建基于RAG(检索增强生成)的运维对话机器人,使其能理解自然语言问题,自动查询知识库与监控数据,提供精准的故障排查指引和网络状态报告;2)自动化修复与智能Runbook:训练运维Agent,使其能够安全、可控地调用网络工具与API;基于对故障场景的理解,自主生成、推荐甚至执行修复方案与应急预案(Runbook); 4、建设容量与风险预测能力:基于历史数据和业务增长模型,预测网络容量瓶颈、高风险链路与“亚健康”设备,驱动主动扩容和预防性维护; 5、打造坚如磐石的工程体系:遵循最佳工程实践,设计和开发高可用、可扩展的AIOps平台与服务;保障从数据采集、模型训练、在线推理到自动化闭环全流程的稳定性和性能。
1、负责大数据计算、存储引擎的稳定性、成本和效率方向工作,包括风险管理、变更管控、成本治理、性能优化、运维运营效率提升等。 2、深入理解上述平台的架构及其支撑的业务(搜推、广告、风控、AI等),帮助业务在稳定性、成本、效率等方向上做更好的架构设计,对生产问题进行诊断和优化,帮助不断提升数据+AI业务的价值。 3、负责大数据PaaS平台和AI Agent建设。探索和落地大数据领域Agent和AIOps技术风险领域的前沿技术和应用场景,包括智能问答、推理分析、容量规划、数据治理、业务诊断、风险预测等,并落地到业务场景,不断推动服务能力升级。