
智能互联阿里云智能-大数据&AI平台智能运维算法专家-异常检测/根因定位
任职要求
1、硕士研究生及以上学历,计算机、软件工程、人工智能等相关专业,5年及以上算法研发经验。 2、具备扎实的机器学习、深度学习算法和统计学基础,熟悉主流预训练模型,熟练掌握Pytorch/Tensorflow等框架。拥有优秀的编程能力,精通Python/Java等至少一门编程语言,具备从算法设计到高质量代码落地的全栈实现能力。理解LLM原理,具备微调、RAG、Agent应用构建的相关经验,熟悉Dify、Langchain等框架。 3、有智能运维(AIOps)领域项目经验者优先,包括时间序列异常检测、日志聚…
工作职责
我们正在寻找具备扎实算法研发能力和系统工程思维的技术人才,共同构建面向超大规模云环境的新一代智能运维(AIOps)体系。你将深度参与从问题定义到算法落地的完整闭环,推动AI技术在稳定性保障、故障诊断、效率提升等关键场景中的创新应用。
主要职责包括但不限于:
1. 业务需求分析与算法方案设计
○ 深入理解阿里云大数据与AI平台在稳定性、性能优化、运维提效等方面的运维痛点,识别核心问题场景,明确算法目标与交付边界;
○ 将复杂运维场景抽象为可建模的问题,结合业界前沿技术完成技术选型与算法方案设计,相关技术包括但不限于:
■ 多维度时间序列异常检测与预测
■ 日志模式提取、聚类与异常识别
■ 关联分析和因果推断
■ 大模型微调(Fine-tuning)与检索增强生成(RAG)
■ 大模型智能体
2. 算法工程化实现与系统建设
○ 按照团队的算法开发工程规范,完成端到端的算法工程化落地,包括数据清洗、特征工程、模型训练与推理流程的设计与开发等;
○ 设计并建立算法服务的SLA体系,涵盖准确性、响应延迟、稳定性及可扩展性,支撑高并发、低延迟的线上服务能力;
○ 将算法能力集成至智能运维平台,并进行相关产品能力建设,支撑包括变更风险巡检、根因定位、智能答疑等功能模块。
3. 算法评估与调优
○ 构建科学的测试验证机制量化评估算法效果;建立离线评测与在线A/B测试联动机制,驱动算法持续优化与产品价值验证;
○ 根据实际运行反馈与性能瓶颈,通过参数调优、模型轻量化、计算逻辑重构等方式提升算法效率与准确率。
4. 前沿技术探索与体系建设
○ 密切跟踪AIOps、时间序列分析、大模型智能体、强化学习、因果推断、知识图谱等领域的最新进展,积极探索AI新技术在运维场景中的落地可能性,助力打造下一代自治云平台。1、市场洞察和竞对分析 •洞察和产品相关的市场机会、市场容量和竞争格局。 •分析竞对产品核心指标、市场策略和市场价格。 •快速捕捉市场热点和客户业务痛点,挖掘产品商机,快速推动落地,形成领先竞争力。 2、产品商机判断和深度技术交流 •作为产品线代表,参与商业策略设计和商机判断。 •对复杂项目需求,协同销售团队与客户进行深度技术交流,结合对行业发展方向和技术变革方向的洞察,就具体技术场景引导客户关键决策人决策,促进商机转化。 3、产品方案设计和技术支持 •对复杂项目,理解客户的业务和功能性/非功能型需求、性能及可用性需求,基于客户场景,提供有技术竞争力和可行性、成本优势的产品组合方案,并在产品选型/POC/报价配置时, 提供技术支持。 •提炼基于客户业务场景的关键技术指标,形成领先控标项,在POC、winback等业务活动中落地验证。 •复杂项目推进方案跨团队协同优化,成本,性能,稳定性等多维度提升解决方案的竞争力。 •探索创新产品的方案和场景,推动新产品快速市场覆盖,保障产品创新活力。 •对大客户提供售后的关键技术答疑,用技术推动业务发展。 4、产品设计和优化支持 •通过对行业、场景的深入了解,参与产品的重大功能设计、定价设计、用户体验设计,协助产品在行业/场景下保持领先性。 •识别并精准提炼客户的共性需求和痛点,反哺产品设计,推动产品改进和多产品融合、新产品和功能孵化。 5、最佳实践沉淀和赋能 •沉淀面向细分场景的最佳实践,选择性输出IaC代码,通过项目实践总结标杆成功案例,提炼共性模块、统一标准化能力,加速产品方案规模化复制。 •提炼产品优势功能性能参数,并针对性的设计测试用例,放大产品和技术的影响力,沉淀基于测试用例、测试方案的解决方案竞争力。 •参与产品GTM材料编写、与伙伴共创联合解决方案、对销售团队和生态伙伴赋能。
1. 负责SQL引擎新功能开发,和PD对齐产品行为,了解SQL标准并进行竞品调研,功能开发、测试、维护等 2. 负责SQL引擎核心优化,深入理解线上业务SQL使用方式,关注业界通用Benchmark,分析性能瓶颈并针对性改进等 3. 负责SQL引擎易用性提升,了解业界竞品语言特性,持续提升用户粘性,Portal工具改进,方便用户自查工具开发等 4. 负责SQL引擎线上支持,部分疑难问题答疑、线上稳定性改进、提升系统可观测性等
我们正在寻找具备扎实算法研发能力和系统工程思维的技术人才,共同构建面向超大规模云环境的新一代智能运维(AIOps)体系。你将深度参与从问题定义到算法落地的完整闭环,推动AI技术在稳定性保障、故障诊断、效率提升等关键场景中的创新应用。 主要职责包括但不限于: 1. 业务需求分析与算法方案设计 ○ 深入理解阿里云大数据与AI平台在稳定性、性能优化、运维提效等方面的运维痛点,识别核心问题场景,明确算法目标与交付边界; ○ 将复杂运维场景抽象为可建模的问题,结合业界前沿技术完成技术选型与算法方案设计,相关技术包括但不限于: ■ 多维度时间序列异常检测与预测 ■ 日志模式提取、聚类与异常识别 ■ 关联分析和因果推断 ■ 大模型微调(Fine-tuning)与检索增强生成(RAG) ■ 大模型智能体 2. 算法工程化实现与系统建设 ○ 按照团队的算法开发工程规范,完成端到端的算法工程化落地,包括数据清洗、特征工程、模型训练与推理流程的设计与开发等; ○ 设计并建立算法服务的SLA体系,涵盖准确性、响应延迟、稳定性及可扩展性,支撑高并发、低延迟的线上服务能力; ○ 将算法能力集成至智能运维平台,并进行相关产品能力建设,支撑包括变更风险巡检、根因定位、智能答疑等功能模块。 3. 算法评估与调优 ○ 构建科学的测试验证机制量化评估算法效果;建立离线评测与在线A/B测试联动机制,驱动算法持续优化与产品价值验证; ○ 根据实际运行反馈与性能瓶颈,通过参数调优、模型轻量化、计算逻辑重构等方式提升算法效率与准确率。 4. 前沿技术探索与体系建设 ○ 密切跟踪AIOps、时间序列分析、大模型智能体、强化学习、因果推断、知识图谱等领域的最新进展,积极探索AI新技术在运维场景中的落地可能性,助力打造下一代自治云平台。
1. 参与SQL引擎性能优化,深入分析线上业务SQL执行特征,定位性能瓶颈并设计针对性的优化方案。 2. 负责SQL引擎控制链路的架构优化,设计和实现全链路Cache、异步化改造等方案,提升查询性能与系统稳定性。 3. 参与SQL-AI融合能力建设,实现大模型、Agent与SQL引擎的集成方案,推动Data+AI场景落地。 4. 参与SQL引擎与GPU等异构资源的适配开发,实现向量检索、多模态数据处理等新能力。 5. 支持SQL引擎线上业务,排查疑难问题,完善可观测性建设,持续提升系统稳定性和用户体验。 6. 跟踪大数据与AI融合领域的技术动态,参与关键技术预研与原型验证。