logo of tencent

腾讯腾讯云-可观测与运维平台高级研发工程师(深圳/杭州/北京/上海)

社招全职3年以上腾讯云技术地点:深圳状态:招聘

任职要求


1.经验与素养:计算机本科及以上,2年以上云计算、大数据或可观测性研发经验;精通Java/ Golang/ Rust/ C++至少一种后端语言,深入理解 Linux 底层与分布式设计;
2.领域技术纵深:熟练掌握可观测与大数据生态技术(如存储类 ClickHouse、VM、InfluxDB,计算类 Flink、Spark 等),有开源社区贡献者优先;
3.运维领域深刻认知:理解可观测性本质,具备多源异构数据语义关联与拓扑对齐的全局视野;认知传统运维痛点(告警风暴、配置地狱等),能准确识别哪些场景适合AI提效(如RCA、智能巡检),哪些场景须坚守确定性规则;
4.AI原生交付能…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


1.AI原生产品演进:负责可观测与运维平台的架构研发。探索大模型与多Agent落地,推动平台向智能化、意图驱动(Intent-Driven)及自然语言交互(LUI)的新一代产品形态演进;
2.数据基础设施研发:负责高并发指标、日志、链路(Metrics, Log, Trace) 海量数据流水线的泛在采集、高性能多维存储与计算组件研发,持续优化系统性能与稳定性;
3.智能运维能力构建:利用AI重构并升级海量告警智能降噪、自适应动态拓扑、智能根因定位(RCA)及ChatOps交互式运维等核心产品能力,实现端到端智能闭环。
包括英文材料
大数据+
Java+
Go+
Rust+
C+++
Linux+
ClickHouse+
还有更多 •••
相关职位

logo of aliyun
社招5年以上云智能集团

我们的愿景:【数据驱动智能,观测重构治理】 在专有云(Apsara Stack)这一数字化转型的技术深水区,我们正在打造 AI 驱动的可观测性中枢。通过高性能引擎与 LLM(大语言模型)的协同,我们致力于在海量、异构的专有云环境中,为政企客户提供秒级故障定位体验。 在这里,你处理的是关乎国计民生的核心基础设施,你定义的每一行代码都在构建一个**“可预测、自修复”**的数字底座。

更新于 2026-03-24北京|杭州|上海
logo of alibaba
实习阿里巴巴研究型实

专注于Anycast系统的开发、设计和调优,具体职责包括: 1.基于机器学习的数据流量优化问题:利用机器学习技术分析和预测网络流量模式,从而优化数据在Anycast网络中的传输路径,提高网络的整体效率和鲁棒性。 2.基于机器学习的流量路由策略(learning to route):使用机器学习模型动态调整流量路由策略,减少网络拥堵,提高数据包传输的成功率和速度。 3.基于机器学习的故障检测与恢复(learning to detect and recover):开发机器学习算法实时监控Anycast网络中的节点和链路状态,及时检测异常并自动触发恢复机制,以保证服务的连续性和稳定性。 4.基于机器学习的资源分配(learning to allocate resources):根据实时的网络负载和用户请求特点,动态调整服务器和网络资源的分配策略,以优化Anycast服务的性能和成本。 5.基于机器学习的网络安全策略(learning to secure):利用机器学习算法识别并防御潜在的网络攻击和安全威胁,增强Anycast网络的安全性和可靠性。

更新于 2026-03-17杭州
logo of alibaba
社招5年以上技术类-开发

作为技术负责人,主导集团 AI 基础设施与稳定性领域核心系统的设计与开发。围绕两大方向展开工作:AIOps 智能运维——建设风险左移、故障事前检测及智能诊断恢复能力;AI 可观测——设计面向 AI 全栈(大模型推理、Agent 编排、RAG 管线、工具调用链路)的可观测体系,让 AI 系统本身"可监控、可调试、可度量"。 1. AI 全栈 Tracing:设计并落地覆盖 LLM 推理、Agent 编排、Tool-use 调用的端到端 Trace 体系,兼容社区开放标准并参与 OpenTelemetry 标准的设计; 2. 质量与安全度量:建设 AI 系统的核心度量体系,包括但不限于 Agent 性能和任务完成率等,驱动 AI 系统的持续质量改进,并建设 AI 场景专属的异常检测与根因归因能力; 3. AIOps 智能运维:基于大模型和 AI Agent 技术,建设覆盖风险左移(存量风险扫描、代码变更结构化分析、依赖拓扑治理)、事前检测(历史故障模式匹配、SOP 完备性推理)、故障诊断与快恢的全链路智能运维能力,打通变更上下文、服务拓扑、容量基线、SOP 知识图谱等多源数据底座,降低 MTTR。

更新于 2026-07-14杭州
logo of xiaohongshu
社招3年以上后端开发

1、负责可观测体系研发工作,围绕 Metrics、Logging、Tracing、Profiling 四大支柱,从全栈领域展开可观测基础能力建设; 2、负责监控平台、全链路追踪、日志服务、计算引擎(流式分析、实时告警、时序检测等)、告警、eBPF 等可观测相关技术架构及产品设计; 3、保障可观测相关基础服务,在高并发环境下的高性能、高可用,推动技术、产品持续优化迭代,支撑国内和海外可观测架构设计、数据合规、基建稳定性保障等工作; 4、落地 AI Infra 可观测、AI 应用可观测、可观测 AI+ 等相关技术,提高 AI 场景稳定性以及传统可观测产品使用体验和效率。

更新于 2026-07-19上海