logo of antgroup

蚂蚁金服蚂蚁集团-可观测存储引擎开发-杭州【数据平台】

社招全职3年以上技术-开发地点:杭州状态:招聘

任职要求


1. 至少三年以上的Linux服务端开发经验,具有后台分布式系统开发经验;
2. 熟悉Rust/C++/GO等任一种开发语言,熟悉通信、多线程、高并发处理、内存管理等技术;
3. 理解可观测性数据协议(如PromQL、OpenMetrics、OTLP),熟悉Prometheus…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


1. 设计并开发可观测性平台的核心模块(Metric、日志、分布式追踪等);
​​2. 优化现有监控系统的性能、可靠性和扩展性,支撑千万级实例的实时数据处理;
3. ​​实时计算能力建设​​:构建指标聚合、降采样、异常检测等实时计算管道,支持秒级延迟的监控告警与业务决策;
​​4. 大规模运维实践​​:设计千万级实例的指标采集方案,解决Agent资源占用、网络传输、服务端写入性能等生产级问题;
​​5. 探索前沿技术(如eBPF、AIOps等),推动智能化根因分析、异常预测等能力落地。
包括英文材料
Linux+
分布式系统+
Rust+
C+++
Go+
还有更多 •••
相关职位

logo of aliyun
社招5年以上云智能集团

1. 负责文件存储可观测性指标体系设计实现,定义监控指标埋点和采集流程标准、定义产品全链路关键性能指标、实现数据和元数据全链路请求追踪方案、构建多层级监控体系,支持实时监控与历史趋势分析。 2. 负责文件存储异常诊断系统,基于可观测性指标体系开发故障根因分析和定位能力,基于 AI Agent 构建故障分析和故障处理方案智能推荐。 3. 与客户支持团队对接,提供可观测工具,辅助 SRE 团队快速响应客户问题。

更新于 2025-11-23杭州|上海
logo of xiaohongshu
社招3年以上后端开发

1、负责可观测体系研发工作,围绕 Metrics、Logging、Tracing、Profiling 四大支柱,从全栈领域展开可观测基础能力建设; 2、负责监控平台、全链路追踪、日志服务、计算引擎(流式分析、实时告警、时序检测等)、告警、eBPF 等可观测相关技术架构及产品设计; 3、保障可观测相关基础服务,在高并发环境下的高性能、高可用,推动技术、产品持续优化迭代,支撑国内和海外可观测架构设计、数据合规、基建稳定性保障等工作; 4、落地 AI Infra 可观测、AI 应用可观测、可观测 AI+ 等相关技术,提高 AI 场景稳定性以及传统可观测产品使用体验和效率。

更新于 2026-07-19上海
logo of xiaohongshu
社招3年以上后端开发

1、负责可观测体系研发工作,围绕 Metrics、Logging、Tracing、Profiling 四大支柱,从全栈领域展开可观测基础能力建设; 2、负责监控平台、全链路追踪、日志服务、计算引擎(流式分析、实时告警、时序检测等)、告警、eBPF 等可观测相关技术架构及产品设计; 3、保障可观测相关基础服务,在高并发环境下的高性能、高可用,推动技术、产品持续优化迭代,支撑国内和海外可观测架构设计、数据合规、基建稳定性保障等工作; 4、落地 AI Infra 可观测、AI 应用可观测、可观测 AI+ 等相关技术,提高 AI 场景稳定性以及传统可观测产品使用体验和效率。 1、Participate in the end-to-end R&D of the observability platform across all four pillars — Metrics, Logging, Tracing, and Profiling — building full-stack observability infrastructure capabilities. 2、Drive the technical architecture and product design of monitoring platforms, distributed tracing, log services, compute engines (streaming analysis, real-time alerting, time-series anomaly detection, etc.), alerting systems, and eBPF-based observability technologies. 3、Ensure high performance and high availability of observability infrastructure under high-concurrency conditions. Drive continuous technical and product iteration to support observability architecture design, data compliance, and infrastructure stability for the multi-region environments. 4、Develop and implement AI Infra observability, AI application observability, and AI-powered observability capabilities to improve stability in AI scenarios and enhance the usability and efficiency of traditional observability products.

更新于 2026-04-09新加坡
logo of aliyun
社招3年以上云智能集团

负责阿里集团、阿里云可观测平台建设,打造日增百PB级数据的实时数据分析平台。 通过实时采集、数据建模等技术,实时处理来自千万设备的海量可观测数据,并进行智能分析与洞察。加入该岗位,您将有机会在国内超大规模的可观测平台上,构建面向各类AI应用场景的 AIOps 平台,打造新一代的 AI 基础设施。 1. 参与阿里云云监控数据链路建设,打造日吞吐PB级的高性能实时计算平台。负责海量监控指标与告警的采集、清洗、聚合与存储,保障秒级报警延迟与高可用性; 2. 深度参与云监控2.0战略落地,构建指标、日志、链路深度融合的统一可观测数据底座。打破数据孤岛,设计基于 UModel 的资源关联建模,实现从基础设施到应用层的全链路诊断能力; 3. 结合 AI/LLM 能力,研发新一代智能报警与根因分析引擎。针对 AI 训练集群等新场景,提供特定优化的监控解决方案,实现从“被动告警”到“主动预防”的跨越; 4. 负责云监控采集探针(Agent)及云产品接入层的建设。拥抱开源生态,支持 Prometheus、OpenTelemetry 等标准协议的无缝接入,打造多元、兼容的监控生态体系,,让云上百万企业能够零门槛接入并监控异构环境。

更新于 2026-06-25杭州