拼多多可观测平台[研发工程师/专家]
任职要求
1. 计算机相关专业,工程实战经验丰富,能够胜任高并发、高性能场景开发 2. 精通go或java,具备后端服务研发或管控系统研发2年以上的工作经验 3. 能独立完成大型互联网企业核心基础服务的设计,开发,上线 4. 具备强烈的自驱力与主人翁意识,沟通协作能力好,注重代码质量与工程规范 …
工作职责
1. 负责拼多多可观测平台的设计和开发工作 2. 负责构建统一的全链路观测系统,包括metric、log、trace的数据采集、处理、存储及展示,持续迭代优化产品体验 3. 负责告警引擎的设计与开发,支持实时、高精度、低噪的告警策略,结合动态阈值、异常检测算法提升告警有效性 4. 持续跟进业界前沿技术方案并结合实际情况,探索可观测性产品建设方向并落地应用,持续提升基础设施的稳定性。
1. 参与建设阿里云内统一的智能全景可观测平台。目前该平台已服务阿里云多个主流云产品,覆盖超百万节点,日产PB+数据,是支撑云的性能乃至稳定性的基础设施。 2. 设计实现云内可观测场景的高效存储模型/系统和先进高性能查询分析引擎。为飞天系统乃至云内产品提供极致性价比和有竞争力的功能,保障核心业务的稳定性和提升用户体验 3. 结合传统的智能算法和现代大模型技术,通过对海量可观测数据的分析和垂直领域大模型的建设以及自然语言界面的链接,持续优化经典和现代AIOps效果,发现Insight,推动云内开发运维的范式跃迁 4. 设计开发云内可观测平台的运维自动化系统和工具流程的设计和开发,提升运营平台的效率与智能化水平,保障本平台7x24小时高可用
1. 设计并开发可观测性平台的核心模块(Metric、日志、分布式追踪等); 2. 优化现有监控系统的性能、可靠性和扩展性,支撑千万级实例的实时数据处理; 3. 实时计算能力建设:构建指标聚合、降采样、异常检测等实时计算管道,支持秒级延迟的监控告警与业务决策; 4. 大规模运维实践:设计千万级实例的指标采集方案,解决Agent资源占用、网络传输、服务端写入性能等生产级问题; 5. 探索前沿技术(如eBPF、AIOps等),推动智能化根因分析、异常预测等能力落地。
1、负责可观测体系研发工作,围绕 Metrics、Logging、Tracing、Profiling 四大支柱,从全栈领域展开可观测基础能力建设; 2、负责监控平台、全链路追踪、日志服务、计算引擎(流式分析、实时告警、时序检测等)、告警、eBPF 等可观测相关技术架构及产品设计; 3、保障可观测相关基础服务,在高并发环境下的高性能、高可用,推动技术、产品持续优化迭代,支撑国内和海外可观测架构设计、数据合规、基建稳定性保障等工作; 4、落地 AI Infra 可观测、AI 应用可观测、可观测 AI+ 等相关技术,提高 AI 场景稳定性以及传统可观测产品使用体验和效率。
1、负责可观测体系研发工作,围绕 Metrics、Logging、Tracing、Profiling 四大支柱,从全栈领域展开可观测基础能力建设; 2、负责监控平台、全链路追踪、日志服务、计算引擎(流式分析、实时告警、时序检测等)、告警、eBPF 等可观测相关技术架构及产品设计; 3、保障可观测相关基础服务,在高并发环境下的高性能、高可用,推动技术、产品持续优化迭代,支撑国内和海外可观测架构设计、数据合规、基建稳定性保障等工作; 4、落地 AI Infra 可观测、AI 应用可观测、可观测 AI+ 等相关技术,提高 AI 场景稳定性以及传统可观测产品使用体验和效率。 1、Participate in the end-to-end R&D of the observability platform across all four pillars — Metrics, Logging, Tracing, and Profiling — building full-stack observability infrastructure capabilities. 2、Drive the technical architecture and product design of monitoring platforms, distributed tracing, log services, compute engines (streaming analysis, real-time alerting, time-series anomaly detection, etc.), alerting systems, and eBPF-based observability technologies. 3、Ensure high performance and high availability of observability infrastructure under high-concurrency conditions. Drive continuous technical and product iteration to support observability architecture design, data compliance, and infrastructure stability for the multi-region environments. 4、Develop and implement AI Infra observability, AI application observability, and AI-powered observability capabilities to improve stability in AI scenarios and enhance the usability and efficiency of traditional observability products.