阿里云阿里云智能-AI Infra可观测高级研发工程师-上海
任职要求
1. 扎实的算法基础和良好的编码习惯,精通 C++、Java、Go、Python 中任何一门语言; 2. 在高性能数据结构、编码压缩、向量处理、异步IO、内存管理、多线程并发等领域有深入实践;有 Linux 内核、eBPF 开发经验更佳; 3. 理解分布式系统,包括调度、分布式锁、负载均衡等; 4. 加分项(AI相关) 1)熟悉 LLM 应用框架、Prompt 设计、Agent 框架(如 LangGraph、Dify、AutoGen、Google ADK、工具链集成等)者优…
工作职责
加入该岗位,你将参与构建面向 AI 时代的下一代可观测数据基础设施。 ● 打造国内超大规模的可观测基础设施:通过实时采集、索引、存储、压缩等技术,实时处理来自千万设备的海量日志数据,并针对 AI 应用场景进行特定优化,提供智能、自动化数据分析服务; ● 深度参与 AI Infra 核心能力建设:从数据采集到智能分析,构建面向 LLM、Agent、多模态等前沿 AI 场景的统一可观测底座; ● 开源引领行业标准:主导 LoongCollector 开源项目,推动云原生可观测采集器成为 AI 时代的新一代 OneAgent。 具体职责包括: 1. 参与阿里云战略级产品 SLS 研发,参与面向AI应用场景的数据采集、处理、查询分析等功能开发与设计; 2. 参与千万级实例、数百 PB 流量的云原生可观测采集器 LoongCollector/iLogtail 及管控系统开发,打造云上统一的 OneAgent 能力,服务于日志、指标、eBPF、主机监控、安全等多种场景; 3. 深度参与并打造高性能、高可靠的数据采集与管控系统,深入底层优化,提升网络、内存和 CPU 等关键资源的利用效率; 4. 面向 AI 应用构建高性能、安全的多模态数据处理与数据集管理平台,参与上下游 AI 生态建设。
作为技术负责人,主导集团 AI 基础设施与稳定性领域核心系统的设计与开发。围绕两大方向展开工作:AIOps 智能运维——建设风险左移、故障事前检测及智能诊断恢复能力;AI 可观测——设计面向 AI 全栈(大模型推理、Agent 编排、RAG 管线、工具调用链路)的可观测体系,让 AI 系统本身"可监控、可调试、可度量"。 1. AI 全栈 Tracing:设计并落地覆盖 LLM 推理、Agent 编排、Tool-use 调用的端到端 Trace 体系,兼容社区开放标准并参与 OpenTelemetry 标准的设计; 2. 质量与安全度量:建设 AI 系统的核心度量体系,包括但不限于 Agent 性能和任务完成率等,驱动 AI 系统的持续质量改进,并建设 AI 场景专属的异常检测与根因归因能力; 3. AIOps 智能运维:基于大模型和 AI Agent 技术,建设覆盖风险左移(存量风险扫描、代码变更结构化分析、依赖拓扑治理)、事前检测(历史故障模式匹配、SOP 完备性推理)、故障诊断与快恢的全链路智能运维能力,打通变更上下文、服务拓扑、容量基线、SOP 知识图谱等多源数据底座,降低 MTTR。
1、理解业务模式与技术架构,制定成本采集方案,执行滚动预测与异动归因分析,识别成本风险并提前预警; 2、监控 GPU 算力、存储、网络等基础设施资源的利用率与水位,持续关注研发提效策略,针对性调整运营手段和优化策略; 3、基于业务发展预期和现有资源水位,制定中长期资源规划方案(容量预测、扩缩容节奏、采购策略); 4、评估采购需求,统筹云资源、硬件采购方案,从成本、供应稳定性、技术适配性等多维度为架构决策和资源规划提供数据支撑; 5、定期与业务部门、财务、采购等部门对接,评估资源容量需求并进行合理规划; 6、与各部门高频对接,收集使用反馈,持续优化产品体验和数据可视化。

团队介绍 我们致力于打造自动驾驶领域的下一代数据闭环系统。我们正在探索如何利用生成式AI重构物理世界,从海量路测数据中提取高保真、可交互的三维场景,构建大规模世界模型。我们寻找热衷于将前沿三维视觉技术转化为数据生产力的伙伴,共同攻克自动驾驶在复杂场景下的仿真与泛化难题。 负责3D高斯泼溅(3DGS)及前馈式生成模型的训练链路优化,提升训练速度、显存效率与模型稳定性; 设计与实现分布式训练框架,支持大规模三维场景数据的高并发训练与高效迭代; 深入硬件与计算栈,进行GPU算子优化、内存调度与混合精度训练策略的研发; 与三维视觉、自动驾驶仿真团队紧密协作,将优化后的训练系统应用于场景生成、神经渲染、高精地图构建等实际业务; 跟踪学术界与工业界在训练加速、模型压缩、系统架构等方面的最新进展,推动技术落地并形成工程实践。