阿里云阿里云智能-高性能网络技术高级开发工程师-北京/杭州
任职要求
计算机科学、网络工程、电子工程等相关专业; 高性能网络或相关领域工作经验,熟练掌握C/C++、Python,Golang 等主流编程语言 精通 Linux 系统编程和调优,熟悉 RDMA 技术原理(RoCE v2、InfiniBand)及应用场景,内核网络栈、DPDK 等高性能网络技术者优先; 具备良好的问题定位与解决能力,能独立处理大规模分布式系统的稳定性问题。 具备良好的学习能力和团队协作意识,…
工作职责
阿里云正在构建面向 AI 大模型训练与推理的下一代高性能网络基础设施,以支撑全球企业对极致算力与低延迟网络的需求。我们正在寻找一位在 RDMA(Remote Direct Memory Access) 技术领域有深厚经验的 DevOps 工程师,负责设计、部署和优化基于 RDMA 的 AI 训练集群网络架构,推动高性能网络技术在分布式 AI 场景的落地与创新。 核心职责: 1)AI 训练集群网络架构设计与运维 部署、运维和维护基于 RoCE/InfiniBand 的 RDMA 网络架构,支撑大规模 AI 训练集群(如万卡级 GPU 集群); 优化分布式 AI 工作负载(如 NCCL、MPI)的网络性能,降低通信延迟,提升吞吐效率。 2)网络性能调优与问题解决 解决分布式训练中的复杂网络问题(如 NCCL/MPI 通信瓶颈、带宽利用率低等); 利用自动化工具进行网络资源分配、监控、诊断及性能分析(如延迟/吞吐量分析、端到端链路追踪)。 3)自动化与 CI/CD 实践 构建网络基础设施的 CI/CD 流水线(Infrastructure as Code),实现网络配置的自动化部署与版本管理; 开发自动化脚本与工具,提升网络运维效率与稳定性。 4)全生命周期网络管理 管理端到端网络生命周期(部署、配置、监控、升级),确保网络服务的高可用性与可扩展性; 设计并实施网络监控与告警体系,快速定位并修复潜在故障。 5)跨团队协作与技术落地 与 AI/ML 工程师紧密合作,排查训练/推理流水线中的网络瓶颈,提供针对性优化方案; 深度参与 AI 框架(如 TensorFlow、PyTorch)与底层网络基础设施的适配与性能调优。
1. 技术方案设计方面 a. 负责高性能网络协议栈核心功能的研发,收集和分析业务需求,明确技术方案、目标和交付范围; b. 基于需求完成技术方案设计、UT/IT测试方案设计,带领技术小组完成研发、测试和交付; 2. 技术实现 a. 基于技术方案的拆解,按照任务目标和产出规范,完成任务/子任务的设计、编码开发和系统功能实现; b. 负责核心功能的架构与代码模板的编写,开发与维护系统公用核心模块,技术架构重构、优化等; c. 对编码进行阶段性的讨论和CodeReview,并通过调试优化,推动代码成功部署 d. 对开发中和部署后的程序进行必要的维护和迭代,包括值班oncall、升级工单处置、bug排查、问题诊断、产品体验改善、性能和成本优化等 3. 稳定性和性能优化 a. 制定稳定性策略,寻找并解决产品系统中的潜在风险和瓶颈,覆盖线上疑难杂症问题,确保系统的安全可靠; b. 运用优化技术和创新方法,结合AI等业务场景特点进行通信性能优化,提高产品稳定性和性能; 4. 技术预研 a. 跟踪和了解新的产品技术和趋势,根据业务需要提供新的技术支持和建议。 5. 技术规划 a. 理解业务战略及重点,基于业务需求作出高可用、高可靠、高拓展性的技术架构规划和落地。
本项目旨在针对广域RDMA网络中的传输性能问题,紧密结合AI智算业务流量特征,设计并实现一套易部署的、高效的广域RDMA网络遥测、拥塞控制、传输丢包控制系统与高性能通信库,以提升跨域AI智算服务的性能与稳定性,并为未来广域分布式计算提供技术储备。具体目标如下: 1、建立面向AI智算业务的广域RDMA流量分析模型:深度融合阿里云真实训练/推理业务Trace与广域网遥测数据,刻画业务流量模式与丢包时空特征的关联关系,为机制设计提供数据驱动的依据。扩展实现面向 Scale-across的高精监控系统; 2、设计自适应于业务与网络的拥塞控制、丢包控制机制:针对AI智算业务流量特征与广域网丢包动态性,创新设计结合智能冗余重传与轻量级前向纠错的混合恢复策略和细粒度拥塞控制,实现快速丢包恢复与带宽有效利用率提升; 3、研发纯软件实现高性能长距RDMA传输框架:通过修改用户态RDMA通信库,重构关键接口与功能,将丢包控制机制无缝集成至RDMA软件栈,实现不依赖特定硬件的可部署方案,并验证其对AI智算业务与集合通信性能的提升效果; 4、面向 Scale-up/Scale-out/Scale-across 全场景的高性能通信库优化:针对阿里自研通信库,开展跨场景深度性能剖析,明确不同互联通信域下的性能瓶颈与优化空间。在 Scale-up 域聚焦节点内/近节点低时延通信优化,在 Scale-out 域强化集群间高吞吐传输能力,在 Scale-across 域完善跨域/跨机房通信的稳定性保障。同时探索PD分离场景下KvCache 存储结构与传输的协同优化。通过分层优化策略,实现全场景通信性能与稳定性的系统性提升。
1.通信算子开发:设计和实现大模型训练/推理场景下的高效集合通信算子(AllReduce、AllGather、ReduceScatter、AllToAll等); 2.通信计算融合:设计通信与计算的overlap策略,实现计算通信并行,提升大模型整体训练/推理性能; 3.通信性能调优:针对不同硬件平台(GPU、NPU等)进行算子性能分析和优化,解决性能瓶颈问题; 4.参与AI通信库整体架构设计,制定技术方案和开发规范。