阿里云阿里云智能-高性能网络协议栈研发技术专家-杭州
任职要求
● 5年以上Coding经验,熟练掌握c/c++、python等主流编程语言; ● 精通RDMA网络协议的细节, 了解网络协议在大规模部署时的用法及稳定性的考量,具备RDMA或DPDK等研发经验,有自研RDMA协议栈研发经验者优先; ● 有强烈的自我驱动力,对新技术有求知欲望和自学动力,…
工作职责
1. 技术方案设计方面 a. 负责高性能网络协议栈核心功能的研发,收集和分析业务需求,明确技术方案、目标和交付范围; b. 基于需求完成技术方案设计、UT/IT测试方案设计,带领技术小组完成研发、测试和交付; 2. 技术实现 a. 基于技术方案的拆解,按照任务目标和产出规范,完成任务/子任务的设计、编码开发和系统功能实现; b. 负责核心功能的架构与代码模板的编写,开发与维护系统公用核心模块,技术架构重构、优化等; c. 对编码进行阶段性的讨论和CodeReview,并通过调试优化,推动代码成功部署 d. 对开发中和部署后的程序进行必要的维护和迭代,包括值班oncall、升级工单处置、bug排查、问题诊断、产品体验改善、性能和成本优化等 3. 稳定性和性能优化 a. 制定稳定性策略,寻找并解决产品系统中的潜在风险和瓶颈,覆盖线上疑难杂症问题,确保系统的安全可靠; b. 运用优化技术和创新方法,结合AI等业务场景特点进行通信性能优化,提高产品稳定性和性能; 4. 技术预研 a. 跟踪和了解新的产品技术和趋势,根据业务需要提供新的技术支持和建议。 5. 技术规划 a. 理解业务战略及重点,基于业务需求作出高可用、高可靠、高拓展性的技术架构规划和落地。
1.通信算子开发:设计和实现大模型训练/推理场景下的高效集合通信算子(AllReduce、AllGather、ReduceScatter、AllToAll等); 2.通信计算融合:设计通信与计算的overlap策略,实现计算通信并行,提升大模型整体训练/推理性能; 3.通信性能调优:针对不同硬件平台(GPU、NPU等)进行算子性能分析和优化,解决性能瓶颈问题; 4.参与AI通信库整体架构设计,制定技术方案和开发规范。
1、负责大规模AI训练和推理场景的集合通信库、RDMA协议栈研发和调优; 2、负责大规模存储等通用业务场景的RDMA协议栈、传输通信库及中间件的研发和调优; 3、参与构建Lossy RDMA网络解决方案,并负责相应拥塞控制算法的研发和调优。
1、负责大规模AI训练和推理场景的集合通信库、RDMA协议栈研发和调优; 2、负责大规模存储等通用业务场景的RDMA协议栈、传输通信库及中间件的研发和调优; 3、参与构建Lossy RDMA网络解决方案,并负责相应拥塞控制算法的研发和调优。
1. 智算网络架构设计与演进: 负责千卡/万卡级AI训练集群的网络架构规划与设计,主导基于RoCE v2、Solar/Stellar等高性能网络技术的落地,确保低延迟、高吞吐的网络环境以支撑大模型训练效率; 2. 高性能网络优化: 深入分析分布式训练中的网络瓶颈,通过拥塞控制算法调优、流量调度策略优化、网卡参数微调等手段,极致提升集群线性加速比; 3. 自动化运维体系构建: 设计并实施网络自动化、智能化运维方案,利用AI Agent驱动实现配置管理、故障自愈及性能监控,构建可观测性极强的智能网络运维平台; 4. 前沿技术探索与落地: 跟踪业界最新网络硬件(如1.6Tbps RDMA网卡和DPU)及协议标准(RDMA、PCIe、NVLINK、ETH+等),推动新技术在现网中的验证与规模化部署; 5. 跨部门协同与故障攻坚: 与算法、系统、存储团队紧密协作,解决复杂场景下的网络疑难杂症,保障核心业务99.99%的高可用性。