阿里云阿里云智能-高性能网络资深架构师-北京/杭州
任职要求
• 10年以上网络、云计算架构设计和开发相关工作经验
• 至少负责过1个有较强行业影响力的产品或技术突破,是核心的技术模块负责人
• 曾负责或主导过大型网络产品的设计,或研发,或市场的工作,负责的产品具有一定规模,并且在业界具备一定影响力
• 2年以上团队管理经验;同时推动多个复杂项目
• 能够支撑组织大型项目和战略目标的完成,并与组织内其他专业角色完成战役目标/策略的设定和共识
• 基于业务价值判断,阐述清晰方案取舍的思考,带领大家目标理解一致、路径达成共识
• 熟悉集团内外部以及业界在本领域的技术水平及发展动态,明确知晓集团技术水平与行业方案的差距
• 对竞对和对标产品的核心技术指标、优劣势对比了如指掌,并通过建立对标机制…工作职责
1. 主导RDMA高性能网络架构设计:
设计并优化万卡级RDMA网络协议、拓扑,流控技术,支持AllReduce、All-to-All等通信模式,保障吞吐率>90%。
联动PyTorch、NCCL等框架,通过RDMA配置、内存注册策略降低CPU干预,提升训练效率。
2. 构建全栈可观测性与智能运维:
开发覆盖NIC、交换机、内核层的监控体系,结合ML模型预测拥塞风险,实现故障分钟级定位与恢复。
制定拥塞控制算法参数、NUMA绑定等跨平台部署规范,确保异构芯片/多云环境下的网络一致性。
3. 推动技术标准化与生态兼容:
主导RDMA网络协议栈(Verbs API、拥塞控制算法,多路径传输协议)的定制化开发,优化驱动与固件性能。
评估UCX、eRPC、xLink over ethernet等新技术,制定下一代AI网络演进路线。
4、技术规划
• 理解业务战略及重点,基于业务需求作出高可用、高可靠、高拓展性的技术架构规划和落地。1.通信算子开发:设计和实现大模型训练/推理场景下的高效集合通信算子(AllReduce、AllGather、ReduceScatter、AllToAll等); 2.通信计算融合:设计通信与计算的overlap策略,实现计算通信并行,提升大模型整体训练/推理性能; 3.通信性能调优:针对不同硬件平台(GPU、NPU等)进行算子性能分析和优化,解决性能瓶颈问题; 4.参与AI通信库整体架构设计,制定技术方案和开发规范。
1、负责大规模AI训练和推理场景的集合通信库、RDMA协议栈研发和调优; 2、负责大规模存储等通用业务场景的RDMA协议栈、传输通信库及中间件的研发和调优; 3、参与构建Lossy RDMA网络解决方案,并负责相应拥塞控制算法的研发和调优。
1、负责大规模AI训练和推理场景的集合通信库、RDMA协议栈研发和调优; 2、负责大规模存储等通用业务场景的RDMA协议栈、传输通信库及中间件的研发和调优; 3、参与构建Lossy RDMA网络解决方案,并负责相应拥塞控制算法的研发和调优。
1. 智算网络架构设计与演进: 负责千卡/万卡级AI训练集群的网络架构规划与设计,主导基于RoCE v2、Solar/Stellar等高性能网络技术的落地,确保低延迟、高吞吐的网络环境以支撑大模型训练效率; 2. 高性能网络优化: 深入分析分布式训练中的网络瓶颈,通过拥塞控制算法调优、流量调度策略优化、网卡参数微调等手段,极致提升集群线性加速比; 3. 自动化运维体系构建: 设计并实施网络自动化、智能化运维方案,利用AI Agent驱动实现配置管理、故障自愈及性能监控,构建可观测性极强的智能网络运维平台; 4. 前沿技术探索与落地: 跟踪业界最新网络硬件(如1.6Tbps RDMA网卡和DPU)及协议标准(RDMA、PCIe、NVLINK、ETH+等),推动新技术在现网中的验证与规模化部署; 5. 跨部门协同与故障攻坚: 与算法、系统、存储团队紧密协作,解决复杂场景下的网络疑难杂症,保障核心业务99.99%的高可用性。