腾讯技术研究-高性能计算方向(青云计划)
任职要求
1、扎实的计算机体系结构基础,熟悉并行计算、数据密集型系统设计; 2、良好的数学基础(线性代数、数值分析、算法复杂度优化)。 加分项 1、有TensorRT/Triton Inference Se…
工作职责
包含GPU、网络、大模型框架等细分方向。 1、针对业务需求,解决算力瓶颈、通信延迟、分布式系统扩展性等问题; 2、协同算法、硬件及运维团队,构建高效、稳定的计算基础设施。 1)GPU方向:研究GPU集群的调度策略,优化资源利用率。探索混合精度计算、模型量化等GPU加速技术; 2)网络方向:设计低延迟、高吞吐的分布式网络架构(如InfiniBand/RoCE/DPU)。优化MPI、NCCL等通信库性能,解决大规模集群中的网络拥塞问题; 3)大模型工程框架方向:开发或优化大模型训练框架(如PyTorch/TensorFlow/DeepSpeed/Megatron-LM),设计分布式训练策略(模型并行、流水线并行、混合并行),提升千亿级参数模型的训练效率。研究训练加速技术(梯度压缩、显存优化、动态计算图调度)。
包含GPU、网络、大模型框架等细分方向。 1、针对业务需求,解决算力瓶颈、通信延迟、分布式系统扩展性等问题; 2、协同算法、硬件及运维团队,构建高效、稳定的计算基础设施。 1)GPU方向:研究GPU集群的调度策略,优化资源利用率。探索混合精度计算、模型量化等GPU加速技术; 2)网络方向:设计低延迟、高吞吐的分布式网络架构(如InfiniBand/RoCE/DPU)。优化MPI、NCCL等通信库性能,解决大规模集群中的网络拥塞问题; 3)大模型工程框架方向:开发或优化大模型训练框架(如PyTorch/TensorFlow/DeepSpeed/Megatron-LM),设计分布式训练策略(模型并行、流水线并行、混合并行),提升千亿级参数模型的训练效率。研究训练加速技术(梯度压缩、显存优化、动态计算图调度)。
包含GPU、网络、大模型框架等细分方向。 1、针对业务需求,解决算力瓶颈、通信延迟、分布式系统扩展性等问题; 2、协同算法、硬件及运维团队,构建高效、稳定的计算基础设施。 1)GPU方向:研究GPU集群的调度策略,优化资源利用率。探索混合精度计算、模型量化等GPU加速技术; 2)网络方向:设计低延迟、高吞吐的分布式网络架构(如InfiniBand/RoCE/DPU)。优化MPI、NCCL等通信库性能,解决大规模集群中的网络拥塞问题; 3)大模型工程框架方向:开发或优化大模型训练框架(如PyTorch/TensorFlow/DeepSpeed/Megatron-LM),设计分布式训练策略(模型并行、流水线并行、混合并行),提升千亿级参数模型的训练效率。研究训练加速技术(梯度压缩、显存优化、动态计算图调度)。
包含GPU、网络、大模型框架等细分方向。 1、针对业务需求,解决算力瓶颈、通信延迟、分布式系统扩展性等问题; 2、协同算法、硬件及运维团队,构建高效、稳定的计算基础设施。 1)GPU方向:研究GPU集群的调度策略,优化资源利用率。探索混合精度计算、模型量化等GPU加速技术; 2)网络方向:设计低延迟、高吞吐的分布式网络架构(如InfiniBand/RoCE/DPU)。优化MPI、NCCL等通信库性能,解决大规模集群中的网络拥塞问题; 3)大模型工程框架方向:开发或优化大模型训练框架(如PyTorch/TensorFlow/DeepSpeed/Megatron-LM),设计分布式训练策略(模型并行、流水线并行、混合并行),提升千亿级参数模型的训练效率。研究训练加速技术(梯度压缩、显存优化、动态计算图调度)。
本项目旨在针对广域RDMA网络中的传输性能问题,紧密结合AI智算业务流量特征,设计并实现一套易部署的、高效的广域RDMA网络遥测、拥塞控制、传输丢包控制系统与高性能通信库,以提升跨域AI智算服务的性能与稳定性,并为未来广域分布式计算提供技术储备。具体目标如下: 1、建立面向AI智算业务的广域RDMA流量分析模型:深度融合阿里云真实训练/推理业务Trace与广域网遥测数据,刻画业务流量模式与丢包时空特征的关联关系,为机制设计提供数据驱动的依据。扩展实现面向 Scale-across的高精监控系统; 2、设计自适应于业务与网络的拥塞控制、丢包控制机制:针对AI智算业务流量特征与广域网丢包动态性,创新设计结合智能冗余重传与轻量级前向纠错的混合恢复策略和细粒度拥塞控制,实现快速丢包恢复与带宽有效利用率提升; 3、研发纯软件实现高性能长距RDMA传输框架:通过修改用户态RDMA通信库,重构关键接口与功能,将丢包控制机制无缝集成至RDMA软件栈,实现不依赖特定硬件的可部署方案,并验证其对AI智算业务与集合通信性能的提升效果; 4、面向 Scale-up/Scale-out/Scale-across 全场景的高性能通信库优化:针对阿里自研通信库,开展跨场景深度性能剖析,明确不同互联通信域下的性能瓶颈与优化空间。在 Scale-up 域聚焦节点内/近节点低时延通信优化,在 Scale-out 域强化集群间高吞吐传输能力,在 Scale-across 域完善跨域/跨机房通信的稳定性保障。同时探索PD分离场景下KvCache 存储结构与传输的协同优化。通过分层优化策略,实现全场景通信性能与稳定性的系统性提升。