logo of kuaishou

快手高性能网络研发工程师

社招全职1-3年J0012地点:北京状态:招聘

任职要求


1、有网络研发相关工作经验;
2、牢固的数据结构算法、操作系统、计算机网络等方面基础知识储备;
3、良好的团队协作和沟通能力,强烈的自驱意识;
4、有如下一个或多个领域经验:
- AI训练场景集合通…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


1、负责大规模AI训练和推理场景的集合通信库、RDMA协议栈研发和调优;
2、负责大规模存储等通用业务场景的RDMA协议栈、传输通信库及中间件的研发和调优;
3、参与构建Lossy RDMA网络解决方案,并负责相应拥塞控制算法的研发和调优。
包括英文材料
数据结构+
算法+
相关职位

logo of kuaishou
社招3-5年D13365

1、负责大规模AI训练和推理场景的集合通信库、RDMA协议栈研发和调优; 2、负责大规模存储等通用业务场景的RDMA协议栈、传输通信库及中间件的研发和调优; 3、参与构建Lossy RDMA网络解决方案,并负责相应拥塞控制算法的研发和调优。

更新于 2025-11-28北京
logo of alibaba
实习阿里巴巴2027

1. 智算网络架构设计与演进: 负责千卡/万卡级AI训练集群的网络架构规划与设计,主导基于RoCE v2、Solar/Stellar等高性能网络技术的落地,确保低延迟、高吞吐的网络环境以支撑大模型训练效率; 2. 高性能网络优化: 深入分析分布式训练中的网络瓶颈,通过拥塞控制算法调优、流量调度策略优化、网卡参数微调等手段,极致提升集群线性加速比; 3. 自动化运维体系构建: 设计并实施网络自动化、智能化运维方案,利用AI Agent驱动实现配置管理、故障自愈及性能监控,构建可观测性极强的智能网络运维平台; 4. 前沿技术探索与落地: 跟踪业界最新网络硬件(如1.6Tbps RDMA网卡和DPU)及协议标准(RDMA、PCIe、NVLINK、ETH+等),推动新技术在现网中的验证与规模化部署; 5. 跨部门协同与故障攻坚: 与算法、系统、存储团队紧密协作,解决复杂场景下的网络疑难杂症,保障核心业务99.99%的高可用性。

更新于 2026-04-01北京|杭州
logo of tencent
社招5年以上腾讯云技术

1.负责计算集群的高性能RDMA网络系统软件开发和建设工作,构建业界领先的集群高性能RDMA网络性能和稳定性; 2.负责业界大模型训练的主流加速框架(如DeepSpeed、Megatron-LM)与云平台底层技术特点和优势结合,通过自研高性能RDMA网络技术进行持续优化; 3.跟踪业界最新AI基础设施和互联网络通信技术建设情况,包括scale up&out网络,持续打造自研产品竞争力。

更新于 2026-06-11上海
logo of tencent
社招3年以上TEG技术

1.通信算子开发:设计和实现大模型训练/推理场景下的高效集合通信算子(AllReduce、AllGather、ReduceScatter、AllToAll等); 2.通信计算融合:设计通信与计算的overlap策略,实现计算通信并行,提升大模型整体训练/推理性能; 3.通信性能调优:针对不同硬件平台(GPU、NPU等)进行算子性能分析和优化,解决性能瓶颈问题; 4.参与AI通信库整体架构设计,制定技术方案和开发规范。

更新于 2026-06-24深圳