logo of aliyun

阿里云阿里云智能-高性能网络研发专家-杭州

社招全职5年以上云智能集团地点:杭州状态:招聘

任职要求


1、有过大模型训练稳定性相关开发或者运维经验者优先,如大模型训练的故障定位,性能定位经验;
2、对RDMA网络、NCCL/DeepEP通信库有开发经验或者调优经验的优先;
3、对大模型训练和推理框架熟悉,有分布式训练推理集合通信性能优化经验,或者kv cache通信优化经验、或者计算通信overlapping经验者优先;
3、有强烈技术热情和好奇心,自…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


1、为阿里大模型训练和推理业务提供稳定性支持,包括问题定位,稳定性系统设计和研发等;
2、为阿里大模型训练和推理业务提供高性能的通信保障,包括问题定位、性能分析、性能优化等。
包括英文材料
大模型+
还有更多 •••
相关职位

logo of aliyun
社招5年以上云智能集团

1、负责AI智算场景VPC网络接入,低时延高吞吐的高速网络技术研发,以及在计算/存储/AI/机器学习/推荐等公司关键业务上的应用; 2、应用VPC高性能网络技术到虚拟机和容器网络,加速网络虚拟化场景; 3、通过DPU、可编程硬件等, 推动高性能VPC技术在阿里云智算场景的大规模部署; 4、通过技术创新推动VPC网络技术的持续演进,打造下一代的超低时延高速VPC网络; 5、探索下一代分布式网关架构,打造超大规模的VPC网络。

更新于 2026-01-09杭州
logo of aliyun
社招5年以上云智能集团

1、负责AI智算场景VPC网络接入,低时延高吞吐的高速网络技术研发,以及在计算/存储/AI/机器学习/推荐等公司关键业务上的应用; 2、应用VPC高性能网络技术到虚拟机和容器网络,加速网络虚拟化场景; 3、通过DPU、可编程硬件等, 推动高性能VPC技术在阿里云智算场景的大规模部署; 4、通过技术创新推动VPC网络技术的持续演进,打造下一代的超低时延高速VPC网络; 5、探索下一代分布式网关架构,打造超大规模的VPC网络。

更新于 2026-03-26杭州
logo of aliyun
社招5年以上云智能集团

1、负责设计和优化大规模AI智算推理系统中GPU集群的高性能云网络架构,负责vpc网络中RDMA、GPUDirect、高性能网络协议栈等技术研发,提供GPU之间以及GPU访问KVcache的高吞吐、低延时网络。 2、负责AI agent场景中容器网络的设计研发,提供极致弹性的vpc网络,满足AI agent对容器的应用需求。 3、负责DPU、可编程硬件中vpc网络功能研发, 支持新型AI智算实例在阿里云的全面部署和运营。 4、探索下一代云网络分布式网关架构,打造超大规模的vpc网络。

更新于 2026-06-25杭州
logo of aliyun
社招5年以上云智能集团

1. 存储和 AI infra 研发,开发和调优高性能通信框架,包括多线程任务调度、零拷贝内存管理、多协议自适应 RPC 等,聚焦云存储(EBS/OSS/DFS/CPFS)与 AI 智算场景的网络基础设施,主导下一代高效稳定的存储网络技术体系构建。 2. 主导 DPDK 和 RDMA 技术栈的深度优化和落地,在不同业务的不同网卡&交换机环境中,进行网络库的适配、集成、性能调优,突破单机业务吞吐瓶颈,降低平均和长尾延迟。 3. 开发基于 BF3 的智算网络加速方案,实现高带宽低延迟大规模 AI 数据流处理。 4. 参与建设网络框架监控、智能运维体系,在保障网络高性能的同时,兼顾可控、可靠、可视化。

更新于 2025-11-23杭州