logo of alibaba

阿里巴巴AI Infra高性能网络研发工程师

实习兼职阿里巴巴2027届实习生地点:北京 | 杭州状态:招聘

任职要求


专业领域:
1.  计算机、通信、电子工程等相关专业; 
2. 专业能力: 有ACM/NOI/IOI等编程大赛获奖经历者优先,有主导开源项目(star > 1K)经验者优先,有CCF-A类会议和期刊论文者优先;
3. 专业经验: 有大型数据中心网络建设运维经验,有RDMA协议设计经验,或有NCCL/DeepEP/MPI等通信库研发经验者优先;
4. 技术深度:
    精通集合通信原理,精通CUDA编程,有AllReduce、All2All、Allgather等集合通信算子开发经验;
    精通TCP/IP协议栈,深刻理解RDMA (RoCE v2)、PFC、ECN、DCQCN等流控与拥塞控制机制;
    熟悉主流网络设备(如NVIDIA/Mellanox, Broadcom等)的架构与配置;
    具备扎实的编程能力(Python/Go/C++),有网络自动化开发或内核网络栈修改经验者极佳。
5. 问题解决: 具备极强的逻…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


1. 智算网络架构设计与演进: 负责千卡/万卡级AI训练集群的网络架构规划与设计,主导基于RoCE v2、Solar/Stellar等高性能网络技术的落地,确保低延迟、高吞吐的网络环境以支撑大模型训练效率;
2. 高性能网络优化: 深入分析分布式训练中的网络瓶颈,通过拥塞控制算法调优、流量调度策略优化、网卡参数微调等手段,极致提升集群线性加速比;
3. 自动化运维体系构建: 设计并实施网络自动化、智能化运维方案,利用AI Agent驱动实现配置管理、故障自愈及性能监控,构建可观测性极强的智能网络运维平台;
4. 前沿技术探索与落地: 跟踪业界最新网络硬件(如1.6Tbps RDMA网卡和DPU)及协议标准(RDMA、PCIe、NVLINK、ETH+等),推动新技术在现网中的验证与规模化部署;
5. 跨部门协同与故障攻坚: 与算法、系统、存储团队紧密协作,解决复杂场景下的网络疑难杂症,保障核心业务99.99%的高可用性。
包括英文材料
NCCL+
Message Passing Interface+
CUDA+
TCP/IP+
Python+
Go+
还有更多 •••
相关职位

logo of 58
实习技术类

Agent开发平台研发

更新于 2026-04-22北京
logo of 58
实习技术类

容器云:docker、k8s方向

更新于 2026-04-22北京
logo of 58
实习技术类

KV、对象、分布式文件系统方向

更新于 2026-04-22北京
logo of 58
实习技术类

大模型训练与高效推理

更新于 2026-04-22北京