logo of alibaba

阿里巴巴AI Infra网络平台研发工程师

实习兼职阿里巴巴2027届实习生地点:北京 | 杭州状态:招聘

任职要求


专业领域:
1. 计算机、通信、电子工程或相关专业;
2. 熟练掌握至少一门编程语言(JAVA/C++/Go/Python等),具备良好的代码风格与系统设计能力,熟悉AI coding编程者优先;
3. 熟悉计算机网络基础,理解TCP/IP协议栈、路由交换原理或者数据中心网络架构者优先;
4. 对开源网络、网络协议、大规模分布式系统、容器技术、SONiC等有相关项目经验者优先;
5. 具备较强的问题分析与解决能力,对挑战超大规模系统技术难题充满好奇与激情。

AI能力:
1. 拥抱AI思维:对AI带来的技术变革保持敏锐好奇心,对试用AI提升平台研发、网络In…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


负责 AI Infra 网络基础设施技术及平台研发,包括但不限于以下方向:
1. ALINOS网络操作系统研发:以 SONiC 开源社区为技术底座,深度参与社区演进、持续贡献关键特性;打造高性能、高可靠的自研网络操作系统,深度参与多种交换芯片的适配、eBGP 控制面集群、FRR 协议升级等硬核项目,推动 Ethernet 架构在 AI 场景落地。
2. 广域网(WAN)研发:以“打造全球一流的广域网基础设施”为愿景,通过构建全球网络流量调度系统,打破云、边、端界限,实现云边一体、端网融合;参与广域网支撑与服务平台研发,从建设交付到巡检监控、从主动探测到流量Qos,守护亿万级流量“零故障”;参与下一代光网络设计研发,构建光网络动态路由算法及平台,为AI Scale Across构建大容量、高韧性的光网络底座;基于Agentic AI打造广域网智能经营平台,实现广域网质量、资源及成本自主优化。
3. 网络自动化研发:参与基础网络中海量运行状态与数据的实时监控与管控体系研发,确保高效异常发现定位与迅速执行止血修复,提供海量数据分析和查询,支持日常网络各种运营需求,沉淀自动化和智能化技术平台体系,和运营、架构等团队一起,保障阿里全球网络的稳定、高可靠。
4. DNS平台研发:以微服务、云原生、软硬结合的高性能解析技术为底座,构建支撑十万亿级日请求量的全自研管控与解析平台,为全球业务提供异地多活、毫秒级的极致高可用解析服务;深度参与全链路AIOPS智能运维、DNS运行态数字孪生、AI Native控制台、加密DNS用户态协议栈等硬核项目,通过“DNS+AI”推动DNS从传统基础设施向AI时代智能体资源寻址与服务发现平台演进。
5. 应用网络研发:以云原生网络和高性能转发技术为技术底座,深度参与 K8S 容器网络在智算场景下的演进、自研高性能高可用智算网络管控和公网访问平台;深度参与大规模集群流量调度、IPv6 协议全栈推动、管控面高并发治理等硬核项目,通过智算网络基础设施技术创新推动AI演进。
包括英文材料
Java+
C+++
Go+
Python+
系统设计+
还有更多 •••
相关职位

logo of aliyun
社招5年以上云智能集团

阿里云基础设施网络研发事业部,始终致力于利用前沿的软硬件技术、Agentic AI技术及创新研究,针对复杂业务需求研发下一代网络解决方案,为阿里巴巴集团及全球客户提供强有力的支持。广域网架构与研发团队作为核心引擎,以“打造全球一流的智能广域网基础设施”为愿景,负责设计、建设并运营面向全球的阿里巴巴广域网络。我们正在从传统的网络运维向“AI驱动的广域网络自治”演进,通过构建具备感知、决策与执行能力的智能体,实现网络的高可靠、高可用与极致成本优化。 具体岗位职责 1. Agentic服务平台研发:负责阿里云全球基础网络的Agentic服务化平台架构设计与核心研发,利用LLM大模型与AI Agent技术,构建具备自主规划、工具调用及自我反思能力的网络智能体,实现广域网质量、资源供给及成本经营的自主闭环优化 2. 负责AI网络集群建设交付平台研发,通过自动化与智能化编排技术,实现从资源申请、网络配置到集群上线的全流程高效交付,保障大规模AI网络集群的建设交付性能与稳定性 3. 智能带宽经营与风险运营:负责阿里AI基础网络的智能化带宽经营系统研发,通过数据分析与智能决策,实现带宽资源精细化评估与调配;构建基于AI的风险感知系统,提前识别网络隐患、执行防御策略 4. 全球网络质量保障与QoS管控:负责全球网络质量探测、流量采集与分析系统的智能化升级;研发基于AI的QoS管控机制,根据业务需求与网络状态,调整流量策略,保障AI业务与云产品的网络稳定 5. 基于AI的数据闭环与平台能力建设:构建面向网络运维的数据飞轮,负责海量网络日志、指标与链路数据的处理与分析平台建设,为Agentic系统提供高质量训练数据与实时上下文,提升广域网智能化水平

更新于 2026-06-26北京|杭州
logo of alibaba
实习阿里巴巴2027

在这里,你将面对AI基础设施的核心技术挑战,深度参与阿里AI基础设施的技术演进。通过软硬一体化、智能网络、NFV/SDN、高性能转发等核心技术,为阿里产品的AI智能化升级提供超大规模、超高性能、极致弹性的网络产品服务。你的工作将同时覆盖大模型推理系统优化和Agentic应用基础设施两大前沿领域。 具体的职责包括但不限于: 1.AI推理网络性能优化 ● 负责设计和优化大规模推理系统中GPU集群的高性能网络架构,支持GPU间通信、KV Cache远端访问、分布式存储数据读写等场景,提供极致的网络通信性能。 ● 深入研究和应用RDMA、GPUDirect等技术,优化集体通信(AllReduce、All-to-All)及点对点通信性能,解决大规模并发下的网络拥塞与丢包问题。 ● 开发与调优网络协议栈(如TCP/IP、RDMA、自定义传输协议),结合AI框架(PyTorch/TensorFlow)和集合通信库(NCCL),实现通信与计算的深度融合与流水线并行。 2.Agentic网络基础设施构建 ● 构建高可用、低延迟的AI Agent接入网关,支持海量用户访问AI应用时的负载均衡、流量调度、ingress/egress连接管理,保障服务SLA。 ● 设计与优化接入层协议(如HTTP/3、WebSocket、gRPC),处理Agent交互中的长连接保持、消息路由、安全认证及限流熔断等机制。 ● 协同上层业务团队,针对强化学习(RL)后训练以及AI Agent动态交互特性(如容器/Sandbox资源构建、工具调用、多轮对话等)进行端到端网络性能分析与瓶颈突破,包括网络管控链路和数据转发链路。

更新于 2026-04-02北京|杭州
logo of alibaba
实习阿里巴巴2027

在这里,你将成为大模型技术落地的“硬核引擎缔造者”。你将参与构建 AI Infra计算基础设施过程,通过软硬件协同优化技术,近距离与大模型设计者协同设计,通过网络计算融合、网络存储融合、异构计算加速等软硬件结合优化技术,让每一个GPU发挥出极致性能,让大模型在训练、推理、调度全链路中的表现出卓越性能。你的代码将直接决定大模型训练的效率、推理的响应速度以及集群资源的利用率,为 AI 时代的算力底座注入核心动力。 1. 基于FPGA/ASIC芯片的设计与开发: •负责FPGA/ASIC芯片的RTL设计与验证,包括C-Model、算法映射、硬件架构设计和性能调优; •开发硬件抽象层(HAL)和相关工具链,支持硬件加速器与上层软件的无缝集成; •参与硬件加速器及系统仿真模型的开发和调试。 2. 软硬件结合技术开发和优化: •研发基于FPGA、ASIC等硬件的计算平台,实现高性能网络加速,网络与计算加速,网络与存储加速等开发优化,提升AI训练和推理等业务的计算性能; •基于自研芯片,加速计算与计算之间,计算与存储之间,计算云服务之间的高性能,低延时互联,实现AI和通用计算的超节点高效互联。 3. 操作系统与固件开发: •优化Linux内核、设备驱动和固件,发挥硬件的极致性能,提升硬件资源利用率; •开发针对特定硬件的定制化操作系统模块,满足高性能计算、高性能网络需求。

更新于 2026-04-02杭州
logo of aliyun
社招5年以上云智能集团

1、负责设计和优化大规模AI智算推理系统中GPU集群的高性能云网络架构,负责vpc网络中RDMA、GPUDirect、高性能网络协议栈等技术研发,提供GPU之间以及GPU访问KVcache的高吞吐、低延时网络。 2、负责AI agent场景中容器网络的设计研发,提供极致弹性的vpc网络,满足AI agent对容器的应用需求。 3、负责DPU、可编程硬件中vpc网络功能研发, 支持新型AI智算实例在阿里云的全面部署和运营。 4、探索下一代云网络分布式网关架构,打造超大规模的vpc网络。

更新于 2026-06-25杭州