logo of alibaba

阿里巴巴AI推理平台-AIGC推理基础设施研发工程师-北京/杭州

社招全职3年以上地点:北京 | 杭州状态:招聘

工作描述


任职要求
1. 计算机、软件工程、人工智能等相关专业,熟练使用 Python;具备 C++CUDARust 等开发经验者优先。
2. 具备 2 年及以上 AI Infra、模型推理、分布式系统或 GPU 服务相关经验,熟悉 PyTorch 及其分布式执行机制。
3. 熟悉多机多卡系统中的进程组、集合通信、显存管理和并行计算,有 FSDP、TP、SP、EP、PP 等多种并行方案的实践经验。
4. 具备良好的系统设计和抽象能力,能够从单模型需求中识别共性问题,设计可扩展、可观测、可灰度和可回滚的平台能力。
5. 有责任心和结果意识,具备良好的沟通、执行与跨团队协作能力,能够推动复杂技术方案从设计、验证走向生产落地。
加分项
● 有图像、视频生成、Diffusion 或 DiT 模型服务经验。
● 熟悉 Diffusers、xDiT、vLLM、SGLang 或其他推理…
登录查看完整工作描述
微信扫码,1秒登录

包括英文材料
Python+
C+++
CUDA+
Rust+
分布式系统+
PyTorch+
FSDP+
还有更多 •••
相关职位

logo of alibaba
社招2年以上技术类-开发

● 在生成模型、推理优化或高性能计算相关方向具备扎实积累 ● 对 LLM 或 AIGC 模型推理过程有较深入理解,具备相关优化实践经验 ● 具备良好的算法分析能力和工程实现能力,能够独立推动方案设计与

更新于 2026-08-12北京|杭州
logo of aligenie
社招4年以上

1. 扎实的系统编程能力,可选精通 C++/Python/Rust,熟悉高性能并发编程与内存管理。 2. 深入理解 KVCache 相关技术,PagedAttention / vAttention 等

更新于 2026-06-16北京|杭州
logo of aligenie
社招4年以上

1. 扎实的后端系统开发能力,熟悉 C++/Go/Python 中至少一种,熟悉高并发服务、分布式系统、RPC、异步编程、缓存系统与资源调度系统设计。 2. 熟悉分布式资源管控或调度系统,理解多租户隔

更新于 2026-06-16北京|杭州
logo of alibaba
社招4年以上技术类-开发

1. 必备技能 (1)扎实的 C++/Python 编程功底,具备模块化设计能力。 (2)大模型推理框架(vLLM/SGLang等)经验,理解模型推理原理。 (3)分布式系统开发经验,熟悉缓存、微服务

更新于 2026-08-07北京|杭州