
智能互联智能引擎-大模型推理系统工程师-LLM
社招全职3年以上技术类-开发地点:北京 | 杭州状态:招聘
任职要求
1. 对 AI 算法和 AI 系统工程(如迭代模式、端到端系统设计、工程框架、性能建模等)有比较深刻的理解,至少熟练掌握一种常见深度学习框架。 2. 理解异构计算和软硬件结合优化,在性能优化方面有一定经验。理解 cutlass 和…
登录查看完整任职要求
微信扫码,1秒登录
工作职责
本岗位隶属于我们是阿里巴巴大模型推理团队,负责生成式 AI 领域(主要是图像生成和LLM)的内部产品、训练推理服务系统建设和维护,为淘宝、天猫、聚划算、优酷、闲鱼等多个集团业务部门提供强有力的技术支撑和底层服务能力。 主要工作内容如下: 1. 负责设计开发高性能大模型推理引擎;结合流量调度、并行、Cache 等方法构建大规模分布式模型服务系统。 2. 融合业界前沿的算法工程理论,基于量化、动态剪枝等有损方法进行极致的模型加速和成本优化。 3. 结合数据、算法和工程,协同构建 AI Infra 平台,为生成式 AI 提供端到端解决方案,推动业务创新与实践应用。
包括英文材料
算法+
https://roadmap.sh/datastructures-and-algorithms
Step by step guide to learn Data Structures and Algorithms in 2025
https://www.hellointerview.com/learn/code
A visual guide to the most important patterns and approaches for the coding interview.
https://www.w3schools.com/dsa/
深度学习+
https://d2l.ai/
Interactive deep learning book with code, math, and discussions.
还有更多 •••
相关职位
社招2年以上
面向大模型在线推理场景,建设高性能、低成本、高可靠的推理加速基础设施,支撑高并发、大规模模型服务。 你将参与以下工作: 1. 设计和研发 KV Cache 存储、复用、调度与加速系统,优化 Prefill/Decode 阶段的缓存管理与资源利用率。 2. 协同 GPU 显存、主存、SSD 及远端存储等多级资源,优化 KV Cache 换入换出、跨节点迁移、共享复用和生命周期管理。 3. 优化首 Token 延迟、端到端时延、推理吞吐和集群资源成本,提升大模型服务的稳定性与弹性能力。 4. 分析并解决推理服务在线上的性能瓶颈、显存碎片、长尾延迟和稳定性问题,持续推动系统架构演进。
更新于 2026-07-17北京

社招3年以上
我们是阿里巴巴大模型推理团队,负责内部 LLM/AIGC 百炼推理服务建设,为淘宝、天猫、聚划算、优酷、闲鱼等多个集团业务部门提供强有力的技术支撑和底层服务能力。 AI 高性能计算工程师负责探索不同AI芯片(NV,AMD, 华为昇腾, TPU, 寒武纪等)的底层架构,使用硬件手写原生 Kernel、 Trition/Tilelang 编译优化等手段,解决“从0到1”(跑通)和“从1到N”(跑得快)的关键问题。
更新于 2026-04-08北京|杭州|上海
社招3年以上技术-基础平台
通过技术创新支持阿里集团大模型研发快速迭代,主要工作内容和挑战如下: 1. 建设大规模强化学习的环境平台,增强大模型对齐Coding&Agentic等方面的能力。 2. 结合强化学习框架,优化强化学习效率,实现高效的大规模强化学习训练。 3. 建设覆盖各个领域场景的真实和仿真环境,支持大规模评测和Agentic后训练。 4. 将成熟的系统与算法成果发表于学术会议,并回馈开源社区(如 ROCK和ROLL等),持续提升在学术界与产业界的影响力。
更新于 2026-06-16北京|杭州