logo of alibaba

阿里巴巴研究型实习生 - LLM推理中的KVCache优化技术研究和应用

实习兼职阿里巴巴研究型实习生地点:杭州状态:招聘

任职要求


1. 计算机或相关方向博士、硕士在读。扎实的工程能力,优良的编程风格,熟悉C++/Go/Python等1至2种语言;
2. 熟悉大模型推理技术,熟悉至少一种推理引擎。熟悉分布式缓存/存储系统;
3. 完成原型系统开发,相关技术经过验证,具有效果,具备合入产品的要求;同时具备清晰…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


当前大语言模型(LLM)推理的快速发展推高了算力需求,推理过程中的 KVCache 技术所需的巨大显存消耗成为显著瓶颈。
目前亟需围绕KVCache的核心竞争力开展技术攻关,解决分级存储效率、动态调度策略、多级缓存协同等关键问题,以形成差异化的技术壁垒。

基于以上背景,本项目期望聚焦如下技术问题的研究:
1.面向大模型推理KVCache场景的分级(显存/内存/存储)缓存池及其多租SLO保障应用;
2.KVCache缓存池的冷热数据分层和压缩等技术应用研究;
3.面向大模型推理的KVCache效果的仿真和模拟量化研究;
4.结合KVCache的AI融合记忆存储系技术研究。
包括英文材料
C+++
Go+
Python+
还有更多 •••
相关职位

logo of alibaba
实习阿里巴巴研究型实

专注于超大规模分布式LLM推理系统的研究、探索和开发,具体职责包括: 1、探索高性能的、可扩展的分布式LLM推理引擎,支持超大规模LLM的高效部署; 2、深入优化高性能算子、运行时、分布式策略等,打造业界领先的LLM推理引擎; 3、分析现有引擎和典型负载的性能瓶颈,提出并实现创新的优化技术; 4、结合阿里云PAI平台产品服务,提供可靠高效的引擎技术方案,支持客户加速模型推理; 5、针对LLM重点场景构建业界领先的优化解决方案。

更新于 2026-03-17北京|上海
logo of alibaba
实习阿里巴巴研究型实

该职位专注于分布式大语言模型 (LLM) 推理系统的底层基础设施研究与探索,包括GPU和RDMA等。主要职责包括: 探索高性能、可扩展的分布式LLM推理引擎,以支持分布式LLM的高效部署; 基于KVCache,对大模型框架进行深入优化; 分析现有推理框架的性能瓶颈,提出并实施创新的优化技术; 参与与大模型相关的开源项目,如mooncake、vllm等。

更新于 2026-03-17北京|杭州|上海
logo of tongyi
实习通义研究型实习生

阿里巴巴通义实验室-对话智能团队 以大模型对话技术为核心,研究及应用方向包括智能客服、个性化对话、角色扮演、分身复刻、社交智能、数字人等,主要业务场景包括: (1) 通义晓蜜—阿里云智能客服,国内对话式AI市占率第一; (2) 通义星尘-类人智能体创作平台。2020年以来,围绕预训练、对话智能、大模型等方向发表80+篇国际顶会论文,欢迎对大模型感兴趣的你加入我们,一起创造人机对话的未来。 拟研究技术方向: 1. 角色扮演技术(Role-Playing Agent)的研究,在相关性、人设一致性、吸引力、情感、道德等维度取得显著提升; 2. 分身复刻(Character AI)的研究,探索角色所处虚拟世界建模与演化; 3. 数字专家的研究,包括用户心理推断、策略搜索推理等技术; 4. 多模态Character模型的研究,包括语音端到端角色对话模型。

更新于 2026-05-28北京|杭州
logo of alibaba
实习阿里巴巴研究型实

随着模型尺寸和数据规模的持续扩大,预训练任务已成为AI研究和发展中最为资源密集的环节之一。本项目旨在深入的理解预训练任务的workload特点,定位性能瓶颈,并进行优化从而降低预训练任务的成本开销。例如从Pipeline,显存,通信优化等方面优化MoE大规模训练任务的吞吐,支持包括通义实验室等领域方向。

更新于 2026-03-17北京|杭州