腾讯大模型推理性能优化工程师
任职要求
1.精通TensorFlow、PyTorch等主流深度学习框架,具备扎实的模型训练、调优及线上部署实践经验; 2.精通C/C++,精通常用数据结构与算法; 3.熟练掌握高性能计算优化技术,深入理解计算机体系结构,熟悉并行计算优化、访存优化,低比特计算等; 4.熟悉大模型推理框架(如vLLM/SGL…
工作职责
1.负责开发和优化TTS,LLM,VLM等大模型推理引擎; 2.与大模型算法同学深度合作,联合优化,打造行业领先的高性能推理引擎; 3.跟进机器学习前沿技术,将合适成果落地于实际应用。
1、分布式推理架构的研发,包括多机推理架构设计,P/D分离、A/F分离、VL模型分离架构的落地; 2、推理引擎服务化,包括推理引擎如何接入线上服务平台,自动扩缩容和可观测性的适配,以及提升线上服务稳定性; 3、多模态模型的推理功能开发和性能优化,包括对Qwen-VL、Qwen-Audio、Qwen-Omni等多模态输入/输出模型的功能支持和推理性能优化; 4、分布式 KV Cache Store 的设计与研发,构建高吞吐、低延迟的全局 KV Cache 池化管理机制,实现跨计算节点(显存/内存)的高效数据传输与共享。
面向大模型在高并发、低延迟、低成本生产环境中的规模化落地,本课题聚焦下一代大模型推理加速关键技术,探索从模型架构、算法创新、硬件协同到集群系统的全链路优化方法,突破当前大模型推理在计算效率、显存占用、通信开销和系统稳定性等方面的瓶颈。 1. 探索面向推理友好的高效模型架构演进方法,结合后训练技术,研究 Attention、MoE、长上下文、KV Cache 等核心结构的推理效率优化,在保证模型效果的前提下提升吞吐、降低时延与部署成本。 2. 探索具有突破性的推理算法优化方案,围绕低比特量化、投机解码、稀疏注意力、LLM/Diffusion蒸馏等方向,以算法的角度持续突破并降低推理代价。 3. 探索面向新型硬件的推理加速技术,结合 GPU/NPU、异构算力单元、存算协同、算子融合和内存访问优化等能力,提升大模型推理在不同硬件平台上的执行效率。 4. 探索大流量集群推理系统的加速方案,结合网络通信、异构算力调度、请求路由、动态批处理等技术,提升推理系统在复杂业务场景下的效率、稳定性与鲁棒性。
大模型推理的成本与效率是行业核心挑战,而 KV Cache 管理是突破瓶颈的关键。本岗位将主导构建下一代 LLM 推理存储架构,融合算法优化、系统调度与硬件感知能力,打造高弹性、低成本、高可用的推理基础设施,支撑公司核心大模型业务的规模化落地。 1. 负责设计和实现面向大规模推理的存储系统,深度融合推理引擎,构建从显存、本地内存至分布式冷存储的全局多级存储池; 2. 基于特征识别实现数据的智能调度与分布管理,推动计算存储分离、弹性资源池等核心能力落地,建立高扩展、高可靠的推理存储系统底座; 3. 定义存储与推理引擎间的统一数据访问抽象层,通过零侵入式接口设计实现计算存储解耦,为多级缓存、预取调度等高级策略提供标准化支撑; 4. 建立 KV Cache 资源评估与治理体系,通过数据驱动的方式识别优化空间,在保障服务品质的前提下持续降低推理成本、提升资源 ROI; 5. 联合上下游团队,深入 KV Cache 全栈优化和技术攻关,建立端到端 KV Cache 系统; 6. 跟踪学术界与工业界 KV Cache 最新进展,推动量化、压缩、调度等创新技术在大规模生产环境中的落地。
1、参与大模型推理引擎(基于 SGLang 框架)的设计与核心模块开发,支持 Transformer、MoE、DiffusionLLM 等多种架构及 LLM/VLM 等模型的高性能推理; 2、运用低比特量化、投机采样、稀疏计算、分布式推理等技术,加速大模型推理速度并降低部署成本, 并优化其稳定性、易用性; 3、针对 GPU/AI 芯片架构(含自研硬件),开展针对性性能调优,优化算子、内存管理、KV Cache 管理等核心模块; 4、与算法、产品及业务团队协作,推动不同模型场景下的系统端到端性能优化; 5、关注并引入前沿大模型推理技术,参与 SGLang 及相关开源生态的维护与贡献。