米哈游AI 推理性能优化工程师
任职要求
1. 有 2 年以上 AI 推理部署、模型性能优化、GPU/NPU 适配或高性能计算相关经验。 2. 熟悉至少 2 种推理引擎或框架,如 TensorRT、vLLM、Triton、SGLang、TensorRT-LLM、ONNX Runtime 等。 3. 熟悉 NVIDIA GPU 生态,包括 CUDA、cuDNN、TensorRT、NCCL,了解 A100、H100、B200 等架构差异。 4. 了解 AMD ROCm 或国产 NPU/GPU 生态,如昇腾、寒武纪、燧原、摩尔线程等,有实际适配经验优先。 5. 熟悉大模型、扩散模型、多模态模型的推理链路,有模型部署、量化、并行推理或性能调优经验。 6. 熟…
工作职责
1. 负责 LLM、CV、语音、多模态等模型在不同 GPU/NPU 硬件上的推理性能测试、调优和适配。 2. 负责 NVIDIA、AMD、国产卡等多硬件平台的 Benchmark 测试,输出模型、硬件、推理引擎维度的性能对比和选型建议。 3. 基于 TensorRT、vLLM、Triton、SGLang、TensorRT-LLM 等推理引擎,开展吞吐、时延、显存、Batch、KV Cache、并行策略等优化。 4. 基于 FLOPs、显存、带宽、Batch Size、Sequence Length、计算/访存比等指标进行性能建模,定位推理瓶颈并输出优化方案。 5. 与算法团队协作,理解模型结构、算子特性和精度约束,推动模型在目标硬件上的最优部署形态落地。
本岗位隶属于我们是阿里巴巴大模型推理团队,团队负责集团内部大语言模型 AI Infra推理系统建设和维护,为淘宝、天猫、聚划算、优酷、闲鱼等多个集团业务部门提供强有力的技术支撑和底层服务能力。AI 性能工程师工作内容包括但不限于: 1. 参与大模型推理系统的研发,聚焦于推理框架与各种类型异构硬件的适配和性能优化工作。 2. 实现各类型“卡-模型”匹配度的自动化观测,指导资源调度策略,评估新硬件引入价值。 3. 线上服务的监控与问题定位,加速大模型能力在集团内落地。 如果您是一位后端研发工程师,具有丰富的性能优化经验,希望投身于AI Infra事业又苦于缺少相关经历,也欢迎投递本岗位,我们更看重您的学习和解决问题的能力!

1. KVCache 核心系统研发,负责 LLM 推理场景下 KVCache 的架构设计与工程实现,优化 KVCache 的内存管理、显存分配与生命周期调度策略,研究并实现 Prefix Cache、Radix Tree Cache 等高效缓存复用机制,提升 Cache Hit Rate。 2. 设计跨机、跨节点的分布式 KVCache 共享与迁移方案,实现 KVCache 在 GPU HBM / CPU DRAM / NVMe SSD 多级存储间的高效卸载(Offload)与加载,针对长上下文、多轮对话场景优化 KVCache 的存储与传输效率。 3. 推理性能优化,结合 Continuous Batching、PagedAttention、Chunked Prefill 等机制,协同优化 KVCache 调度策略,分析推理链路中 KVCache 相关的性能瓶颈,进行端到端性能优化,针对主流推理框架(vLLM / SGLang / TensorRT-LLM / RTP-LLM)进行 KVCache 模块的深度优化与定制。 4. 系统可靠性与可观测性建设,建设 KVCache 命中率、内存占用、调度延迟等核心指标的监控体系,保障大规模集群下 KVCache 服务的高可用与容错能力。

1. 负责 LLM 推理场景下 KVCache 管控系统的架构设计与工程实现,建设面向大规模 GPU 集群的 KVCache 资源管理、容量规划、配额控制、生命周期管理与调度编排能力,提升 KVCache 资源利用率与系统稳定性。 2. 设计 KVCache 全局管控与调度策略,结合请求特征、模型类型、上下文长度、Prefix 复用关系、租户优先级与集群资源状态,实现 KVCache 的准入控制、淘汰策略、热点识别、跨实例复用、跨节点迁移与负载均衡。 3. 建设 KVCache 多级存储管控能力,统一管理 GPU HBM / CPU DRAM / NVMe SSD / 远端存储中的 Cache 资源,设计 Cache 分层、回收、预热、预取、降级与故障恢复机制,支撑长上下文、多轮对话、Agent 工作流等复杂推理场景。 4. 负责 KVCache 管控系统与主流推理引擎及调度系统的集成,围绕 vLLM / SGLang / TensorRT-LLM / RTP-LLM 等框架,抽象统一的 KVCache 元数据、状态同步、资源上报与控制接口,支撑异构推理后端的统一纳管。 5. 建设 KVCache 可观测性与稳定性体系,设计 Cache Hit Rate、复用收益、内存水位、碎片率、迁移延迟、Offload 延迟、淘汰次数、请求级 Cache 轨迹等核心指标,支持容量评估、异常诊断、策略调优与线上问题定位。 6. 参与大规模推理集群的端到端性能优化,分析 KVCache 管控策略对 TTFT、TPOT、吞吐、显存利用率、GPU 利用率和请求成功率的影响,持续优化系统在高并发、多租户、长上下文场景下的服务质量。
1. 核心系统研发 (1)设计与优化大模型推理服务框架与分布式缓存系统。 (2)支持多推理引擎适配、多模态推理、分布式部署及高效数据管理。 (3)开发工具链与服务化能力,包括模型量化、转换、调度与生命周期管理。 2. 性能与稳定性优化 (1)优化推理服务框架的性能,包括引擎适配、生命周期管理和资源调度。 (2)深入优化kvcache的显存、内存和存储管理、批处理、缓存策略和网络传输。 (3)支持高性能通信协议、容错与负载均衡机制。 (4)提升系统可观测性,完善监控、告警与故障恢复体系。 3. 引擎与应用集成 (1)深度集成推理引擎、缓存系统和存储系统,优化访问模式与架构设计。 (2)满足大规模、多模态推理场景下的高吞吐与低延迟需求。