logo of mihoyo

米哈游AI 推理性能优化工程师

社招全职2年以上程序&技术类地点:上海状态:招聘

任职要求


1. 有 2 年以上 AI 推理部署、模型性能优化、GPU/NPU 适配或高性能计算相关经验。
2. 熟悉至少 2 种推理引擎或框架,如 TensorRTvLLMTritonSGLangTensorRT-LLMONNX Runtime 等。
3. 熟悉 NVIDIA GPU 生态,包括 CUDA、cuDNN、TensorRT、NCCL,了解 A100、H100、B200 等架构差异。
4. 了解 AMD ROCm 或国产 NPU/GPU 生态,如昇腾、寒武纪、燧原、摩尔线程等,有实际适配经验优先。
5. 熟悉大模型、扩散模型、多模态模型的推理链路,有模型部署、量化、并行推理或性能调优经验。
6. 熟…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


1. 负责 LLM、CV、语音、多模态等模型在不同 GPU/NPU 硬件上的推理性能测试、调优和适配。
2. 负责 NVIDIA、AMD、国产卡等多硬件平台的 Benchmark 测试,输出模型、硬件、推理引擎维度的性能对比和选型建议。
3. 基于 TensorRT、vLLM、Triton、SGLang、TensorRT-LLM 等推理引擎,开展吞吐、时延、显存、Batch、KV Cache、并行策略等优化。
4. 基于 FLOPs、显存、带宽、Batch Size、Sequence Length、计算/访存比等指标进行性能建模,定位推理瓶颈并输出优化方案。
5. 与算法团队协作,理解模型结构、算子特性和精度约束,推动模型在目标硬件上的最优部署形态落地。
包括英文材料
推理引擎+
TensorRT+
大模型+
vLLM+
Triton Inference Server+
SGLang+
ONNX+
CUDA+
还有更多 •••
相关职位

logo of alibaba
社招1年以上

本岗位隶属于我们是阿里巴巴大模型推理团队,团队负责集团内部大语言模型 AI Infra推理系统建设和维护,为淘宝、天猫、聚划算、优酷、闲鱼等多个集团业务部门提供强有力的技术支撑和底层服务能力。AI 性能工程师工作内容包括但不限于: 1. 参与大模型推理系统的研发,聚焦于推理框架与各种类型异构硬件的适配和性能优化工作。 2. 实现各类型“卡-模型”匹配度的自动化观测,指导资源调度策略,评估新硬件引入价值。 3. 线上服务的监控与问题定位,加速大模型能力在集团内落地。 如果您是一位后端研发工程师,具有丰富的性能优化经验,希望投身于AI Infra事业又苦于缺少相关经历,也欢迎投递本岗位,我们更看重您的学习和解决问题的能力!

更新于 2026-07-24北京|杭州
logo of aligenie
社招4年以上

1. KVCache 核心系统研发,负责 LLM 推理场景下 KVCache 的架构设计与工程实现,优化 KVCache 的内存管理、显存分配与生命周期调度策略,研究并实现 Prefix Cache、Radix Tree Cache 等高效缓存复用机制,提升 Cache Hit Rate。 2. 设计跨机、跨节点的分布式 KVCache 共享与迁移方案,实现 KVCache 在 GPU HBM / CPU DRAM / NVMe SSD 多级存储间的高效卸载(Offload)与加载,针对长上下文、多轮对话场景优化 KVCache 的存储与传输效率。 3. 推理性能优化,结合 Continuous Batching、PagedAttention、Chunked Prefill 等机制,协同优化 KVCache 调度策略,分析推理链路中 KVCache 相关的性能瓶颈,进行端到端性能优化,针对主流推理框架(vLLM / SGLang / TensorRT-LLM / RTP-LLM)进行 KVCache 模块的深度优化与定制。 4. 系统可靠性与可观测性建设,建设 KVCache 命中率、内存占用、调度延迟等核心指标的监控体系,保障大规模集群下 KVCache 服务的高可用与容错能力。

更新于 2026-06-16北京|杭州
logo of aligenie
社招4年以上

1. 负责 LLM 推理场景下 KVCache 管控系统的架构设计与工程实现,建设面向大规模 GPU 集群的 KVCache 资源管理、容量规划、配额控制、生命周期管理与调度编排能力,提升 KVCache 资源利用率与系统稳定性。 2. 设计 KVCache 全局管控与调度策略,结合请求特征、模型类型、上下文长度、Prefix 复用关系、租户优先级与集群资源状态,实现 KVCache 的准入控制、淘汰策略、热点识别、跨实例复用、跨节点迁移与负载均衡。 3. 建设 KVCache 多级存储管控能力,统一管理 GPU HBM / CPU DRAM / NVMe SSD / 远端存储中的 Cache 资源,设计 Cache 分层、回收、预热、预取、降级与故障恢复机制,支撑长上下文、多轮对话、Agent 工作流等复杂推理场景。 4. 负责 KVCache 管控系统与主流推理引擎及调度系统的集成,围绕 vLLM / SGLang / TensorRT-LLM / RTP-LLM 等框架,抽象统一的 KVCache 元数据、状态同步、资源上报与控制接口,支撑异构推理后端的统一纳管。 5. 建设 KVCache 可观测性与稳定性体系,设计 Cache Hit Rate、复用收益、内存水位、碎片率、迁移延迟、Offload 延迟、淘汰次数、请求级 Cache 轨迹等核心指标,支持容量评估、异常诊断、策略调优与线上问题定位。 6. 参与大规模推理集群的端到端性能优化,分析 KVCache 管控策略对 TTFT、TPOT、吞吐、显存利用率、GPU 利用率和请求成功率的影响,持续优化系统在高并发、多租户、长上下文场景下的服务质量。

更新于 2026-06-16北京|杭州
logo of alibaba
社招4年以上技术类-开发

1. 核心系统研发 (1)设计与优化大模型推理服务框架与分布式缓存系统。 (2)支持多推理引擎适配、多模态推理、分布式部署及高效数据管理。 (3)开发工具链与服务化能力,包括模型量化、转换、调度与生命周期管理。 2. 性能与稳定性优化 (1)优化推理服务框架的性能,包括引擎适配、生命周期管理和资源调度。 (2)深入优化kvcache的显存、内存和存储管理、批处理、缓存策略和网络传输。 (3)支持高性能通信协议、容错与负载均衡机制。 (4)提升系统可观测性,完善监控、告警与故障恢复体系。 3. 引擎与应用集成 (1)深度集成推理引擎、缓存系统和存储系统,优化访问模式与架构设计。 (2)满足大规模、多模态推理场景下的高吞吐与低延迟需求。

更新于 2026-06-16北京|杭州