理想汽车大模型推理硬件架构实习生
任职要求
【岗位要求】 1.计算机体系结构、电子工程、微电子、计算机科学等相关专业在读; 2.熟悉计算机体系结构基础,了解 GPU、NPU、FPGA 或 AI 加速器; 3.熟悉 Verilog/SystemVerilog、HLS、CUDA、C/C++ 或架构模拟工具中的一种或多种; 4.具备 Python 和 PyTorch 基础…
工作职责
1.面向大模型训练与推理加速,研究 GPU、NPU、FPGA 等异构计算平台的架构与性能优化;分析 Transformer、MoE 的计算、访存和通信特征,定位系统性能瓶颈; 2.参与矩阵计算、稀疏/低比特计算、片上存储及数据流等关键模块设计; 使用性能建模、架构仿真、HLS 或 RTL 开展设计空间探索与方案验证; 推进量化、稀疏化等软硬件协同优化,提升端侧及云端部署的吞吐、延迟和能效; 3.参与原型实现、实验评估及 ISCA、MICRO、HPCA、ASPLOS、MLSys 等会议论文投稿。
● 面向 NVIDIA GPU、AMD GPU、NPU 等主流异构 AI 加速硬件,对大模型核心算子进行深度性能优化,极致压榨计算与访存带宽资源,显著提升端到端推理吞吐量与延迟表现。 ● 设计并实现高精度、极低比特(如 INT4/INT2)量化内核,在保障推理精度的前提下,大幅降低模型存储占用与计算开销,推动大模型在资源受限场景下的高效部署。 ● 针对大规模分布式推理场景,研发计算-通信协同优化技术,有效隐藏通信延迟,提升多卡/多节点系统的可扩展性与资源利用率。 ● 紧跟大模型架构前沿演进,针对稀疏 MoE、线性注意力(Linear Attention)、稀疏注意力(Sparse Attention)等新型结构,开展端到端性能建模、算子定制与内核级优化,为下一代高性能推理引擎提供核心技术支撑。
面向大模型在高并发、低延迟、低成本生产环境中的规模化落地,本课题聚焦下一代大模型推理加速关键技术,探索从模型架构、算法创新、硬件协同到集群系统的全链路优化方法,突破当前大模型推理在计算效率、显存占用、通信开销和系统稳定性等方面的瓶颈。 1. 探索面向推理友好的高效模型架构演进方法,结合后训练技术,研究 Attention、MoE、长上下文、KV Cache 等核心结构的推理效率优化,在保证模型效果的前提下提升吞吐、降低时延与部署成本。 2. 探索具有突破性的推理算法优化方案,围绕低比特量化、投机解码、稀疏注意力、LLM/Diffusion蒸馏等方向,以算法的角度持续突破并降低推理代价。 3. 探索面向新型硬件的推理加速技术,结合 GPU/NPU、异构算力单元、存算协同、算子融合和内存访问优化等能力,提升大模型推理在不同硬件平台上的执行效率。 4. 探索大流量集群推理系统的加速方案,结合网络通信、异构算力调度、请求路由、动态批处理等技术,提升推理系统在复杂业务场景下的效率、稳定性与鲁棒性。
大模型推理的成本与效率是行业核心挑战,而 KV Cache 管理是突破瓶颈的关键。本岗位将主导构建下一代 LLM 推理存储架构,融合算法优化、系统调度与硬件感知能力,打造高弹性、低成本、高可用的推理基础设施,支撑公司核心大模型业务的规模化落地。 1. 负责设计和实现面向大规模推理的存储系统,深度融合推理引擎,构建从显存、本地内存至分布式冷存储的全局多级存储池; 2. 基于特征识别实现数据的智能调度与分布管理,推动计算存储分离、弹性资源池等核心能力落地,建立高扩展、高可靠的推理存储系统底座; 3. 定义存储与推理引擎间的统一数据访问抽象层,通过零侵入式接口设计实现计算存储解耦,为多级缓存、预取调度等高级策略提供标准化支撑; 4. 建立 KV Cache 资源评估与治理体系,通过数据驱动的方式识别优化空间,在保障服务品质的前提下持续降低推理成本、提升资源 ROI; 5. 联合上下游团队,深入 KV Cache 全栈优化和技术攻关,建立端到端 KV Cache 系统; 6. 跟踪学术界与工业界 KV Cache 最新进展,推动量化、压缩、调度等创新技术在大规模生产环境中的落地。
1、参与大模型推理引擎(基于 SGLang 框架)的设计与核心模块开发,支持 Transformer、MoE、DiffusionLLM 等多种架构及 LLM/VLM 等模型的高性能推理; 2、运用低比特量化、投机采样、稀疏计算、分布式推理等技术,加速大模型推理速度并降低部署成本, 并优化其稳定性、易用性; 3、针对 GPU/AI 芯片架构(含自研硬件),开展针对性性能调优,优化算子、内存管理、KV Cache 管理等核心模块; 4、与算法、产品及业务团队协作,推动不同模型场景下的系统端到端性能优化; 5、关注并引入前沿大模型推理技术,参与 SGLang 及相关开源生态的维护与贡献。