高德地图高德-大模型推理引擎工程师/专家-北京
任职要求
1. 本科及以上学历,计算机科学与技术、电子工程、自动化、通信工程等相关专业,3年及以上深度学习推理引擎/推理优化相关工作经验,优秀者可放宽年限与学历要求。 2. 精通C/C++编程语言,熟悉Python,具备扎实的算法与数据结构基础,良好的工程化编码素养与代码规范意识。 3. 精通CUDA编程,熟悉GPU架构与性能优化方法,有丰富的深度学习算子开发、优化经验;熟悉至少一种主流推理框架(TensorRT/ONNX Runtime/TVM/LibTorch等)…
工作职责
1. 负责全双工实时语音交互场景下,上下行语音链路的推理引擎整体架构设计与落地,覆盖语音前端处理(降噪、AEC、VAD)、ASR、TTS、音色转换、情感合成等全链路语音模型的推理服务建设,支持打断、优先级调度、并行处理等全双工核心交互特性。 2. 针对语音大模型的流式推理特性,开展极致性能优化,包括但不限于算子定制与优化、低精度量化(INT8/FP8/INT4)、模型压缩、内存/显存复用、编译优化、流式pipeline并行调度、分布式推理优化等,持续压缩端到端推理延迟,提升服务并发能力与资源利用率。 3. 负责推理引擎的工程化落地、工具链建设与线上稳定性保障,搭建从训练模型到推理部署的全流程自动化工具链,实现模型转换、量化、编译、部署的标准化落地;对接算法团队的模型迭代,快速支撑新模型的上线;搭建性能监控与告警体系,解决线上高并发、低延迟场景下的技术问题,保障服务SLA。 4. 预研并落地大语言模型的推理加速技术,包括分布式推理、KV Cache优化、投机解码、动态批处理等,打通语音-语言大模型的端到端推理链路,支撑多模态交互场景的技术需求。 5. 跟踪业界前沿的推理引擎、深度学习编译、模型优化技术,结合业务场景开展技术预研与落地,持续迭代推理引擎的技术竞争力。
随着Agent技术的规模化落地,大模型推理的Token消耗呈现指数级增长,推理系统的性能与成本已成为制约业务发展的核心瓶颈。LongCat推理团队致力于打造世界级的高效、稳定、可扩展的大模型推理引擎,支撑超大规模集群的复杂线上流量场景,为业务提供极致的推理性能与成本优势。岗位职责我们诚邀在以下一个或多个方向具备深厚积累的工程师加入: 1.模型-系统协同设计深度参与模型架构设计,将推理效率优化的思想前置到模型设计环节,与算法及训练工程团队紧密协作,从硬件亲和性角度出发,设计低延迟、高吞吐的模型结构,实现算法与系统的端到端优化。 2.高性能算子开发 面向异构计算硬件,研发极致优化的融合算子 ,探索Tiling策略、内存访问模式、流水线并行等底层性能优化手段。 3.推理框架优化 深入优化自研推理框架,降低调度开销,实现计算与通信的高效重叠,提升硬件利用率。 4.分布式系统架构 设计高可用的分布式推理系统,通过智能请求调度、动态负载均衡、反压控制等机制,保障系统在突发流量下的稳定性与SLA。 5.长上下文场景极致优化 针对T级别参数模型在M级别序列长度下的推理场景,系统性优化显存占用、IO带宽、算力分配及跨节点通信效率,充分释放硬件潜力。 【为什么是我们】 1.直面大模型时代最核心的工程挑战——用极致的系统优化,打破推理成本与性能的边界。 2.从大规模集群的分布式调度,到底层算子的硬件性能榨取;从长上下文场景的显存革命,到模型-系统协同设计的未来架构。每一行代码,都将直接影响千亿级Token的推理效率,改善数亿用户的线上服务体验。
1、参与 LLM 推理框架 的研发与性能优化,支持主流开源模型及自研模型的高效推理; 2、负责底层算子优化,包括但不限于访存模式优化、计算流水线编排、低精度量化(如 INT8/FP8)、编译优化等,持续提升硬件资源利用效率与模型推理 MFU(Model FLOPs Utilization); 3、优化推理框架上层调度策略,通过节点内及节点间的计算任务调度与通信优化,提升整体引擎性能; 4、建设与优化 LLM 模型服务相关工具与平台,提升模型部署的易用性及在线服务的稳定性。
参与快手大模型推理引擎研发,工作内容包括: 1、参与大模型推理引擎的设计和研发,支撑快手自研以及开源模型的快速部署和高性能推理; 2、通过各种技术手段持续优化性能,降低推理成本,包括但不限于:算子/编译优化、异构推理、模型量化&蒸馏、分布式并行等; 3、支持RL中的多样化采样、generation性能优化等。