拼多多大模型推理加速算法工程师
任职要求
1、计算机、高性能计算(HPC)、软件工程、人工智能等相关专业硕士及以上学历,具备大模型推理优化或 ML Sys 实际生产环境落地经验 2、具有较强的编程能力,熟练使用Python等编程语言,熟悉CUDA等并行计算技术 3、熟悉深度学习框架(如P…
工作职责
1、负责多模态大模型(如internVL/CLIP等)的推理性能优化工作,提高模型的推理速度及效率 2、了解大模型的训练和微调流程、Prompt Engineering等,熟悉相关训练和部署工具的使用,在量化、剪枝和蒸馏上有实际落地经验 3、熟悉业界主流的AI加速库和框架,探索新的推理优化技术和算法 4、深入了解深度学习框架(如PyTorch、TensorFlow等),并熟悉其优化技术和工具链。分析并识别模型的瓶颈,设计和实现相应的优化方案
面向大模型在高并发、低延迟、低成本生产环境中的规模化落地,本课题聚焦下一代大模型推理加速关键技术,探索从模型架构、算法创新、硬件协同到集群系统的全链路优化方法,突破当前大模型推理在计算效率、显存占用、通信开销和系统稳定性等方面的瓶颈。 1. 探索面向推理友好的高效模型架构演进方法,结合后训练技术,研究 Attention、MoE、长上下文、KV Cache 等核心结构的推理效率优化,在保证模型效果的前提下提升吞吐、降低时延与部署成本。 2. 探索具有突破性的推理算法优化方案,围绕低比特量化、投机解码、稀疏注意力、LLM/Diffusion蒸馏等方向,以算法的角度持续突破并降低推理代价。 3. 探索面向新型硬件的推理加速技术,结合 GPU/NPU、异构算力单元、存算协同、算子融合和内存访问优化等能力,提升大模型推理在不同硬件平台上的执行效率。 4. 探索大流量集群推理系统的加速方案,结合网络通信、异构算力调度、请求路由、动态批处理等技术,提升推理系统在复杂业务场景下的效率、稳定性与鲁棒性。
职位描述: 1.设计和实现面向大模型推理的多层级存储系统,综合利用多种硬件进行数据的存储和迁移管理,优化大模型缓存利用率,提升推理性能; 2.设计负载感知的推理框架自调优能力,设计高效的指标采集模块,能够根据对不同负载自动调优推理框架的参数; 3.优化模型量化以及模型卸载技术,进一步提升单机场景下支持的模型规模; 4.设计高效微调框架,集成并优化微调算法,实现动态策略调度模块,基于任务特征挑选最合适的微调方案。
1.负责通用多模态大模型的推理部署,包括多模态理解、生成、语音大模型等研发支持,推动算法落地; 2.多模态大模型性能优化及推理框架优化,提升整体吞吐、降低部署成本;提升框架易用性; 3.紧跟多模态生成和理解领域的技术前沿,推动技术创新在产品中落地; 4.针对落地业务,优化部署方案及适配定制化需求。