小鹏汽车AI编译器&模型优化实习生
任职要求
1、27届-28届毕业的同学,计算机/电子工程等相关专业,硕士及以上在读; 2、扎实的系统与工程能力:精通C++/Python,扎实掌握数据结构与算法,能高质量实现高性能算子或底层系统组件; 3、AI编译器基础:熟悉MLIR/TVM/XLA/IREE等编译框架,了解计算图优化、算子融合、内存复用等关键技术; 4、模型理解:熟悉LLM/VLM/扩散模型等主流架构,理解其计算模式对编译优化的需求;熟悉常用的大语言模型优化和压缩算法,比如量化,剪枝,稀疏化。 【…
工作职责
1、参与面向大模型与物理AI场景的AI编译器研发,优化计算图表示、算子融合与内存调度策略; 2、针对自研AI芯片进行算子定制与性能调优,实现端到端推理与训练加速; 3、设计并实现自动代码生成工具链,支持多后端(GPU/NPU/CPU)的高效算子发射; 4、调研SOTA大语言模型的压缩和加速算法,并针对小鹏的模型结构做优化和实现; 5、与算法、芯片团队深度协作,推动编译优化在百万级量产环境中的稳定落地。

岗位职责: 1.负责设计、开发和维护DSA架构下的NPU编译器工具链,确保其高效稳定运行。 2.扩展和优化深度学习框架(包括TensorFlow、PyTorch、ONNX等)的支持能力,提升AI模型兼容性。 3.负责计算图优化,包括各种网络的常见通用优化以及针对硬件平台的优化。 4.优化编译器工具链中的各种算法,以提高编译质量和执行效率。 5.与芯片设计团队及软件开发团队紧密合作,进行系统层面的编译器性能调优。 6.对开源编译器框架TVM/LLVM(MLIR)进行二次开发,以满足自驾业务需求。
“理想+”是理想汽车面向全球顶尖技术人才的校园招聘计划。我们期待你的加入,与理想汽车一起成长、分享收获,通过人工智能技术去改变物理世界的效率和体验,造福我们服务的每一个家庭,以及家庭里的每一位成员。 【本岗位的主要工作内容】 1. 参与并设计AI编译器框架,承接端到端自动驾驶/大语言各类前沿AI模型负载,面向自研AI芯片,实现高性能推理; 2. 参与AI模型推理引擎构建,包括计算图融合,计算图优化以及自动化调优等; 3. 参与AI算子库的开发和优化,支撑算法模型推理所需算子的功能和基本性能要求,分析性能瓶颈,构建方案优化; 4. 面向自研芯片,优化算法实现,参与制定芯片软硬件协作方案。
1. 下一代AI编译器架构设计与研发:主导AI芯片编译器的核心方案设计与开发实现,聚焦于软硬件协同优化,挑战极致的硬件资源利用率与高能效比(Energy Efficiency)。 2. LLM驱动的编译器前沿探索:结合大语言模型(LLM)与智能体(Agent)技术,探索自动代码生成、智能算子融合及自动化性能调优等前沿课题,构建“AI辅助AI编译”的下一代智能工具链。 3. 软硬协同的系统级优化:深度融合前沿AI算法(如大模型推理/训练)、底层硬件架构与业务产品需求,打通从算法到芯片的端到端编译优化链路。 4. 极致性能与功耗分析:主导复杂模型在真实场景下的性能瓶颈剖析,建立深度的性能与功耗分析模型,研发并落地系统级的极致优化策略。 5. 编译器技术演进与生态建设:保持对业界顶尖编译器(如TVM, MLIR, Triton等)及LLM前沿动态的敏锐嗅觉,规划并引领自研AI编译器的技术演进路线图。
【部门介绍】引擎架构部提供小红书搜广推,CV和NLP业务的深度学习模型高性能推理服务。主导SOTA推理引擎的架构设计与核心模块开发,支撑搜广推业务在长序列建模、生成式推荐、Agent等前沿场景在GPU,XPU等异构计算部件上规模落地。 1. 参与推理引擎的架构设计与核心模块的开发,参与AI编译器前后端的设计与实现,优化IR Compile模式下DSL特征处理引擎和AI推理引擎的性能。 2. 分析I/O性能瓶颈、优化编译耗时和codegen性能,改进编译优化算法,不断优化编译器,解决编译部署问题。 3. 优化IR Compile模式下搜广推、长序列、多模态、MoE等深度学习模型的推理效率。 4. 针对GPU/NPU等异构计算芯片,探索基于IR编译优化的片内多部件并行流水线等前沿技术,构建业界影响力。