小鹏汽车AI编译器&模型优化实习生
任职要求
1、27届-28届毕业的同学,计算机/电子工程等相关专业,硕士及以上在读; 2、扎实的系统与工程能力:精通C++/Python,扎实掌握数据结构与算法,能高质量实现高性能算子或底层系统组件; 3、AI编译器基础:熟悉MLIR/TVM/XLA/IREE等编译框架,了解计算图优化、算子融合、内存复用等关键技术; 4、模型理解:熟悉LLM/VLM/扩散模型等主流架构,理解其计算模式对编译优化的需求;熟悉常用的大语言模型优化和压缩算法,比如量化,剪枝,稀疏化。 【…
工作职责
1、参与面向大模型与物理AI场景的AI编译器研发,优化计算图表示、算子融合与内存调度策略; 2、针对自研AI芯片进行算子定制与性能调优,实现端到端推理与训练加速; 3、设计并实现自动代码生成工具链,支持多后端(GPU/NPU/CPU)的高效算子发射; 4、调研SOTA大语言模型的压缩和加速算法,并针对小鹏的模型结构做优化和实现; 5、与算法、芯片团队深度协作,推动编译优化在百万级量产环境中的稳定落地。

岗位职责: 1.负责设计、开发和维护DSA架构下的NPU编译器工具链,确保其高效稳定运行。 2.扩展和优化深度学习框架(包括TensorFlow、PyTorch、ONNX等)的支持能力,提升AI模型兼容性。 3.负责计算图优化,包括各种网络的常见通用优化以及针对硬件平台的优化。 4.优化编译器工具链中的各种算法,以提高编译质量和执行效率。 5.与芯片设计团队及软件开发团队紧密合作,进行系统层面的编译器性能调优。 6.对开源编译器框架TVM/LLVM(MLIR)进行二次开发,以满足自驾业务需求。
1. 下一代AI编译器架构设计与研发:主导AI芯片编译器的核心方案设计与开发实现,聚焦于软硬件协同优化,挑战极致的硬件资源利用率与高能效比(Energy Efficiency)。 2. LLM驱动的编译器前沿探索:结合大语言模型(LLM)与智能体(Agent)技术,探索自动代码生成、智能算子融合及自动化性能调优等前沿课题,构建“AI辅助AI编译”的下一代智能工具链。 3. 软硬协同的系统级优化:深度融合前沿AI算法(如大模型推理/训练)、底层硬件架构与业务产品需求,打通从算法到芯片的端到端编译优化链路。 4. 极致性能与功耗分析:主导复杂模型在真实场景下的性能瓶颈剖析,建立深度的性能与功耗分析模型,研发并落地系统级的极致优化策略。 5. 编译器技术演进与生态建设:保持对业界顶尖编译器(如TVM, MLIR, Triton等)及LLM前沿动态的敏锐嗅觉,规划并引领自研AI编译器的技术演进路线图。
【部门介绍】引擎架构部提供小红书搜广推,CV和NLP业务的深度学习模型高性能推理服务。主导SOTA推理引擎的架构设计与核心模块开发,支撑搜广推业务在长序列建模、生成式推荐、Agent等前沿场景在GPU,XPU等异构计算部件上规模落地。 1. 参与推理引擎的架构设计与核心模块的开发,参与AI编译器前后端的设计与实现,优化IR Compile模式下DSL特征处理引擎和AI推理引擎的性能。 2. 分析I/O性能瓶颈、优化编译耗时和codegen性能,改进编译优化算法,不断优化编译器,解决编译部署问题。 3. 优化IR Compile模式下搜广推、长序列、多模态、MoE等深度学习模型的推理效率。 4. 针对GPU/NPU等异构计算芯片,探索基于IR编译优化的片内多部件并行流水线等前沿技术,构建业界影响力。

1、从事RISC-V CPU 编译器的研发工作,包括编译器架构设计、优化遍开发、应用程序性能分析调优等工作; 2、基于 MLIR + Linalg 框架,提升编译器代码块执行效率; 3、参与图优化、后端代码生成、调度策略、指令优化、流水并行化相关优化工作; 4、研究和优化 Kernel 计算性能,降低计算开销,提高吞吐率; 5、研究算子融合(Op Fusion)、自动调优(Auto-Tuning)、代码生成(CodeGen)相关优化策略; 6、与硬件团队、AI 框架团队(如 PyTorch)协作,提升 AI 编译器的支持能力; 跟踪 LLVM、Triton、TVM、XLA、TorchInductor 等 AI 编译器前沿技术,优化编译性能。