荣耀端侧AI推理优化工程师
任职要求
1、计算机、自动化、电子工程、人工智能等相关专业本科及以上学历; 2、具备扎实的编程基础,熟练使用Python,掌握C/C++等至少一种系统级开发语言,具备良好的数据结构与算法基础; 3、熟悉至少一种深度学习框架(如PyTorch / TensorFlow),具备模型训练、推理或部署相关经验; 4、了解深度学习模型结构(如CNN、Transformer等),理解模型推理与性能优化的基本原理; 5、具…
工作职责
1、负责荣耀PC端侧AI能力建设,开展AI模型在端侧设备上的部署、推理加速与性能优化工作; 2、负责AI模型在Intel、AMD、NVIDIA等主流PC芯片平台上的适配与优化,提升模型在不同硬件架构上的运行效率与资源利用率; 3、负责AI算法在CPU/GPU/NPU等处理器上的计算性能优化与算子加速,持续提升端侧推理性能; 4、参与端侧AI模型部署与推理加速能力的平台化设计与开发,构建统一高效的模型部署与运行框架; 5、跟踪端侧AI推理优化与系统加速领域的前沿技术,在不同硬件平台上开展技术研究与创新,推动关键技术突破并落地到产品。
1. 主导端侧AI推理框架的整体架构设计与核心模块开发,支持Omni、Speech、VLM等多模态大模型在资源受限设备上的高效运行。 2. 深度优化模型推理性能,包括但不限于算子融合、内存复用、图优化、量化(INT8/INT4)、稀疏化、编译优化(如MLIR/TVM)等关键技术。 3. 针对高通、地平线、MTK、NVIDIA、华为昇腾等主流芯片平台,进行定制化适配与极致性能调优,实现低延迟、低功耗、高吞吐的推理能力。 4. 构建端侧多模态任务调度与资源管理机制,支持语音识别、视觉理解、对话生成等多模型并发执行与协同推理。 5. 与算法、系统、硬件及客户解决方案团队紧密协作,推动从模型训练到端侧部署的端到端Pipeline打通。 6. 跟踪业界前沿技术(如WebNN、ONNX Runtime Mobile、TensorRT-LLM、ExecuTorch等),引入先进工具链与优化策略。
1.聚焦办公 PC、手机消费级终端大模型推理优化,负责端侧推理引擎性能调优,保障本地离线大模型平稳高效运行; 2.运用模型蒸馏、量化压缩、KV 缓存优化等轻量化技术,在保证效果前提下,降低端侧推理延迟、内存占用与硬件功耗; 3.负责端侧模型格式转换、算子适配与PC / 手机异构算力调度,充分调用 CPU、独显、端侧 NPU 算力,最大化设备推理性能; 4.对接 Intel、AMD 桌面端 AI 生态,适配本地推理服务框架,完成与上层业务框架快速集成落地; 5.梳理 PC 与手机端推理性能瓶颈,输出标准化优化方案,协同团队完成本地大模型方案规模化落地; 6.持续跟进桌面端、移动端轻量化推理前沿技术,优化本地离线推理体验。
主导公司产品在端侧AI如具身智能、AI加速卡、无人驾驶等场景的规模化落地,通过市场调研输出TAM/SAM信息并充分理解端侧AI行业的内存痛点,利用公司已有产品或者牵引新产品开发来满足行业核心需求,配合部门负责人完成端侧AI的市场战略制定和落地,主要包括商业洞察、价格策略、营收和市场份额、产品线规划、大客户合作、行业合作等。