logo of tongyi

通义通义实验室-端侧AI推理框架技术专家-北京/杭州

社招全职3年以上技术-基础平台地点:北京 | 杭州状态:招聘

任职要求


1.  计算机科学、电子工程、自动化或相关专业硕士及以上学历,3年以上端侧AI系统或高性能计算相关工作经验。
2.  精通C/C++,熟悉Python,具备扎实的系统编程与底层优化能力。
3.  深入理解主流AI推理框架(如TensorRT、ONNX Runtime、TFLite、MNN、NCNN、MindSpore Lite等)的架构与实现原理。
4. …
登录查看完整任职要求
微信扫码,1秒登录

工作职责


1.  主导端侧AI推理框架的整体架构设计与核心模块开发,支持Omni、Speech、VLM等多模态大模型在资源受限设备上的高效运行。
2.  深度优化模型推理性能,包括但不限于算子融合、内存复用、图优化、量化(INT8/INT4)、稀疏化、编译优化(如MLIR/TVM)等关键技术。
3.  针对高通、地平线、MTK、NVIDIA、华为昇腾等主流芯片平台,进行定制化适配与极致性能调优,实现低延迟、低功耗、高吞吐的推理能力。
4.  构建端侧多模态任务调度与资源管理机制,支持语音识别、视觉理解、对话生成等多模型并发执行与协同推理。
5.  与算法、系统、硬件及客户解决方案团队紧密协作,推动从模型训练到端侧部署的端到端Pipeline打通。 
6.  跟踪业界前沿技术(如WebNN、ONNX Runtime Mobile、TensorRT-LLM、ExecuTorch等),引入先进工具链与优化策略。
包括英文材料
学历+
C+
C+++
Python+
TensorRT+
还有更多 •••
相关职位

logo of honor
社招研发类

1、负责荣耀PC端侧AI能力建设,开展AI模型在端侧设备上的部署、推理加速与性能优化工作; 2、负责AI模型在Intel、AMD、NVIDIA等主流PC芯片平台上的适配与优化,提升模型在不同硬件架构上的运行效率与资源利用率; 3、负责AI算法在CPU/GPU/NPU等处理器上的计算性能优化与算子加速,持续提升端侧推理性能; 4、参与端侧AI模型部署与推理加速能力的平台化设计与开发,构建统一高效的模型部署与运行框架; 5、跟踪端侧AI推理优化与系统加速领域的前沿技术,在不同硬件平台上开展技术研究与创新,推动关键技术突破并落地到产品。

更新于 2026-07-01西安
logo of tencent
社招5年以上QClaw技术

1.聚焦办公 PC、手机消费级终端大模型推理优化,负责端侧推理引擎性能调优,保障本地离线大模型平稳高效运行; 2.运用模型蒸馏、量化压缩、KV 缓存优化等轻量化技术,在保证效果前提下,降低端侧推理延迟、内存占用与硬件功耗; 3.负责端侧模型格式转换、算子适配与PC / 手机异构算力调度,充分调用 CPU、独显、端侧 NPU 算力,最大化设备推理性能; 4.对接 Intel、AMD 桌面端 AI 生态,适配本地推理服务框架,完成与上层业务框架快速集成落地; 5.梳理 PC 与手机端推理性能瓶颈,输出标准化优化方案,协同团队完成本地大模型方案规模化落地; 6.持续跟进桌面端、移动端轻量化推理前沿技术,优化本地离线推理体验。

更新于 2026-05-28深圳
logo of cxmt
社招3年以上市场营销类

主导公司产品在端侧AI如具身智能、AI加速卡、无人驾驶等场景的规模化落地,通过市场调研输出TAM/SAM信息并充分理解端侧AI行业的内存痛点,利用公司已有产品或者牵引新产品开发来满足行业核心需求,配合部门负责人完成端侧AI的市场战略制定和落地,主要包括商业洞察、价格策略、营收和市场份额、产品线规划、大客户合作、行业合作等。

更新于 2026-06-12合肥|上海|北京
logo of tcl
实习研发技术类

1.基于开源神经网络模型,开展效果微调与性能优化,满足端侧业务需求; 2.基于端侧开源推理框架,完成模型工程化落地与部署; 3.跟进端侧模型前沿论文,实现可复现Demo,探索端侧推理模型原型构建。

更新于 2026-07-28深圳