logo of hello

哈啰模型量化部署实习生

实习兼职算法地点:上海状态:招聘

任职要求


1. 计算机、电子信息、自动化等相关专业2027届硕士应届毕业生,扎实掌握C/C++/Python任意一门编程语言
2. 熟悉深度学习基础理论,了解CNNTransformer等常见模型结构;
3. 了解TensorRT、ONNX、TVM等至少一种推理框架的基本使用,有模型转换、算子开发相关实践经验优先
4. 熟悉Linux开发环境,掌握基础的Shell脚本编写、性能调试工具使用方法,有CUDA编程基础者优先
5. 对AI部署方向有强烈兴趣,主动关注模型量化、推理优化领域的…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


1. 参与Transformer、CV类模型的INT8/FP16量化、稀疏化、QAT、剪枝、蒸馏工作,解决量化精度损失问题,实现模型体积与推理速度的平衡优化
2. 基于TensorRT、ONNX Runtime、TVM等主流推理框架,完成模型转换、算子开发与性能调优,支撑GPU/ARM等多硬件平台部署
3. 参与推理引擎的性能 Profiling 工作,定位并解决推理链路中的瓶颈点,推动核心场景的吞吐率提升30%以上
4. 协同算法、业务团队完成部署方案落地,输出标准化部署SOP,保障线上推理服务的稳定性与低延迟
包括英文材料
C+
C+++
Python+
深度学习+
CNN+
Transformer+
还有更多 •••
相关职位

logo of horizon
实习算法序列

1、性能分析与对齐:配合编译器团队,跟踪模型在特定硬件上的推理延迟,定位并辅助解决因编译器版本更迭导致的性能异常; 2、自动化评测工具开发:参与构建端侧模型性能/精度自动化评测系统,实现从模型转换、数据回推到端侧部署指标分析的全流程闭环; 3、前沿算法实验:追踪并复现业界主流量化算法(如 GPTQ, AWQ, SmoothQuant 等),验证其在特定芯片架构上的适配性与加速效果; 4、量化精度对齐与攻关:负责大语言模型(LLM)及多模态模型(VLM)在端侧平台的量化实验,涵盖 W8A8、W4 等主流方案,分析并解决 PTQ/QAT 过程中的精度掉点问题。

更新于 2026-03-09北京
logo of tencent
社招3年以上出行行业应用技术

1.负责座舱端侧大模型量化部署,如高通/MTK/Nvidia等座舱芯片平台; 2.探索不同芯片平台的算子能力与工程新特性,设计不同的量化策略与验证方法,优化量化前后精度损失; 3.负责端侧大模型部署过程中的性能优化,优化token生成速度与减少内存带宽的使用; 4.研究端侧大模型前沿的量化部署方法,提升端侧大模型整体性能与精度。

更新于 2025-12-05深圳
logo of horizon
社招算法序列

【工作职责】 1. 负责大模型和业务模型的量化方案设计与落地,包括LSQ、动态量化等量化过程的优化、模型latency优化、模型迭代等 2.负责模型关键算子优化,提升推理性能与硬件利用率,降低显存占用并提升吞吐 2. 使用模型优化技术,包括模型低精度量化、模型压缩/裁剪,熟悉大模型的量化、长上下文推理优化等 3. 参与软硬件协同优化设计,与硬件团队协作,参与硬件设计和优化,提升模型在硬件平台的执行效率

更新于 2026-03-27北京|上海
logo of horizon
实习算法序列

1、参与大模型量化精度调优工作; 2、参与大模型量化算法端侧适配工作;

更新于 2025-12-12北京|南京|上海