logo of horizon

地平线大模型部署优化工程师

社招全职算法序列地点:北京 | 上海状态:招聘

任职要求


1. 硕士及以上学历,计算机、人工智能、电子、软件工程的直接相关专业,或运筹学、统计学、数学类的基础专业;

2. 熟悉自动驾驶感知,预测,数据…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


1. 搭建高效的AI系统,为算法迭代和部署提供模型优化、量化、部署的高效算法工具链;

2. 使用模型优化技术,包括模型低精度量化、模型压缩/裁剪,熟悉大模型的量化、长上下文推理优化等,开发模型优化的工具链,对模型进行优化加速;

3. 参与软硬件协同优化设计。与硬件工程师协作,参与硬件设计和优化,提供模型在私有硬件平台的执行效率。
包括英文材料
学历+
自动驾驶+
还有更多 •••
相关职位

logo of keep
社招2年以上

1、负责运动健康垂类大模型的推理服务建设与性能优化,涵盖 SLM / LLM / VLM 等多种模型形态; 2、基于 vLLM / SGLang 等推理框架,持续优化首 token 延迟、吞吐量及 GPU 资源利用率; 3、设计并实现模型推理加速方案,包括 Prefix Caching、Speculative Decoding、量化部署等; 4、负责多模型统一接入与请求调度网关的开发,根据不同业务场景实现智能路由与负载均衡; 5、负责与推理引擎相关的 Context / KV Cache 管理优化(如长上下文、Prefix 复用等),支撑上层 Agent 场景的高效落地; 6、构建模型服务的可观测性体系,包括延迟监控、请求全链路 trace、成本归因与降级熔断策略; 7、与算法研究员紧密协作,完成模型从训练产出到线上服务的全链路打通; 8、跟进大模型推理优化领域的前沿技术进展,持续迭代推理架构和服务性能。

更新于 2026-05-09北京
logo of pinduoduo
社招技术类

1. 负责大模型(LLM/VLM), 视频生成、数字人相关算法服务高性能推理服务研发与部署; 2. 负责大语言模型(VLM/LLM)应用系统的架构设计与工程实现; 3. 主导大模型微调, 模型压缩、量化(INT8/AWQ)及性能调优,深度应用TensorRT-LLM, vLLM, Triton等推理引擎; 4. 推动大模型,视频生成,图片生成等生成服务在电商(如数字人、带货视频)场景的工程化落地与性能保障。

更新于 2025-11-28上海
logo of xpeng
实习

【关于我们】 小鹏机器人中心致力于研发先进的人形机器人技术,包括机器人的行走、操作、智能导航,以及在大语言模型支持下的人机交互等。我们的软硬件团队覆盖深圳、上海、广州、北京和北美,组成了一支世界一流的跨领域团队。作为本团队的一员,你将成为连接人工智能与物理世界的桥梁,与其它领域的工程师共同解决前沿的科研和工程难题,并在机器人技术的发展中留下自己的印记。 作为小鹏机器人核心团队的实习生,你将深入参与具身智能(Embodied AI)VLA 大模型的全链路优化工作,主要探索和负责以下领域: 核心职责:参与具身 VLA 大模型的部署优化,熟悉算子优化、模型量化等原理。 技术探索:参与研究和应用最新的大模型结构,探索软硬一体的高效模型部署设计方案,提升模型推理性能。 团队协作:与算法、硬件及基础设施团队紧密合作,共同推进模型从训练到部署的迭代,解决前沿工程技术与算法论文在真实场景中的落地挑战。

更新于 2025-12-30深圳
logo of mihoyo
实习程序&技术类

1. 跟踪业界大模型推理技术发展趋势,调研并分析主流开源推理框架及相关工程实践。 2. 参与开源大模型的高性能推理部署与优化工作,包括但不限于 PD 分离、推理参数调优、并发性能优化、显存优化等方向。 3. 支撑 SGLang、vLLM 等主流开源推理框架的部署、适配、测试与性能评估。 4. 参与推理网关相关技术调研,包括请求调度、路由策略、负载均衡、多模型服务管理、限流熔断等能力分析。 5. 跟踪开源社区重要特性演进,参与问题定位、性能瓶颈分析及工程修复。 6. 沉淀部署实践、调研报告和性能优化经验,为团队大模型推理平台建设提供技术支撑。

上海