logo of mihoyo

米哈游大模型推理部署优化实习生-AI引擎

实习兼职程序&技术类地点:上海状态:招聘

任职要求


1. 计算机、数学、电子信息、自动化等相关专业本科及以上学历,优秀在校生优先。
2. 具备扎实的 PythonC++ 编程基础,熟悉 Linux 开发环境和常用工程工具。
3. 对大模型推理部署、推理加速、GPU 计算等方向有浓厚兴趣,具备较强的学习能力和问题分析能力。
4. 熟悉至少一种主流大模型推理框架,如 SGLangvLLM、TensorRT-LLM、TGI 等,有实际部署或调优经验者优先。
5. 有 CUDA、Triton、NCCL、TensorRT 或其他 GPU 编程经验者优先。
6. 了解大模型推理相关…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


1. 跟踪业界大模型推理技术发展趋势,调研并分析主流开源推理框架及相关工程实践。
2. 参与开源大模型的高性能推理部署与优化工作,包括但不限于 PD 分离、推理参数调优、并发性能优化、显存优化等方向。
3. 支撑 SGLang、vLLM 等主流开源推理框架的部署、适配、测试与性能评估。
4. 参与推理网关相关技术调研,包括请求调度、路由策略、负载均衡、多模型服务管理、限流熔断等能力分析。
5. 跟踪开源社区重要特性演进,参与问题定位、性能瓶颈分析及工程修复。
6. 沉淀部署实践、调研报告和性能优化经验,为团队大模型推理平台建设提供技术支撑。
包括英文材料
学历+
Python+
C+++
Linux+
大模型+
SGLang+
vLLM+
还有更多 •••
相关职位

logo of keep
社招2年以上

1、负责运动健康垂类大模型的推理服务建设与性能优化,涵盖 SLM / LLM / VLM 等多种模型形态; 2、基于 vLLM / SGLang 等推理框架,持续优化首 token 延迟、吞吐量及 GPU 资源利用率; 3、设计并实现模型推理加速方案,包括 Prefix Caching、Speculative Decoding、量化部署等; 4、负责多模型统一接入与请求调度网关的开发,根据不同业务场景实现智能路由与负载均衡; 5、负责与推理引擎相关的 Context / KV Cache 管理优化(如长上下文、Prefix 复用等),支撑上层 Agent 场景的高效落地; 6、构建模型服务的可观测性体系,包括延迟监控、请求全链路 trace、成本归因与降级熔断策略; 7、与算法研究员紧密协作,完成模型从训练产出到线上服务的全链路打通; 8、跟进大模型推理优化领域的前沿技术进展,持续迭代推理架构和服务性能。

更新于 2026-05-09北京
logo of jd
社招算法开发岗

1. 构建AI云推理架构: 探索PD分离、KV池化、通信优化等技术,设计并实现适用于AI原生的分布式推理服务架构,应对高并发、低延迟挑战; 2. 开发核心推理平台能力: 打造AI原生网关及高可用系统,核心技术点包括但不限于:异构资源调度、身份认证与鉴权、请求智能限流、动态模型路由、推理容器/镜像加速、安全变更管控、系统深度可观测性等; 3. 参与推理全栈应用实践: 积极涉足推理服务上下游应用开发,如构建RAG(检索增强生成)系统、探索提示词工程优化实践、参与AI模型市场(MCP)建设或AIGC应用落地等。

更新于 2025-12-02北京
logo of horizon
实习算法序列

1、参与VLA模型在仿真环境中的部署与运行,支持数据采集、任务执行与结果统计; 2、参与LLM/VLM/VLA模型的工程化训练与推理流程搭建,支持模型在不同配置下的运行与评测; 3、参与模型压缩、量化、推理加速等工程优化工作,对不同方案进行实验验证与性能对比; 4、配合完成模型部署相关的脚本、工具与文档,提升整体工程稳定性与可复现性。

更新于 2026-03-09北京
logo of alibaba
实习阿里巴巴2027

面向大模型在高并发、低延迟、低成本生产环境中的规模化落地,本课题聚焦下一代大模型推理加速关键技术,探索从模型架构、算法创新、硬件协同到集群系统的全链路优化方法,突破当前大模型推理在计算效率、显存占用、通信开销和系统稳定性等方面的瓶颈。 1. 探索面向推理友好的高效模型架构演进方法,结合后训练技术,研究 Attention、MoE、长上下文、KV Cache 等核心结构的推理效率优化,在保证模型效果的前提下提升吞吐、降低时延与部署成本。 2. 探索具有突破性的推理算法优化方案,围绕低比特量化、投机解码、稀疏注意力、LLM/Diffusion蒸馏等方向,以算法的角度持续突破并降低推理代价。 3. 探索面向新型硬件的推理加速技术,结合 GPU/NPU、异构算力单元、存算协同、算子融合和内存访问优化等能力,提升大模型推理在不同硬件平台上的执行效率。 4. 探索大流量集群推理系统的加速方案,结合网络通信、异构算力调度、请求路由、动态批处理等技术,提升推理系统在复杂业务场景下的效率、稳定性与鲁棒性。

更新于 2026-06-03北京|杭州