logo of mihoyo

米哈游大模型-推理平台研发工程师

校招全职程序&技术类地点:上海状态:招聘

任职要求


1. 本科及以上学历,计算机、软件、人工智能等相关专业;
2. 具备扎实的计算机基础(数据结构算法、操作系统、计算机网络、并发编程);
3. 至少熟悉 Go/Python/C++/Rust 中一种,具有良好的工程实现与代码质量意识;
4. 对分布式系统/大规模异构推理有浓厚兴趣,喜欢钻研底层原理与性能瓶颈,有实际追踪相关领域进展。

加分项
1. 参与过大模…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


1. 负责大模型推理平台的开发、维护与性能优化,保障服务高可用性和高性能运行;
2. 对大模型 KVCache 集群进行开发、维护与性能调优,解决大规模并发推理内存瓶颈;
3. 管理推理服务的计算资源、流量及任务调度,优化集群资源利用率,降低推理成本;
4. 建立推理服务监控告警体系,及时发现和解决性能异常和系统故障;
5. 参与推理服务架构设计,支持多模态模型和不同规模模型的推理需求。
包括英文材料
学历+
数据结构+
算法+
Go+
Python+
C+++
Rust+
分布式系统+
还有更多 •••
相关职位

logo of alibaba
社招3年以上

1、负责视频图像生成、多模态语言类模型的推理引擎和服务框架建设,为百炼和广泛的阿里业务线提供高效、稳定、低延迟的模型推理能力。我们建设、开源且同时在内部使用的开源推理引擎包括: LLM类:https://github.com/alibaba/rtp-llm Diffusion类:https://github.com/modelscope/DiffSynth-Engine 2、负责上述推理引擎开发与性能优化,包括高性能CUDA算子开发与融合、混合精度与量化推理、显存生命周期管理,以及Tensor Parallelism等分布式并行策略在多模态模型上的设计与实现,持续提升推理吞吐与延迟指标。 3、负责多模态推理服务框架的架构设计与开发,包括多阶段模型pipeline的请求编排与调度、异构计算资源的混布与隔离、continuous batching与流式推理、多租户资源管理与弹性伸缩,构建高可用、高吞吐的在线推理服务体系。 4、工作地点:北京、杭州,未来会开放「上海」工作地点,现阶段支持员工根据团队安排部分时间在上海办公,详情可与hr或面试官沟通。

更新于 2026-06-09北京|杭州
logo of alibaba
社招3年以上技术类-开发

本岗位隶属于我们是阿里巴巴大模型推理团队,负责生成式 AI 领域(主要是图像生成和LLM)的内部产品、训练推理服务系统建设和维护,为淘宝、天猫、聚划算、优酷、闲鱼等多个集团业务部门提供强有力的技术支撑和底层服务能力。 主要工作内容如下: 1. 负责设计开发高性能大模型推理引擎;结合流量调度、并行、Cache 等方法构建大规模分布式模型服务系统。 2. 融合业界前沿的算法工程理论,基于量化、动态剪枝等有损方法进行极致的模型加速和成本优化。 3. 结合数据、算法和工程,协同构建 AI Infra 平台,为生成式 AI 提供端到端解决方案,推动业务创新与实践应用。

更新于 2026-07-28北京|杭州
logo of alibaba
社招3年以上

我们是阿里巴巴大模型推理团队,负责内部 LLM/AIGC 百炼推理服务建设,为淘宝、天猫、聚划算、优酷、闲鱼等多个集团业务部门提供强有力的技术支撑和底层服务能力。 AI 高性能计算工程师负责探索不同AI芯片(NV,AMD, 华为昇腾, TPU, 寒武纪等)的底层架构,使用硬件手写原生 Kernel、 Trition/Tilelang 编译优化等手段,解决“从0到1”(跑通)和“从1到N”(跑得快)的关键问题。 工作地点:北京、杭州,未来会开放「上海」工作地点,现阶段支持员工根据团队安排部分时间在上海办公,详情可与hr或面试官沟通。

更新于 2026-07-08北京|杭州
logo of baidu
社招ACG

-负责千帆MaaS平台级推理降本与效率优化策略设计与落地,并支持定制化推理性能优化 -负责量化、投机推理(MTP / speculative decoding / Eagle)等训练–推理协同优化方案的设计与落地 -负责建设大模型推理性能评测与收益评估体系 -前沿技术落地:调研并落地大模型推理多维度优化技术,包括但不限于模型量化(INT4/INT8/FP8,含PTQ/QAT两种方式)、MTP投机推理优化、结构化剪枝与稀疏化等,持续提升推理效率与资源利用率,降低部署成本。

更新于 2026-02-10北京