米哈游大模型-推理平台研发工程师
任职要求
1. 本科及以上学历,计算机、软件、人工智能等相关专业; 2. 具备扎实的计算机基础(数据结构、算法、操作系统、计算机网络、并发编程); 3. 至少熟悉 Go/Python/C++/Rust 中一种,具有良好的工程实现与代码质量意识; 4. 对分布式系统/大规模异构推理有浓厚兴趣,喜欢钻研底层原理与性能瓶颈,有实际追踪相关领域进展。 加分项 1. 参与过大模…
工作职责
1. 负责大模型推理平台的开发、维护与性能优化,保障服务高可用性和高性能运行; 2. 对大模型 KVCache 集群进行开发、维护与性能调优,解决大规模并发推理内存瓶颈; 3. 管理推理服务的计算资源、流量及任务调度,优化集群资源利用率,降低推理成本; 4. 建立推理服务监控告警体系,及时发现和解决性能异常和系统故障; 5. 参与推理服务架构设计,支持多模态模型和不同规模模型的推理需求。
1、负责视频图像生成、多模态语言类模型的推理引擎和服务框架建设,为百炼和广泛的阿里业务线提供高效、稳定、低延迟的模型推理能力。我们建设、开源且同时在内部使用的开源推理引擎包括: LLM类:https://github.com/alibaba/rtp-llm Diffusion类:https://github.com/modelscope/DiffSynth-Engine 2、负责上述推理引擎开发与性能优化,包括高性能CUDA算子开发与融合、混合精度与量化推理、显存生命周期管理,以及Tensor Parallelism等分布式并行策略在多模态模型上的设计与实现,持续提升推理吞吐与延迟指标。 3、负责多模态推理服务框架的架构设计与开发,包括多阶段模型pipeline的请求编排与调度、异构计算资源的混布与隔离、continuous batching与流式推理、多租户资源管理与弹性伸缩,构建高可用、高吞吐的在线推理服务体系。 4、工作地点:北京、杭州,未来会开放「上海」工作地点,现阶段支持员工根据团队安排部分时间在上海办公,详情可与hr或面试官沟通。
本岗位隶属于我们是阿里巴巴大模型推理团队,负责生成式 AI 领域(主要是图像生成和LLM)的内部产品、训练推理服务系统建设和维护,为淘宝、天猫、聚划算、优酷、闲鱼等多个集团业务部门提供强有力的技术支撑和底层服务能力。 主要工作内容如下: 1. 负责设计开发高性能大模型推理引擎;结合流量调度、并行、Cache 等方法构建大规模分布式模型服务系统。 2. 融合业界前沿的算法工程理论,基于量化、动态剪枝等有损方法进行极致的模型加速和成本优化。 3. 结合数据、算法和工程,协同构建 AI Infra 平台,为生成式 AI 提供端到端解决方案,推动业务创新与实践应用。
我们是阿里巴巴大模型推理团队,负责内部 LLM/AIGC 百炼推理服务建设,为淘宝、天猫、聚划算、优酷、闲鱼等多个集团业务部门提供强有力的技术支撑和底层服务能力。 AI 高性能计算工程师负责探索不同AI芯片(NV,AMD, 华为昇腾, TPU, 寒武纪等)的底层架构,使用硬件手写原生 Kernel、 Trition/Tilelang 编译优化等手段,解决“从0到1”(跑通)和“从1到N”(跑得快)的关键问题。 工作地点:北京、杭州,未来会开放「上海」工作地点,现阶段支持员工根据团队安排部分时间在上海办公,详情可与hr或面试官沟通。