【小红书】大模型推理系统MaaS研发工程师（实习）

实习大模型

1、参与小红书万亿级Token量推理系统构建，包括但不限于大模型智能网关、大模型弹性伸缩、推理系统优化等方向，共同打造国内领先的大模型推理系统； 2、探索负载感知的推理系统流量调度算法，如基于Prefix Cache命中率调度、基于P/D分离的流量调度、基于KVCache使用率、推理排队负载感知的流量调度、长上下文请求调度优化等，持续提升MaaS系统的稳定性、成本效益； 3、探索并跟进业界开源SOTA模型，如Qwen系列、DeepSeek系列，多维度评估模型效果并建立相关的准入体系，及时上架到MaaS系统； 4、参与MaaS系统的国产卡适配，如华为910C、阿里PPU等； 5、参与攻克大规模分布式推理系统带来的复杂挑战，通过弹性调度、容量规划、链路压测等手段提升系统健壮性，确保平台能够弹性扩展，支撑业务的飞速增长。

更新于 2025-08-22北京|上海

AI大模型推理系统研发工程师实习生

实习引擎

核心职责参与小红书万亿级Token量推理系统构建，包括但不限于大模型智能网关、大模型弹性伸缩、推理系统优化等方向，共同打造国内领先的大模型推理系统；探索负载感知的推理系统流量调度算法，如基于Prefix Cache命中率调度、基于P/D分离的流量调度、基于KVCache使用率、推理排队负载感知的流量调度、长上下文请求调度优化等，持续提升MaaS系统的稳定性、成本效益；探索并跟进业界开源SOTA模型，如Qwen系列、DeepSeek系列，多维度评估模型效果并建立相关的准入体系，及时上架到MaaS系统；参与MaaS系统的国产卡适配，如华为910C、阿里PPU等；参与攻克大规模分布式推理系统带来的复杂挑战，通过弹性调度、容量规划、链路压测等手段提升系统健壮性，确保平台能够弹性扩展，支撑业务的飞速增长。

更新于 2025-11-25北京|上海

【REDstar】大模型训练/压缩/推理Infra研发工程师

校招大模型

小红书中台AI Infra团队深耕大模型「数-训-压-推-评」技术闭环，具备专业的大模型训练加速、模型压缩、推理加速、部署提效等方向硬核技术积淀，基于RedAccel训练引擎、RedSlim压缩工具、RedServing推理部署引擎、DirectLLM大模型MaaS服务，支撑小红书社区、商业、交易、安全、数平、研效等多个核心业务实现AI技术高效落地！大模型训练方向： 1、参与设计实现支持RLHF/DPO等对齐技术的高效训练框架，优化强化学习阶段的Rollout、Reward Model集成、多阶段训练Pipeline； 2、研发支持多机多卡RL的分布式训练框架，开发TP/PP/ZeRO-3与RL流程的动态协同机制，解决RL算法在超长时序下的显存/通信瓶颈； 3、基于自建的训推引擎，落地公司统一的大模型生产部署平台，为公司所有大模型算法同学提供端到端的一站式服务。大模型压缩方向： 1、探索研发针对大语言模型、多模态大模型等场景的压缩技术，包括但不限于量化、蒸馏、剪枝、稀疏化等； 2、参与/负责多个业务场景中的模型压缩技术实现，对模型进行轻量化压缩，提高训练/推理效率，支持业务降本增效； 3、参与/负责针对英伟达GPU、华为昇腾NPU等不同的计算硬件，制定不同的模型压缩方案并在业务落地。大模型推理方向： 1、参与/负责研发面向LLM/MLLM等模型的稳定、易用、性能领先的AI推理框架； 2、通过并行计算优化、分布式架构优化、异构调度等多种框架技术，支撑各业务方向持续降本增效； 3、深度参与周边深度学习系统多个子方向的工作，包括但不限于模型管理、推理部署、日志/监控、工作流编排等。高性能计算方向： 1、参与/负责AI推理/训练框架的底层性能优化工作，包括但不限于高性能算子、通信库开发与优化等工作； 2、参与/负责大模型计算引擎的研发工作，通过多种方式实现训推性能SOTA； 3、参与/负责前沿AI编译加速等技术的探索和业务落地。大模型服务方向： 1、参与/负责大模型MaaS系统的架构设计、系统研发、产品研发等工作； 2、深入参与面向大模型场景的请求调度、异构资源调度、引擎优化等核心工作，实现万亿级并行推理系统； 3、为内部产品线提供解决方案，协助公司内用户解决大模型应用过程中业务在MaaS上的使用问题。

更新于 2025-09-24北京|上海

【2026校招】大模型训练/压缩/推理Infra研发工程师

校招大模型

小红书中台AI Infra团队深耕大模型「数-训-压-推-评」技术闭环，具备专业的大模型训练加速、模型压缩、推理加速、部署提效等方向硬核技术积淀，基于RedAccel训练引擎、RedSlim压缩工具、RedServing推理部署引擎、DirectLLM大模型MaaS服务，支撑小红书社区、商业、交易、安全、数平、研效等多个核心业务实现AI技术高效落地！大模型训练方向： 1、参与设计实现支持RLHF/DPO等对齐技术的高效训练框架，优化强化学习阶段的Rollout、Reward Model集成、多阶段训练Pipeline； 2、研发支持多机多卡RL的分布式训练框架，开发TP/PP/ZeRO-3与RL流程的动态协同机制，解决RL算法在超长时序下的显存/通信瓶颈； 3、基于自建的训推引擎，落地公司统一的大模型生产部署平台，为公司所有大模型算法同学提供端到端的一站式服务。大模型压缩方向： 1、探索研发针对大语言模型、多模态大模型等场景的压缩技术，包括但不限于量化、蒸馏、剪枝、稀疏化等； 2、参与/负责多个业务场景中的模型压缩技术实现，对模型进行轻量化压缩，提高训练/推理效率，支持业务降本增效； 3、参与/负责针对英伟达GPU、华为昇腾NPU等不同的计算硬件，制定不同的模型压缩方案并在业务落地。大模型推理方向： 1、参与/负责研发面向LLM/MLLM等模型的稳定、易用、性能领先的AI推理框架； 2、通过并行计算优化、分布式架构优化、异构调度等多种框架技术，支撑各业务方向持续降本增效； 3、深度参与周边深度学习系统多个子方向的工作，包括但不限于模型管理、推理部署、日志/监控、工作流编排等。高性能计算方向： 1、参与/负责AI推理/训练框架的底层性能优化工作，包括但不限于高性能算子、通信库开发与优化等工作； 2、参与/负责大模型计算引擎的研发工作，通过多种方式实现训推性能SOTA； 3、参与/负责前沿AI编译加速等技术的探索和业务落地。大模型服务方向： 1、参与/负责大模型MaaS系统的架构设计、系统研发、产品研发等工作； 2、深入参与面向大模型场景的请求调度、异构资源调度、引擎优化等核心工作，实现万亿级并行推理系统； 3、为内部产品线提供解决方案，协助公司内用户解决大模型应用过程中业务在MaaS上的使用问题。

更新于 2025-09-24北京|上海

小红书大模型推理系统MaaS研发工程师（实习）

任职要求

工作职责