小红书大模型MaaS推理系统研发工程师(练习生)
任职要求
任职要求 1、熟悉业界主流Dense、MOE大模型架构及主要特点,能识别出模型效果及主要使用场景,支持用户大模型的选型和使用需求; 2、了解至少一种大模型服务推理部署框架,如vLLM、SGLang、Dynamo等,并有过大模型服务部署的经验; 3、优秀的代码能力、数据结构和基础算法功底,熟悉C++/Python开发,熟悉 Linux/Git 开发环…
工作职责
核心职责 1、参与小红书万亿级Token量推理系统构建,包括但不限于大模型智能网关、大模型弹性伸缩、推理系统优化等方向,共同打造国内领先的大模型MaaS服务; 2、探索负载感知的推理系统流量调度算法,如基于Prefix Cache命中率调度、基于P/D分离的流量调度、基于KVCache使用率、推理排队负载感知的流量调度、长上下文请求调度优化等,持续提升MaaS系统的稳定性、成本效益; 3、探索并跟进业界开源SOTA模型,如Qwen系列、DeepSeek系列,多维度评估模型效果并建立相关的准入体系,及时上架到MaaS系统; 4、参与MaaS系统的国产卡适配与异构算力统一调度体系,如华为910C、阿里PPU、昆仑芯P800; 5、参与攻克大规模分布式推理系统带来的复杂挑战,通过弹性调度、容量规划、链路压测等手段提升系统健壮性,确保平台能够弹性扩展,支撑业务的飞速增长。
核心职责 1、参与小红书万亿级Token量推理系统构建,包括但不限于大模型智能网关、大模型弹性伸缩、推理系统优化等方向,共同打造国内领先的大模型MaaS服务; 2、探索负载感知的推理系统流量调度算法,如基于Prefix Cache命中率调度、基于P/D分离的流量调度、基于KVCache使用率、推理排队负载感知的流量调度、长上下文请求调度优化等,持续提升MaaS系统的稳定性、成本效益; 3、探索并跟进业界开源SOTA模型,如Qwen系列、DeepSeek系列,多维度评估模型效果并建立相关的准入体系,及时上架到MaaS系统; 4、参与MaaS系统的国产卡适配与异构算力统一调度体系,如华为910C、阿里PPU、昆仑芯P800; 5、参与攻克大规模分布式推理系统带来的复杂挑战,通过弹性调度、容量规划、链路压测等手段提升系统健壮性,确保平台能够弹性扩展,支撑业务的飞速增长
我们是小红书中台大模型 Infra 团队,专注打造领先易用的「AI 大模型全链路基础设施」!团队深耕大模型「数-训-压-推-评」技术闭环,在大模型训练加速、模型压缩、推理优化、部署提效等方向积累了深厚的技术优势,基于 RedAccel 训练引擎、RedSlim 压缩工具、RedServing 推理部署引擎、DirectLLM 大模型 API 服务、QuickSilver 大模型生产部署平台等核心产品,持续赋能社区、商业、交易、安全、数平、研效等多个核心业务,实现 AI 技术高效落地! DirectLLM是小红书内部面向各业务场景建设的大模型API服务产品,通过标准化API接口提供LLM/MLLM等大模型推理服务,致力于为AI应用开发者提供品类丰富、数量众多的模型选择,并通过API接口为其提供开箱即用、能力卓越、成本经济的模型服务,各领域模型的能力均可通过统一的API和SDK来实现被不同业务系统集成。 核心职责 1、MaaS 平台架构与研发: 参与 MaaS 系统架构设计与研发,建设公司统一的大模型 API 服务入口。 2、模型服务治理能力建设: 负责模型接入、请求路由、鉴权、限流、配额、TPM / RPM、灰度发布、SLO、成本统计等核心能力。 3、请求调度与稳定性建设: 建设多模型、多租户、高并发场景下的请求调度与服务治理能力,提升模型服务稳定性和资源效率。 4、推理引擎与业务打通: 打通底层推理引擎与上层业务应用,为社区、搜索、审核、企效、AI 应用等场景提供开箱即用的大模型服务能力。 5、开发者体验优化: 持续优化统一 API、SDK、文档、监控、问题诊断和接入流程,提升内部 AI 应用开发效率。 6、成本与效率优化: 与推理、压缩、调度团队协同,持续优化模型调用成本、服务延迟和资源利用率。
1、MaaS 网关架构与研发:负责大模型 MaaS 网关的整体架构设计与核心研发,建设公司统一的大模型 API 服务入口,提供 OpenAI 兼容 API。 2、模型接入与路由:负责多模型接入抽象、请求路由、模型版本管理、灰度发布等能力,支撑异构推理后端的统一对外服务。 3、服务治理能力建设:负责鉴权、限流、配额、TPM / RPM、流控、熔断降级、SLO 保障、成本统计等网关核心治理能力。 4、多租户与高并发:建设多模型、多租户、高并发场景下的请求调度与服务治理体系,提升模型服务的稳定性和资源效率。 5、开发者体验优化:持续优化统一 API、SDK、文档、监控、问题诊断和接入流程,提升内部 AI 应用开发效率。 6、业务打通与协同:与推理引擎、调度、算法及上层业务团队协同,为社区、搜索、审核、企效、AI 应用等场景提供开箱即用的大模型服务能力。
深入参与阿里云 MaaS(Model as a Service)平台核心算法研发,以先进的大模型与智能体体系驱动业务落地,定义下一代 AI-Native 交互范式。工作内容包括并不限于: 1、负责面向真实场景的智能体自适应、自演进技术研发,构建基于业务数据的 Agentic RL 训练、Agentic Infra 优化,持续提升智能体在任务规划、工具调用、多轮推理等方面的能力,支撑 AI 搜索、Deep Research等场景的云产品研发; 2、主导针对挑战性难题的大模型优化(文本、语音、全模态),深入理解电商、教育、金融等垂直行业的业务诉求,基于大模型如Qwen进行后训练全链路优化(数据-训练-评测),攻坚大模型在关键领域、核心指标上的能力提升以及泛化性增强,构建基于大模型的行业端到端解决方案; 3、从真实场景中沉淀评测基准、数据、训练等核心算法能力,融合至阿里基座模型的训练和评测中,持续提升通用大模型在真实场景中的能力表现; 4、持续跟踪AI领域的技术趋势,将前沿和自研技术转化为核心业务驱动力,确保大模型与智能体具备卓越的性能表现,持续保持团队在AI领域的全球技术领先地位。