小红书dots-AI infra
任职要求
分布式 1、熟练掌握Linux环境下的C/C++、Python语言; 2、具备扎实的计算机科学功底和编程能力,熟悉常见算法和数据结构,具有良好的编程习惯; 3、能够熟练使用至少一种主流的机器学习框架(TensorFlow / PyTorch等),熟悉框架内部实现; 4、熟悉Transformer模型…
工作职责
【训练推理框架研发】 大模型hi lab AI Infra团队专注于大语言模型领域的前沿技术研究和落地,提供高性能、高可靠、可扩展的机器学习系统、丰富的异构计算资源和极致的端到端的机器学习服务体验,为公司提供核心技术能力和服务。 1、负责机器学习框架的研究与开发,服务于公司各个产品; 2、高效部署,优化NLP/多模态大模型核心业务模型; 【轻量化】 机器学习系统团队需要将传统或者新型的轻量化算法和工程有机结合起来进行加速,提高大语言模型训练或者推理性能的同时,通过算法手段尽可能降低效果损失。候选人将在以下几个方向进行深入探索和落地: 1、量化方向:负责但不限于大语言模型的低精度训练(FP8)、推理(W8A8KV8等)、低精度优化器(量化梯度、优化器状态、参数等) 2、高性能模型结构:大语言模型Finetune或者其他阶段的LoRA系列(熟悉各种变种),训练阶段的MQA/GQA系列等 3、稀疏化方向:大语言模型剪枝、稀疏、蒸馏、Sparse Attention等 4、新型方向:Medusa、超长文本、Speculative Sampling等
数据工程 详负责支撑 dots(LLM / 多模态 / Agentic)训练与对齐所需的超大规模数据工程体系,覆盖从 数据生产、清洗、存储、调度、分布式读取到质量闭环的全链路。 RL 训练框架 负责强化学习系统的规模化落地,优化分布式 RL 训练吞吐,处理长序列/推理/CLI Agent 任务 算子优化 深入 CUDA/CuteDSL/TileLang 底层,攻克性能瓶颈(如 FlashMLA、Mega Kernel、低精度算子、通信计算重叠优化) 推理引擎 打造高并发、低延迟的推理架构,优化 PD/AF 分离 schedule、解耦架构及动态资源调度
1、端到端功能建设及交付:参与点点(Dots)AI 对话应用的全栈功能研发,熟练借助 AI 编程工具(如 Claude Code、Cursor、Codex 等)实现人机协同编程,独立完成完整功能模块的端到端(Client-Server-AI)架构设计与高质量交付。 2、Agent 系统与工作流建设:参与构建连接大模型与业务场景的 Agent 系统,设计并落地多步推理(Multi-step Reasoning)、动态 Workflow 编排、多模型路由、多样 Tool Calling 、 DeepResearch 等核心机制。 3、服务端与高并发对话系统研发:参与 AI 对话产品服务端核心架构设计,构建支撑千万级并发的流式消息分发与路由系统(基于 SSE / WebSocket / gRPC 等协议);推进微服务系统容量规划、全链路追踪(Trace)与性能瓶颈调优。 4、大前端与跨端交互体验攻坚:具备跨端视野,深度参与大前端(iOS / Android / Web / RN)核心模块开发,攻坚富文本与复杂卡片渲染、多模态交互(音视频 / 图像)、复杂动画及极致的客户端性能治理(启动、内存、卡顿与流畅度)。 5、全链路高可用保障:针对复杂 AI 任务的不确定性与不可靠性,设计并实现健壮的工程兜底机制,构建高可用的服务架构,涵盖中间状态存储与恢复(Memory/State Management)、长链路容错、智能重试与降级,支撑核心场景的工业级稳定性。
1. 参与小红书AI chatbot方向独立产品的方案规划和产出落地; 2. 设计C端应用和B端平台产品原型,确保产品的易用性和用户体验; 3. 参与模型数据生产标准制定,基于产品形态设计各场景下模型回复的理想态。