小红书【Ace顶尖实习生】大模型后训练泛化性研究
任职要求
1、不限年级,本科及以上在读,计算机/人工智能/软件工程等相关专业优先; 2、扎实的编程能力和算法功底,熟练掌握Python/C++/Java等至少一种编程语言; 3、扎实的机器学习/深度学习理论基础,有大规模推荐系统、计算广告、搜索引擎等核心算法项目经验; 3、有LLM/MLLM等多模态理解技术背景,…
工作职责
本课题聚焦小红书通用基座模型在真实业务 OOD 场景下的泛化性问题,围绕三个方向展开: 1)研究如何在训练阶段提升模型的 In-context Learning 与 OOD 泛化能力,包括任务抽象、数据构造、Prompt 模板改写与训练策略设计; 2)研究如何评测这些能力,建立真实 OOD 评测和面向领域任务构造的 ICL 能力评测方法,区分真正的泛化提升与同分布收益; 3)在模型固定的情况下,研究如何通过更好的 Context Engineering 提升模型在 OOD 任务上的表现。目标是沉淀可复用的训练、评测和 Context Engineering 方法,为小红书通用基座模型通过 Prompting 调用 API 更好服务业务提供支撑。
我们致力于构建可持续进化的 Agent 系统:让 Agent 在真实环境中通过交互、学习与数据闭环,不断提升复杂任务能力。 围绕“数据 → 学习 → 自进化”三位一体展开: - Agent 自进化: 基于真实任务轨迹与反思机制,提升 Agent 在长期交互中的自主学习能力,解决反馈建模、策略泛化与错误累积问题。 - RL for Agent Systems: 将强化学习引入 Agent 全链路(规划-执行-反馈),研究 trajectory-level reward、credit assignment 及 offline/online 混合训练。 - Agentic Data Construction: 构建由 Agent 主导的数据生产与筛选机制,形成“生成 → 评估 → 反哺”的数据闭环,持续放大模型能力。
当前推荐算法主要依赖用户行为做相关性建模,基于正负反馈信号动态调整用户兴趣表示。这种建模方式在用户意图理解、复杂偏好刻画及跨领域知识利用和泛化性方面仍存在明显局限:一方面,行为信号往往稀疏且滞后,导致兴趣调节效率有限;另一方面,推荐模型缺乏对高维世界知识的有效提取、整合与推理能力,难以深入理解用户真实需求及其潜在偏好。尤其对于低活跃、低消费或行为样本不足的用户群体,现有方法较难显著提升推荐效果与用户体验。 近年来,大模型在知识表征、语义理解、逻辑推理和泛化能力方面展现出显著优势,为突破当下推荐系统瓶颈提供了新的技术路径。通过探索大模型与推荐系统的深度融合,有望增强系统对用户意图的精准感知能力,提升对复杂兴趣和长尾需求的理解水平,可进一步推动推荐系统向更加智能化、个性化和人性化的方向发展。
本课题的研究目标是打造行业领先的社媒多语言大模型,结合站内外多语言社媒语料内容及高质量翻译互译数据,开展大规模预训练、SFT、RL等,实现: (1)应用于小红书多语言大模型翻译场景取得领先效果; (2)应用于国际化搜索召回/相关性,AI搜索混排/生成等跨语言场景,取得业务收益。