小红书【Dots】多模pretrain-图片生成模型研究员
任职要求
任职要求: 本科及以上学历,计算机、人工智能、数学等相关专业优先; 具备扎实的代码阅读和编写能力,熟练使用 Agentic AI,具有深入的 Python、PyTorch 技术栈实践经验; 在计算机视觉…
工作职责
在算力驱动的 AGI 和人文精神的烟火气交汇之处,我们真诚邀请对 AI 技术有信仰的同学加入,共同打造更具影响力的智能系统。你会成为团队的一员,并和其他同事协作,共同研发 SOTA 的智能技术。期待你以务实和客观的科学态度来推进技术的进展,不被过往经验裹挟、不被主观偏好影响。期待你除了算法外仍然是为出色的工程师。期待你对技术有强烈的好奇心和开放心态,以未来几年 AI 技术的质变突破为目标。 岗位职责:参与图片生成大模型的研发工作,负责下述事项中的一项或多项: 模型预训练:研发文生图、图生图等生成模型,探索 Diffusion、Flow Matching、自回归等模型架构及训练方法,持续提升生成质量、语义一致性和审美表现; 数据建设:建设高质量图片生成训练数据,研究数据清洗、标注、合成、配比及课程学习等方法,提升数据效率和模型能力; 模型后训练:围绕指令遵循、审美质量、文字渲染和复杂概念组合等方向,探索监督微调、偏好学习、强化学习及奖励模型等技术; 可控生成与编辑:研究多模态条件控制、主体一致性、局部编辑、风格迁移等能力,提升模型在真实创作场景中的可用性; 推理与评测:优化模型推理速度、显存占用和部署效率,建设覆盖生成质量、语义一致性、审美及安全性的评测体系。
探索 RL Scaling Law,提升模型 general 的真实推理与反思能力(而非仅在特定任务或 Benchmark 上的表现) 在人类智能密度最高的领域(如顶尖数学、竞赛编程、前沿科学等)持续突破,向达到乃至超过人类顶尖水平的方向迈进。 推动推理与工具使用、真实环境的结合,并提升模型思考效率及 adaptive thinking 的能力。
团队介绍 做多模态的人通常有两种:一种是把各种模态「拼」在一起,一种是真的想搞清楚不同模态之间的关系,我们是后者。从视觉理解,到视觉+语音联合感知,到生成与理解统一——我们在挑战的不是某一个模态的单点能力,是整个「理解-生成-统一」的链条,挑战每种模态的单一能力上限,挑战多种模态的融合难题,挑战理解和生成能力的融合难题,实现类人的多模态能力。 岗位职责:参与视觉语言大模型的研发工作,负责下属事项至少一项或若干 VIT Pretrain:提升模型感知能力,包括但不限于 Vision Encoder Pretrain 算法架构 / 多种感知能力数据构建 VLM Pretrain:提升 vlm pretrain 的通用能力,探索各种不同训练阶段设计 / 不同通用数据的组织形式; VLM Post Train:提升 vlm 通用能力,包括但不限于合成数据 / RL 等方法 生成理解统一:探索生成理解统一架构,同时提升理解和生成能力
团队简介 我们是 Dots 基座大模型的 Post-train 团队。我们相信,模型不只是记住世界,而是真正学会在真实世界中思考、行动与自我成长。团队聚焦可验证奖励 RL、长程 agentic 智能、综合推理与自我演进等最前沿的方向,构建下一代能在复杂真实任务中可靠工作、并持续自我迭代的基座模型。 工作职责 在以下一个或多个方向进行深度攻关。 1. Frontier Research -Self Evolving:提升模型进行机器学习与大模型优化的能力,探索以 AI 加速 AI 研发的新范式:让模型参与到自身的训练、部署及 Agent 调度机制的迭代中,把改进的对象从"模型本身"抬升到"产生模型的研发流程",构建可递归的能力增益回路,持续寻找下一代能力增长曲线 -Lifelong Learning:探索模型"学会学习"的 Meta 能力:让模型在与陌生、开放环境的在线交互中持续更新自身内部状态,无需重新训练即可积累经验,不断提升长期的 decision making 与任务完成能力 -Scalable Oversigh:在难以 verify 的 fuzzy / 开放式任务上,突破人类监督的扩展性瓶颈:研究可扩展的监督、自我评估与自我修正机制,让监督信号的质量能随模型能力一同增长,降低对外部人工反馈的依赖 2. RL Algorithms -研究面向长程、多轮、稀疏奖励场景的 RL 算法,系统性解决信用分配、训练稳定性、探索效率等核心问题 -设计更有效、更鲁棒的奖励与评估信号,缓解 reward hacking、验证误差与奖励噪声对训练的干扰 -研发 Adaptive Thinking,使模型按任务复杂度动态调整思考深度,在保证效果的同时实现高效推理 -探索新的优化目标与训练范式,显著提升长程、稀疏奖励任务的收敛速度与样本效率 -与 infra / 工程团队协同,推进 rollout 加速、环境稳定性、训推一致性等工程化瓶颈的解决 3. Agentic Intelligence -在 Proactive Agent、CLI/GUI 计算机控制,高价值专业知识任务、深度信息获取、 软件工程等任务上,提升模型的 Agentic 能力,让模型在高复杂度真实任务上达到行业前沿水平 -构建复杂、多样、多模态、可验证的 RL 环境,在复杂 harness 上开展 blackbox RL 训练,提升模型在长程、多工具、真实环境中的规划、执行与反思能力 -研究超长程任务下的多智能体协作、长程记忆与跨任务经验的积累复用 -建设可规模化的 Agent 训练环境与评测体系 4. Reasoning -探索 RL Scaling Law,提升模型 general 的真实推理与反思能力(而非仅在特定任务或 Benchmark 上的表现) -在人类智能密度最高的领域(如顶尖数学、竞赛编程、前沿科学等)持续突破,向达到乃至超过人类顶尖水平的方向迈进 -推动推理与工具使用、真实环境的结合,并提升模型思考效率及 adaptive thinking 的能力
团队简介 我们是 Dots 基座大模型的 Post-train 团队。我们相信,模型不只是记住世界,而是真正学会在真实世界中思考、行动与自我成长。团队聚焦可验证奖励 RL、长程 agentic 智能、综合推理与自我演进等最前沿的方向,构建下一代能在复杂真实任务中可靠工作、并持续自我迭代的基座模型。 工作职责 在以下一个或多个方向进行深度攻关。 1. Frontier Research Self Evolving:提升模型进行机器学习与大模型优化的能力,探索以 AI 加速 AI 研发的新范式:让模型参与到自身的训练、部署及 Agent 调度机制的迭代中,把改进的对象从"模型本身"抬升到"产生模型的研发流程",构建可递归的能力增益回路,持续寻找下一代能力增长曲线。 Lifelong Learning:探索模型"学会学习"的 Meta 能力:让模型在与陌生、开放环境的在线交互中持续更新自身内部状态,无需重新训练即可积累经验,不断提升长期的 decision making 与任务完成能力。 Scalable Oversigh:在难以 verify 的 fuzzy / 开放式任务上,突破人类监督的扩展性瓶颈:研究可扩展的监督、自我评估与自我修正机制,让监督信号的质量能随模型能力一同增长,降低对外部人工反馈的依赖。 2. RL Algorithms 研究面向长程、多轮、稀疏奖励场景的 RL 算法,系统性解决信用分配、训练稳定性、探索效率等核心问题; 设计更有效、更鲁棒的奖励与评估信号,缓解 reward hacking、验证误差与奖励噪声对训练的干扰; 研发 Adaptive Thinking,使模型按任务复杂度动态调整思考深度,在保证效果的同时实现高效推理; 探索新的优化目标与训练范式,显著提升长程、稀疏奖励任务的收敛速度与样本效率; 与 infra / 工程团队协同,推进 rollout 加速、环境稳定性、训推一致性等工程化瓶颈的解决。 3. Agentic Intelligence 在 Proactive Agent、CLI/GUI 计算机控制,高价值专业知识任务、深度信息获取、 软件工程等任务上,提升模型的 Agentic 能力,让模型在高复杂度真实任务上达到行业前沿水平; 构建复杂、多样、多模态、可验证的 RL 环境,在复杂 harness 上开展 blackbox RL 训练,提升模型在长程、多工具、真实环境中的规划、执行与反思能力; 研究超长程任务下的多智能体协作、长程记忆与跨任务经验的积累复用; 建设可规模化的 Agent 训练环境与评测体系。 4. Reasoning 探索 RL Scaling Law,提升模型 general 的真实推理与反思能力(而非仅在特定任务或 Benchmark 上的表现) 在人类智能密度最高的领域(如顶尖数学、竞赛编程、前沿科学等)持续突破,向达到乃至超过人类顶尖水平的方向迈进。 推动推理与工具使用、真实环境的结合,并提升模型思考效率及 adaptive thinking 的能力。