通义通义实验室-多模态后训练算法专家-杭州/上海/北京
任职要求
1、计算机科学、人工智能、机器学习或相关领域的硕士或博士学位。 2、在多模态、计算机视觉、NLP、AIGC、计算机图形学、机器学习等一个或多个领域有较深入的研究。 3、有多模态大模型后训练相关经验,benchmark构造经验。 4、能够积极创新, 乐于面对挑战, 负责敬业,优秀的团队合作精神,一起探索新技术,推进技术进步。 加分项: 1、具…
工作职责
1、探索研究多模态理解、视频理解等方向的前沿技术。 2、关注多模态、全模态大模型的后训练相关技术,研判RL在多模态理解上的潜力。
1、主导多模态大模型(Keye)基座模型的后训练全流程优化,包括指令微调(SFT)、强化学习(RLHF/DPO/PPO)、模型蒸馏等技术的研发与工程实现,持续提升模型在通用领域及垂直领域(如短视频理解、电商理解)的泛化能力和安全性; 2、参与多模态合成数据生成(覆盖纯文本、图文及视频等内容理解维度)、建立数据质量评估体系,设计数据蒸馏流程,推动数据-模型-评测迭代优化; 3、面向短视频社区、电商内容理解等场景,解决后训练阶段的核心挑战,如跨模态对齐一致性、长上下文推理、多任务指令冲突优化以及多模态智能推理探索等;推动技术成果转化,主导模型在快手短视频社区的集成落地(例如RAG增强系统、多模态Agent任务规划),并通过API封装与服务化支撑业务创新; 4、跟踪前沿多模态大模型后训练技术的前沿演进,探索SFT自动化迭代、轻量化RLHF以及reward model一体化等创新技术方向,形成专利或顶会论文提升团队技术影响力。
针对当前多模态大模型在后训练阶段面临的模态割裂、对齐效率低、奖励信号稀疏且场景泛化能力弱等关键挑战,本课题聚焦于构建统一的多模态大模型后训练算法体系。研究内容主要包括三个方面: 1、探索模型高效对齐的后训练算法,结合指令微调、偏好学习与知识蒸馏技术,提出低资源、高响应的对齐范式,实现模型行为与人类意图的高度契合。通过构建“奖励驱动—训练加速—对齐优化”三位一体的后训练框架,推动多模态大模型向更智能、更可靠、更可控的方向持续演进,为通用人工智能提供可复用、可扩展的算法基础设施; 2、开展超大规模强化学习(RL)训练架构优化,研究分布式训练中的梯度同步策略、样本效率提升方法与稳定收敛机制,支撑千亿级甚至万亿级参数模型在多模态环境下的高效策略优化; 3、设计面向通用场景的多模态统一奖励系统(Reward System),融合语言、视觉等多维信号,构建细粒度、可泛化的奖励函数,实现跨模态语义一致性与任务目标的联合建模。
我们正在构建具备物理世界感知、理解、仿真能力与支撑数字世界高质量呈现的本地生活视觉技术引擎,让每一次连接更智能,让物理世界的烟火气更美好。 团队介绍: 作为美团官方的视觉AI基础模型团队,负责数字世界和物理世界等本地生活全场景多模态技术的前沿探索和应用,在AIGC生成、虚拟人交互、多模态理解等领域持续沉淀行业领先的技术成果。 研究方向包括但不限于: 1、基于多模态预训练和后训练相关技术创新,提升多模态大模型在OCR、文档图表解析、Visual Grounding、细粒度感知、视觉问答等核心视觉理解任务上的能力上限; 2、索多模态强化学习方案创新设计,实现视觉感知、多模态理解等场景下的高性能可信输出和幻觉抑制; 3、增强模型的视觉推理能力(Visual CoT、PRM等)、工具调用与Agent能力、长上下文视觉理解能力和GUI能力,提升模型在视觉感知、理解、规划决策的长程复杂任务上的综合表现。
