通义通义实验室 - 通义万相原生多模态世界模型前沿技术研究 - 阿里星
任职要求
1. 来自全球Top高校计算机科学、人工智能、数学、物理或相关领域应届博士/顶尖硕士毕业生。 2. 在国际顶级计算机会议/期刊(如NeurIPS、CVPR、ICLR、ECCV、TPAMI等)以一作身份发表过多篇论文,或在开源社区、竞赛中展示出引领性的研究成果。 3. 对Diffusion Models、GANs、VAEs等生成模型有深入理解,熟悉基于Transformer架构的自回归生成模型、DiT等扩散模型;在语言-视觉联合建模、图文/视频生成任务方面有系统性理解,熟悉CLIP/VLM 等跨模态模型架构,并至少在生成模型或语言-视觉联…
工作职责
随着大模型技术的飞速发展,理解和生成多模态数据(图像、视频、音频、3D素材等)的能力日益增强。目前,构建能够同时进行输入和输出的多模态世界模型已成为业界的研究热点,也是实现通用人工智能(AGI)的重要技术路径之一。 通义万相(Wan)将持续在世界模型、原生多模态预训练、理解-生成融合范式、统一Tokenizer研究、人类反馈与强化学习等前沿技术方向上进行探索,始终追求在多模态世界模型领域的领先研究地位,致力于建立世界级的技术影响力。 多模态世界模型前沿技术研究项目,团队在多个方向上进行探索(具体如下罗列),若你对以下一个或者多个课题感兴趣均欢迎投递: 1. 世界模型,包括但不限于:长视频生成、多模态交互式世界模型、实时音视频生成、生成驱动的世界渲染引擎、3D/4D生成。 2. 原生多模态预训练,包括但不限于:融合语言与图像理解生成统一的多模态模型、音视频融合的生成模型、高效多模态预训练算法。 3. 人类反馈与强化学习,包括但不限于:基于规则的强化学习策略、高效 DPO 与 PPO 算法设计、基于用户反馈的RLHF视频生成质量提升。 4. 统一Tokenizer研究,包括但不限于:适用于图像、视频、音频等多种模态生成和理解的统一Tokenizer、提高多模态模型的泛化能力和效率。 5. 大模型训练/推理优化,包括但不限于:模型蒸馏、模型剪枝、attention计算近似等高效训练加速策略。
核心职责 产品规划与技术洞察 1. 持续跟踪全球视频图像AIGC领域的前沿技术进展,包括但不限于扩散模型、视频生成、多模态大模型、3D生成等方向; 2. 深入分析Veo3、Sora等主流视觉生成能力模型的演进趋势,评估其在企业级应用和创作中的可行性,以及有自己的思考和市场洞察; 3. 建立商业化产品的演进方向和市场选择以匹配模型快速发展的需要,满足对应客户的诉求下产品设计与商业化落地; 4. 负责ToB视频图像AIGC产品的全生命周期管理,从0到1构建产品体系,实现从技术demo到规模化商业化的跨越; 5. 深度理解企业客户需求,设计符合B端业务场景的AI解决方案,并产出对应的培训手册和评价体系; 6. 主导商业化策略制定,包括定价模型、客户分层和选型、商业模式等,确保产品具备清晰的商业价值和盈利模式; 7. 定期产出客户反馈以指导产品的迭代和商业覆盖策略跨团队协作。 跨团队协作 1. 与算法团队紧密合作,将前沿研究成果转化为可落地的产品功能,平衡技术先进性与工程可行性,交付可被行业广泛使用的产品; 2. 与前线销售及市场团队协作,建立从需求挖掘到客户交付的完整闭环,提升客户满意度和商业规模的增长数据驱动与效果优化; 3. 建立产品核心指标体系,通过数据驱动产品迭代优化; 4. 建立模型效果的评测体系以链接市场需求与创作要求; 5. 持续监控模型性能、用户体验、商业转化等关键指标,快速响应市场变化; 6. 定期输出商业化案例,形成可复制的成功模式。
作为通义万相的AI infra训推优化团队,你将有机会参与或负责以下工作内容: ● 对推理引擎的运行时环境进行深度优化,减少延迟,提高整体性能; ● 针对多种异构AI加速硬件,对核心算子进行极致性能优化,结合量化、蒸馏、cache等技术,降低视频推理成本; ● 开发智能的请求调度算法,确保高并发场景下的最优响应时间和吞吐量; ● 持续关注并跟进业界技术发展,积极尝试和探索新的推理优化方向,提出并验证创新性的解决方案。

1. 负责机器人操作系统的整体软硬件集成与真机部署,完成机械臂、传感器、计算单元等系统的搭建、调试与优化,构建稳定可靠的机器人运行环境。 2. 负责实时遥操作系统的开发与优化,满足高时效性和可靠性要求,设计并搭建真机评测体系与数据管线。 3. 解决真实机器人系统中的部署问题(延迟、标定误差等),优化异步推理系统(RTC等),设计安全保护机制(碰撞检测、异常行为监测、急停),持续提升系统鲁棒性与安全性。 4. 协同算法、数据、硬件团队,将前沿算法成功转化为可稳定运行的机器人系统,推动在真实场景和任务的落地闭环。
近年来,以大模型为核心的生成式人工智能技术在语言理解、内容生成、多模态建模与跨模态交互等领域取得了突破性进展,展现出前所未有的技术潜力与广泛的应用前景。 我们致力于通用人工智能(AGI)方向的前沿探索与产业落地创新。一方面,在迈向AGI的长期路径中,随着大语言模型能力的持续进化,多模态感知、融合与推理等关键问题日益凸显,成为构建通用智能系统的核心挑战;另一方面,围绕典型行业场景(如智能交互、高质量内容生成、跨模态检索与理解等),如何将现有大模型能力有效转化为可落地、可扩展、可持续的解决方案,也成为当前研究与工程实践的重点方向。 如果你对生成式AI、通用人工智能(AGI/ASI)前沿探索、多模态建模与智能交互系统有浓厚兴趣,并渴望深入参与下一代多模态通用模型的研发与演进,欢迎加入我们,共同定义未来AI的能力边界,牵引千行百业在智能时代的深度变革。 1. 多模态大模型算法创新:定义下一代多模态通用大模型技术范式,实现文本、语音、视觉模态的联合建模,探寻和解决多模态对齐、推理、Agentic等方面的核心挑战,不断追寻多模态通用大模型的效果上限。 2. 场景驱动的算法创新:结合业务场景(如智能交互、内容生成、跨模态检索等),设计并优化大模型架构,提升效果、效率与鲁棒性。 3. 端到端技术闭环:从数据构建、模型训练、评测到部署,主导技术方案落地,通过AB实验、调用量、用户反馈验证价值。 4. 前沿应用技术探索:紧跟并能驱动LLM、Diffusion Models、强化学习等技术相关进展,定义技术新范式,快速实验并迭代创新方案,拉升相关模型SOTA。