阿里巴巴研究型实习生-万相Wan多模态生成前沿技术研究
任职要求
1. 硕士及以上学历,具备扎实的多模态或者机器学习算法基础,有成果发表在CVPR,NeurIPS,ICML,ICLR,TPAMI,IJCV等顶级会议期刊者优先。 2. 熟练掌握…
工作职责
多模态生成模型前沿技术研究项目,旨在进行如下课题研究: 1. 模型架构与 Scaling Law:探索面向视频生成的高效 DiT/MoE 架构,通过Attention优化、Optimizer优化、VAE 表征极限压缩,研究视频生成的 Scaling Law, 提升长时序与物理一致性生成能力; 2. 音视频多模态对齐:解决视频与音频在时序、语义、情绪上的强一致性问题,支持文本/图像/视频/音频等多任务统一建模; 3. 多模态生成后训练:基于 WAN基模与 RLHF/Continue Learning 后训练范式,多维度奖励模型探索,缓解长视频中的漂移、形变与物理遵循问题; 4. 实时视频生成:探索Streaming、量化、注意力机制优化、CUDA 并行计算及模型蒸馏等技术,建立实时视频生成的 pipeline 级别技术解决方案与算法; 5. 多模态交互式世界模型:研究多模态交互式世界模型技术框架,探索多模态生成领域的新范式。
基于开源的 Diffusion 图像和视频生成模型,构建基础推理和训练引擎,探索前沿的 AIGC 技术,具体职责包括: 1、加入魔搭社区 DiffSynth-Studio 等开源项目的开发,接入先进的图像和视频生成模型,为业界提供领先的推理和训练引擎基建。 2、基于丰富的开源模型生态,探索 AIGC 技术的全新能力,开展多元化的科研项目,包括但不限于图像生成的思维链、跨模态模型的能力集成、理解-生成统一架构模型等,发表高水平学术论文。 3、参与魔搭社区的运营活动,为新模型的开源提供技术支持,推动 AI 技术的普及推广。
阿里巴巴通义实验室-对话智能团队 以大模型对话技术为核心,研究及应用方向包括智能客服、个性化对话、角色扮演、分身复刻、社交智能、数字人等,主要业务场景包括: (1) 通义晓蜜—阿里云智能客服,国内对话式AI市占率第一; (2) 通义星尘-类人智能体创作平台。2020年以来,围绕预训练、对话智能、大模型等方向发表80+篇国际顶会论文,欢迎对大模型感兴趣的你加入我们,一起创造人机对话的未来。 拟研究技术方向: 1. 角色扮演技术(Role-Playing Agent)的研究,在相关性、人设一致性、吸引力、情感、道德等维度取得显著提升; 2. 分身复刻(Character AI)的研究,探索角色所处虚拟世界建模与演化; 3. 数字专家的研究,包括用户心理推断、策略搜索推理等技术; 4. 多模态Character模型的研究,包括语音端到端角色对话模型。
当前视觉语言模型(VLM)以通用图片和视频理解为主,而人物往往是图片或视频的重要组成部分,因此对图片、视频中的人物进行精准、精细的理解非常重要。本项目重点围绕人物视频,对视频中人物的行为变化、人与人的互动行为、人与物的互动行为等使用文字的方式进行理解。