logo of alibaba

阿里巴巴万相Wan数据算法实习生

实习兼职阿里巴巴日常实习生地点:北京 | 杭州状态:招聘

任职要求


1.对图像/视频生成大模型领域有浓厚兴趣,具备极强的研发热情和自驱力,能够跟进最前沿的行业动态。
2.具备很强的动手能力,熟练掌握 PyTorch 框架;熟悉包括但不限于 LLM、VLM、Diffusion Models等相关算法。
3.具备优秀的逻辑分析能力,能够准确定义问题并设计解决方案;具备良好的团队合作意识和跨团队沟通能力。
…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


在 AIGC 技术浪潮的驱动下,图像与视频生成领域正经历着效果跃迁的关键阶段。这一演进不仅依赖于算法结构的创新,更对数据资产的规模化、精细化处理以及科学的评测提出了前所未有的挑战。
万相Wan致力于研发世界领先的图像/视频生成模型,在世界模型、原生多模态预训练、理解-生成融合范式、以及人类反馈强化学习等前沿领域保持深厚的技术储备与深度探索。高质量、体系化的数据资源与完备的模型评测体系是驱动模型能力涌现的核心底座。因此,我们诚挚邀请具备创新精神的实习生加入,共同构建驱动多模态生成大模型持续进化的底层基石,探索具有突破性的技术创新。

岗位职责:
1.规模化数据链路构建:深入理解图像/视频生成大模型的任务目标,设计并实现严谨的、可扩展的数据处理链路,实现海量数据的清洗、归类与规模化产出,支撑基础大模型的高效迭代。
2.精品和RLHF数据构建:与算法工程师密切合作,拆解算法目标和需求,设计详细的数据体系,并能够使用多领域专家模型来构建精品和RLHF数据的解决方案,及其开发和维护。
3.图像/视频模型评测:建立专业且详尽的图像/视频生成质量评估方法和基准测试,通过数据实验分析定位模型瓶颈,指引算法优化方向。
4.数据质量评测:设计并利用多个专家模型对海量预训练或者精品数据进行定量/定性评测分析,建立“数据-模型-反馈”体系,帮助实现数据质量的持续迭代。
5.前沿技术探索:持续优化链路效率与易用性,探索并落地业界最新的图像/视频数据处理技术,并在业务中使用。
包括英文材料
大模型+
还有更多 •••
相关职位

logo of alibaba
实习阿里巴巴2027

随着大模型技术的飞速发展,理解和生成多模态数据(图像、视频、音频、3D素材等)的能力日益增强。目前,构建能够同时进行输入和输出的多模态世界模型已成为业界的研究热点,也是实现通用人工智能(AGI)的重要技术路径之一。 万相Wan将持续在世界模型、原生多模态预训练、理解-生成融合范式、统一Tokenizer研究、人类反馈与强化学习等前沿技术方向上进行探索,始终追求在多模态世界模型领域的领先研究地位,致力于建立世界级的技术影响力。 多模态世界模型前沿技术研究项目,团队在多个方向上进行探索(具体如下罗列),若你对以下一个或者多个课题感兴趣均欢迎投递: 1. 世界模型,包括但不限于:长视频生成、多模态交互式世界模型、实时音视频生成、生成驱动的世界渲染引擎、3D/4D生成。 2. 原生多模态预训练,包括但不限于:融合语言与图像理解生成统一的多模态模型、音视频融合的生成模型、高效多模态预训练算法。 3. 人类反馈与强化学习,包括但不限于:基于规则的强化学习策略、高效 DPO 与 PPO 算法设计、基于用户反馈的RLHF视频生成质量提升。 4. 统一Tokenizer研究,包括但不限于:适用于图像、视频、音频等多种模态生成和理解的统一Tokenizer、提高多模态模型的泛化能力和效率。 5. 大模型训练/推理优化,包括但不限于:模型蒸馏、模型剪枝、attention计算近似等高效训练加速策略。

更新于 2026-03-17北京|杭州
logo of alibaba
实习阿里巴巴研究型实

多模态生成模型前沿技术研究项目,旨在进行如下课题研究: 1. 模型架构与 Scaling Law:探索面向视频生成的高效 DiT/MoE 架构,通过Attention优化、Optimizer优化、VAE 表征极限压缩,研究视频生成的 Scaling Law, 提升长时序与物理一致性生成能力; 2. 音视频多模态对齐:解决视频与音频在时序、语义、情绪上的强一致性问题,支持文本/图像/视频/音频等多任务统一建模; 3. 多模态生成后训练:基于 WAN基模与 RLHF/Continue Learning 后训练范式,多维度奖励模型探索,缓解长视频中的漂移、形变与物理遵循问题; 4. 实时视频生成:探索Streaming、量化、注意力机制优化、CUDA 并行计算及模型蒸馏等技术,建立实时视频生成的 pipeline 级别技术解决方案与算法; 5. 多模态交互式世界模型:研究多模态交互式世界模型技术框架,探索多模态生成领域的新范式。

更新于 2026-05-22北京|杭州
logo of tongyi
社招3年以上技术-游戏技术

1. 负责Wan视频生成模型的美学效果设计与数据标准建设,参与模型后训练迭代循环,基于编导、视觉、视听、表演、动画、特效等专业领域知识,设计视频数据的标注维度、质量标准和分级体系,将感性审美判断转化为可执行的结构化规则。 2. 专业数据的收集工作,制定数据采集方向与分布平衡策略,参与标注员培训与质检,确保送入模型的每一条数据都有可靠的专业标签。熟练运用AI工具辅助标注规范撰写与标注,提升数据建设效率。 3. 搭建覆盖叙事结构、视觉语言、视听关系、角色表演、运动规律等多维度的模型评测体系,对Wan模型生成的视频样本进行专业级评审,定位各维度的能力缺陷,输出结构化的评估报告,形成"评估→缺陷定位→数据优化→模型迭代"的闭环。 4. 持续洞察AI行业前沿动态及影视行业技术趋势,深入分析视频生成模型的用户需求与能力边界,开展相关评测方向的前置探索与实验。 5. 与算法、工程、产品等团队深度协作,将专业领域意见以技术语言清晰传达,推动模型在叙事逻辑、光影质感、音画情绪协同、表演自然度、运动合理性等核心维度上持续提升。

更新于 2026-07-10北京|杭州
logo of tongyi
社招2年以上

【部门介绍】 随着大模型技术的飞速发展,理解和生成多模态数据(图像、视频、音频、3D素材等)的能力日益增强。目前,构建能够同时进行输入和输出的多模态世界模型已成为业界的研究热点,也是实现通用人工智能(AGI)的重要技术路径之一。 万相Wan将持续在世界模型、原生多模态预训练、理解-生成融合范式、统一Tokenizer研究、人类反馈与强化学习等前沿技术方向上进行探索,始终追求在多模态世界模型领域的领先研究地位,致力于建立世界级的技术影响力。 【工作内容】 1. 探索大规模多模态理解生成统一基础模型,包括但不限于:统一建模设计、高效模型结构设计、高效Scaling、视觉Tokenizer、多模态联合训练等。 2. 探索和突破多模态强化学习,包括但不限于:视觉CoT、面向复杂视觉设计任务的强化学习设计、基于用户反馈的在线自学习等。 3. 构建基于生成模型的真实世界渲染引擎,探索新的多模态交互范式,探索虚拟和真实世界的强化反馈链路设计。

更新于 2026-07-10北京|杭州