logo of alibaba

阿里巴巴研究型实习生-多模态理解和生成统一模型(图像+视频+音频方向)

实习兼职阿里巴巴研究型实习生地点:北京 | 杭州状态:招聘

任职要求


1、在读博士,计算机视觉、多模态理解和表征学习、Vision-Language理解和生成大模型相关训练经验和落地经验者优先。
2、熟练掌握计算机视觉领域的基础理论和方法,熟悉P…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


1、理解-生成融合范式: 研究理解模型和生成模型的有效融合范式,例如探索Diffusion-Transformer (DiT) 和 Auto-Regressive (AR) 模型的融合与交互方式。
2、融合音频数据的统一模型: 将音频数据融入现有的多模态理解和生成框架,构建更全面的多模态统一模型。
3、统一Tokenizer研究: 探索适用于图像、视频、音频等多种模态生成和理解的统一Tokenizer,提高模型的泛化能力和效率。
包括英文材料
OpenCV+
大模型+
PyTorch+
深度学习+
模式识别+
CVPR+
还有更多 •••
相关职位

logo of alibaba
实习阿里巴巴研究型实

1.负责多模态理解大模型的前沿算法研究、实现与优化,重点攻克图像/视频理解、视觉问答、跨模态交互等关键任务。 2.参与构建和清洗大规模多模态数据集,探索数据增强策略,并可能建设高效的数据生产、标注和评估 pipeline,涵盖通用数据、视频、OCR等场景。 3.具备技术前瞻性与创新能力,跟踪国际最新技术动态,探索如多模态理解创新架构、音视频理解、Agentic RAG、AI Memory等新方向,并提出创新算法或方案,推动学术前沿发展。

更新于 2026-07-27杭州|上海
logo of tongyi
实习通义研究型实习生

1.负责多模态理解大模型的前沿算法研究、实现与优化,重点攻克图像/视频理解、视觉问答、跨模态交互等关键任务。 2.参与构建和清洗大规模多模态数据集,探索数据增强策略,并可能建设高效的数据生产、标注和评估 pipeline,涵盖通用数据、视频、OCR等场景。 3.具备技术前瞻性与创新能力,跟踪国际最新技术动态,探索如多模态理解创新架构、音视频理解、Agentic RAG、AI Memory等新方向,并提出创新算法或方案,推动学术前沿发展。

更新于 2025-12-02杭州|上海
logo of quark
实习日常实习生

1. 参与图像生成、图像编辑和文档理解其中一个方向的工作,围绕效果和速度,通过算法创新持续提升业务天花板; 2. 围绕扩散模型、生成加速、融合模型等方向,不断探索前沿算法,保持方案领先性,助力业务取得效果突破; 3. 围绕数据构建、vae、dit、moe、训练策略等环节,挖掘突破口,持续改进提升。

更新于 2026-01-29北京|杭州
logo of alibaba
实习阿里巴巴研究型实

1. 协助团队开展多模态大模型算法研发工作,参与语音/音频生成、理解等核心技术的研发与测试; 2. 辅助研发多模态内容理解模型,协助搭建高精度、细粒度的内容描述体系,完成基础数据标注与整理工作; 3. 参与训练数据集的搭建、清洗、整理与标注,助力模型迭代优化,配合完成数据集相关基础调研; 4. 协助推进多模态大模型在核心业务中的落地测试,参与技术实用化过程中的效果验证与问题反馈; 5. 跟踪多模态大模型、音频AI领域行业前沿技术,协助整理前沿技术资料,参与团队技术研讨与学习。

更新于 2026-06-29北京|杭州