logo of alibaba

阿里巴巴研究型实习生-视频理解与生成应用算法研究

实习兼职阿里巴巴研究型实习生地点:北京 | 杭州状态:招聘

任职要求


1. 博士在读,计算机相关专业优先;
2. base地可选北京和杭州,杭州优先;
3. 具有扎实的计算机视觉大模型算法基础,对主流大模型的原理和使…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


专注于视频理解与生成应用算法研究,具体研究内容包括:
1.视频理解:通过高质量数据构建方案,实现视频的精细主体/运动/场景描述以及长视频结构化描述(如人物关系、情节发展、故事主旨),支持长视频问答与精准时序定位。同时结合R1等前沿思维链技术解析复杂视频事件,视频逻辑推理等;
2.视频生成:聚焦视频DiT/AR等前沿架构下的垂类微调,包括复杂人体运动/场景动效生成与可控编辑技术,研究多模态指令驱动的视频编辑、人体运动增强及物理约束建模方法,提升生成视频的动态质量与风格迁移能力。
包括英文材料
OpenCV+
大模型+
算法+
CVPR+
还有更多 •••
相关职位

logo of tongyi
实习通义研究型实习生

1. 负责超长视频内容的前沿算法研究、实现与优化,重点攻克高效的长视频处理机制,如关键帧选择、特征压缩和记忆机制。 2. 参与构建和清洗大规模多模态数据集,优化长视频理解在视频问答、内容摘要等任务上的准确率,优化视频场景下模型的推理能力。 3. 具备技术前瞻性与创新能力,跟踪国际最新技术动态,探索如多模态理解创新架构、音视频理解等新方向,并提出创新算法或方案,推动学术前沿发展。

更新于 2025-12-18北京|杭州|上海
logo of alibaba
实习阿里巴巴研究型实

1. 负责超长视频内容的前沿算法研究、实现与优化,重点攻克高效的长视频处理机制,如关键帧选择、特征压缩和记忆机制。 2. 参与构建和清洗大规模多模态数据集,优化长视频理解在视频问答、内容摘要等任务上的准确率,优化视频场景下模型的推理能力。 3. 具备技术前瞻性与创新能力,跟踪国际最新技术动态,探索如多模态理解创新架构、音视频理解等新方向,并提出创新算法或方案,推动学术前沿发展。

更新于 2026-07-27北京|杭州|上海
logo of tongyi
实习通义研究型实习生

当前视觉语言模型(VLM)以通用图片和视频理解为主,而人物往往是图片或视频的重要组成部分,因此对图片、视频中的人物进行精准、精细的理解非常重要。本项目重点围绕人物视频,对视频中人物的行为变化、人与人的互动行为、人与物的互动行为等使用文字的方式进行理解。

更新于 2026-05-20杭州
logo of alibaba
实习阿里巴巴研究型实

聚焦文生视频模型的推理与训练加速技术,探索、设计并实现全新的算法与系统级解决方案。解决当前文生视频模型面临的最大瓶颈:高昂的计算成本与漫长的生成时间。

更新于 2026-05-06北京|杭州