logo of alibaba

阿里巴巴视频生成模型工程师-Agentic视频生成

实习兼职阿里巴巴日常实习生地点:杭州状态:招聘

任职要求


1. 计算机、人工智能、数学等相关专业,硕士/博士在读优先;
2. 熟悉PythonPyTorch,具备优秀的算法实现与代码工程能力;
3. 熟悉扩散模型(Diffusion Models/DiT)或视频生成相关技术,理解主流LLM/MLLM基础架构,有SFT/…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


围绕Agentic视频生成方向,开展视频智能体架构设计、多镜头一致性控制和推理侧扩展相关研究,推动视频生成模型从“单点工具”向“自主系统”演进,并服务于广告营销、短剧创作等实际业务落地。

你将参与以下一个或多个方向的工作: 
1. 视频Agent工作流构建:面向复杂剧情生成场景,研究视频Agent的核心组件,包括任务自主拆解、长短期记忆机制、工具调用及自我反思与修正。通过SFT/RLHF/DPO等后训练技术,提升模型在分镜规划与多维指令遵从上的能力,探索从模糊意图到高质量长视频生成的端到端智能体方案。 
2. 可控生成与长视频能力:面向商业级视频交付需求,研究基于Agent上下文记忆的多镜头一致性控制算法,攻克复杂场景下角色IP、场景特征与运动规律的稳定性难题。通过后训练,重点突破长视频生成的时空稳定性与长效剧情逻辑,提升模型在长时序列下的生成质量。同时研究视频大模型在推理阶段的Test-time Scaling策略,突破模型在复杂提示词下的语义对齐上限。 
3. 视频智能体评测与进化:构建完善的视频Agent量化评测体系,涵盖视觉一致性、意图命中率、任务完成度等核心维度,打通从数据采集、自动评测到模型在线迭代的闭环。结合广告、漫剧等具体业务场景,参与Agent系统的设计与优化,显著提升商业化视频生成的可用率与交付效率。
包括英文材料
Python+
PyTorch+
算法+
大模型+
还有更多 •••
相关职位

logo of pinduoduo
社招技术类

1. 负责大模型(LLM/VLM), 视频生成、数字人相关算法服务高性能推理服务研发与部署; 2. 负责大语言模型(VLM/LLM)应用系统的架构设计与工程实现; 3. 主导大模型微调, 模型压缩、量化(INT8/AWQ)及性能调优,深度应用TensorRT-LLM, vLLM, Triton等推理引擎; 4. 推动大模型,视频生成,图片生成等生成服务在电商(如数字人、带货视频)场景的工程化落地与性能保障。

更新于 2025-11-28上海
logo of amap
社招3年以上技术类-算法

团队介绍: 高德地图机器学习研发部是公司AI核心技术引擎,聚焦多模态大模型、视频生成与理解、图像编辑与生成等前沿领域。团队深耕人工智能技术落地,支撑亿级用户产品,同时长期投入前沿探索,在NeurIPS/ICLR/CVPR/ICCV/ACL等顶会发表多篇论文,多项成果入选“最有影响力论文”榜单。我们拥有海量数据与算力资源,鼓励创新突破,诚邀你与顶尖算法专家并肩,共同定义AI的未来!如果你渴望挑战多模态与生成式AI的技术巅峰,在视频、图像、大模型的交叉领域实现突破,欢迎加入我们!团队的github页面是:https://github.com/AMAP-ML/ 我们提供 • 参与亿级用户产品的AI核心算法研发,见证技术直接赋能业务; • 与学术大牛和工业界专家共事,持续提升技术视野; • 顶配算力资源+开放创新氛围,支持前沿探索与顶会论文发表。 具体职责包括但不限于: 1. 视频生成:负责视频生成技术的前沿技术的研究,包括world model,对AIGC的diffusion和auto-regressive技术有深入了解,在T2I/AIGCT2V/I2V上面有一定的研究,图文对齐,长视频生成等有一定的研究,做好视频生成在高德业务(广告,POI详情页等)中的进行落地。 2. 视频理解:能够使用和优化多模态大模型对用户上传的视频进行质量理解,标签,densecaption,视频summary等生成,作用到视频的搜索,广告,推荐等业务的落地。 3. 世界模型: 参与世界模型的构建,能够使用最新的视频生成技术,包括:SFT,RL,DMD+Forcing等工作,3D技术等构建符合人类物理规律的统一的世界模型,在高德的业务进行落地。 4. 紧跟技术前沿和技术沉淀,形成顶会论文和专利。

更新于 2026-07-10北京
logo of amap
社招2年以上技术类-算法

我们是高德视觉技术中心,专注于以计算机视觉技术为核心的前沿研究与创新应用,致力于打造时空互联网领域的核心技术能力。 我们致力于构建 “真实世界 × 虚拟世界” 的生成式世界模型,引领多模态 AI 赋能智慧出行和日常生活。团队成员参与端到端 3D+视频+语言 大模型的研发,与阿里云算力、十亿级全域图像 / 点云 / 出行数据深度结合,让算法在真实应用中产生即时经济价值与社会影响力。 团队主页:https://github.com/amap-cvlab 岗位职责: 1. 核心算法研发:主导 1B-100B 参数级世界模型 / VLA / VLM 网络的整体方案与关键模块创新; 2. 高效预训练与微调:构建跨模态自监督目标(时序一致性、物理一致性、语言对齐等),并推动 SFT → DPO → RL-HF 全链路落地上线; 3. 跨模态推理与生成:针对 3D 场景、连续视频、语言描述开展对齐、生成与评估实验,推动端到端模型落地。创新3D场景/连续视频/交互策略/语言描述等跨多种模态的端到端理解与生成; 4. 产线落地与性能优化:与地图引擎、自动驾驶、智能导航等业务协同,迭代模型压缩、Edge-Cloud 混合部署、隐私数据训练; 5. 技术沉淀与传播:完成技术调研、实验复现、消融与报告撰写,将成果转化为论文、专利等技术沉淀。

更新于 2026-01-15北京
logo of aligenie
社招2年以上技术类-算法

我们是高德视觉技术中心,专注于以计算机视觉技术为核心的前沿研究与创新应用,致力于打造时空互联网领域的核心技术能力。 我们致力于构建 “真实世界 × 虚拟世界” 的生成式世界模型,引领多模态 AI 赋能智慧出行和日常生活。团队成员参与端到端 3D+视频+语言 大模型的研发,与阿里云算力、十亿级全域图像 / 点云 / 出行数据深度结合,让算法在真实应用中产生即时经济价值与社会影响力。 团队主页:https://github.com/amap-cvlab 岗位职责: 1. 核心算法研发:主导 1B-100B 参数级世界模型 / VLA / VLM 网络的整体方案与关键模块创新; 2. 高效预训练与微调:构建跨模态自监督目标(时序一致性、物理一致性、语言对齐等),并推动 SFT → DPO → RL-HF 全链路落地上线; 3. 跨模态推理与生成:针对 3D 场景、连续视频、语言描述开展对齐、生成与评估实验,推动端到端模型落地。创新3D场景/连续视频/交互策略/语言描述等跨多种模态的端到端理解与生成; 4. 产线落地与性能优化:与地图引擎、自动驾驶、智能导航等业务协同,迭代模型压缩、Edge-Cloud 混合部署、隐私数据训练; 5. 技术沉淀与传播:完成技术调研、实验复现、消融与报告撰写,将成果转化为论文、专利等技术沉淀。

更新于 2026-04-02北京