哔哩哔哩视频大模型算法实习生(基础模型)【2027届】
任职要求
1.具备多模态大模型的相关知识,熟悉VLM、video VLM以及长视频内容理解,了解主流的开源模型。
2.熟悉VLM、video VLM的预训练、中训练、后训练等关键流程,具备数据…工作职责
1.探索视频多模态大模型的前沿技术,负责数据建设、模型训练与评测框架搭建。 2.深入研究并实践视频多模态大模型的全套训练流程,包括pretraining、mid-training、SFT、RL、on-policy distillation等。 3.跟踪并复现主流的开源视频多模态模型,进行前沿论文的调研、复现与创新。 4.协助优化视频内容理解、dense video caption、视频生成/编辑中的用户意图理解等相关任务上的模型效果,持续提高算法的性能与效率。
职位描述 我们是哔哩哔哩多模态视频生成技术团队。依托团队自研的业界领先 AniSora 动画生成系统及 AI 辅助智能创作工具链,我们正专注于 AI 动画与视频生成核心技术的深度研究与落地。我们的目标是打造面向未来的视频内容生产力平台,重塑创作范式。期待你加入我们,与优秀的技术伙伴并肩站在前沿,攻克实际技术难题。 工作描述: 1.下一代理解生成一体化模型的结构设计与研发,探索VLM-based Video Diffusion、Autoregressive Video Diffusion等多种技术路线; 2.研究及探索图像生成、VLM蒸馏模型的训练数据及训练策略; 3.设计及研发自动化评估方法,为模型研发与强化学习提供科学指导。
工作职责: 1.探索视频多模态大模型(video VLM)的前沿技术,负责数据建设、模型训练与评测框架搭建。 2.深入研究并实践视频多模态大模型的全套训练流程,包括预训练、继续预训练以及后训练。 3.跟踪并复现主流的开源视频多模态模型,进行前沿论文的调研、复现与创新。 4.协助优化视频内容理解、dense video caption等相关任务上的模型效果,持续提高算法的性能与效率。
1. 参与视频剧本生成 Agent 的算法研发与落地,围绕视频剧本生成、角色一致性、场景连续性、镜头编排、文案生成等核心能力,持续提升模型在真实业务中的可用性与稳定性。 2. 负责多 Agent 系统设计与 Harness Engineering,包括任务拆解、角色分工、状态管理、工具调用、反馈回路、自动评测等,构建可扩展、可迭代的 Agent 应用架构。 3. 参与大模型后训练与对齐优化,探索 agentic RL、SFT、偏好优化、过程奖励建模等前沿方法,提升模型的剧本写作能力、工具调用能力和复杂任务规划能力。 4. 结合业务场景设计数据构造、标注、评测和迭代方案,推动算法效果在视频创作、广告生成、内容生产等场景中的持续提升。 5. 跟踪大模型、Agent、强化学习等前沿技术动态,探索其在内容生成和创意生产场景中的创新应用。