哔哩哔哩后训练数据算法实习生(视频生成方向)
实习兼职技术类地点:上海状态:招聘
工作描述
工作职责: 1. 面向视频生成模型的 SFT、偏好优化和强化学习,设计并构建高质量后训练数据。 2. 分析模型在指令遵循、主体一致性、动作生成、复杂运镜、时序稳定性、物理规律和视觉审美等方面的能力短板。 3. 建设细粒度评测和错误分类体系,对模型失败案例进行聚类、归因和优先级判断。 4. 研究难例挖掘、数据筛选、数据合成、拒绝采样、偏好构造和数据配比等策略。 5. 建设视频生成偏好数据,包括 Pairwise Ranking、评分标准、标注规范及质量控制机制。 6. 探索基于多模态模型、Reward Mod…
登录查看完整工作描述
微信扫码,1秒登录
包括英文材料
SFT+
https://cameronrwolfe.substack.com/p/understanding-and-using-supervised
Understanding how SFT works from the idea to a working implementation...
强化学习+
https://cloud.google.com/discover/what-is-reinforcement-learning?hl=en
Reinforcement learning (RL) is a type of machine learning where an "agent" learns optimal behavior through interaction with its environment.
https://huggingface.co/learn/deep-rl-course/unit0/introduction
This course will teach you about Deep Reinforcement Learning from beginner to expert. It’s completely free and open-source!
https://www.kaggle.com/learn/intro-to-game-ai-and-reinforcement-learning
Build your own video game bots, using classic and cutting-edge algorithms.
还有更多 •••
相关职位
社招深度学习研究员
【团队使命】 通过高质量后训练数据与前沿算法,最大化释放Base模型潜能,打造兼具强大智能与深度意图理解力的AI模型。使得模型既能解决最难的问题,也能读懂每一个意图,更能作为自主Agent在复杂真实世
北京|杭州

校招算法
1、2027届本科及以上学历,计算机、软件工程、人工智能等相关专业 ; 2、对通用人工智能和基础模型长期发展有强烈兴趣,具备优秀的学习能力、工程意识、团队协作能力和结果导向; 3、 具备较强的 AI
更新于 2026-07-07北京|深圳|上海

校招算法
1、2027届本科及以上学历,计算机、软件工程、人工智能等相关专业 ; 2、对通用人工智能和基础模型长期发展有强烈兴趣,具备优秀的学习能力、工程意识、团队协作能力和结果导向; 3、 具备较强的 AI
更新于 2026-07-07北京|深圳|上海
