哔哩哔哩多模态内容理解实习生
任职要求
- 计算机、人工智能、电子信息等相关专业本科及以上全日制在读,2027届及以后毕业; - 扎实的计算机视觉基础,有VLM相关的实习、科研或竞赛经历; - 熟悉Python编程,掌握PyTorch等主流深度学习框架,熟练使用Vibe cod…
工作职责
- 参与多模态大模型(VLM)在内容安全场景的研究与落地,涵盖数据自动标注、模型微调及效果评估; - 协助识别与分析图像/视频中的安全风险(如违规、低俗、欺诈、暴力等),推动检测能力迭代; - 参与高质量数据集的构建、清洗与分析,驱动模型在安全场景下的持续优化; - 跟进多模态理解、内容安全等领域的前沿进展,参与团队技术分享与方案创新。
ByteIntern:面向2027届毕业生(2026年9月-2027年8月期间毕业),为符合岗位要求的同学提供转正机会。 团队介绍:团队负责抖音、抖音极速版、抖音火山版等App的直播体裁基建和直播营收业务,直播体裁基建立足对边生产边分发时效性高的直播体裁的理解,结合多模态信号理解动态的时间切片和长尾兴趣点,建立短视频域到直播域的兴趣迁移,在全场景分发直播体裁,满足用户看播需求并服务于营收、电商、生活服务、游戏等多业务。直播营收致力于为歌唱/舞蹈/弹奏/朗读/情感/户外等广泛的具有一技之长的普通人通过直播这个舞台被更多人看到获得收入,并满足用户多层次的精神消费和情感表达诉求,让优质内容供给持续增长反哺整个直播生态。 1、研究方向:提升视频、音频、图像、文本及多模态的大模型基础能力,在业务领域与通用领域取得行业领先的效果,建设体系化的模型能力提升方法论;探索理解大模型与生成大模型能力结合互补模式,探索并落地一体化模型并取得更高的模型效果;推动多模态内容理解能力在推荐场景的落地应用; 2、负责抖音直播业务场景下的内容理解工作,建设多模态大模型、生成式模型等前沿模型技术能力,接近人类感知认知模型能力,产出相应的研究成果; 3、跟进行业最新技术进展,探索多模态方向的新技术研究与落地。
1. 负责基于多模态内容理解的应用能力建设以及技术沉淀,如图像/视频理解、内容审核以及多模态生成等,服务用户增长、营销、搜索、推荐等流量分发场景。 2. 参与多模态大模型前沿技术的探索及落地,尝试前沿的技术方案创新。
岗位课题: 探索生成和理解统一模型对视觉理解的增益 课题项目背景: 基于推荐和内容场景,通过多模态、大模型技术,应用于内容质量审核、内容基础信息完善、推荐泛化性探索等场景;我们有海量的商品、用户行为数据,能让实习生将前沿技术落地,并在真实应用和用户反馈中实现技术价值。 岗位职责: 在这里,你将深度参与并探索多模态、大模型技术给推荐、内容应用场景带来的新可能、新突破。这些技术成果,也将具体体现在每日用户使用和反馈的效果提升上。