字节跳动内容理解算法工程师-Data
任职要求
1、精通CV/NLP/音频至少两类单模态算法,具备跨模态融合、多模态预训练落地经验; 2、扎实的机器学习基础,精通深度学习、LLM、多模态生成模型原理,数理功底扎实、自学能力强; 3、编码能力扎实,熟练使用主流机…
工作职责
1、多模态内容理解体系搭建:构建视频图文多模态表征体系,融合视觉、音频、文本完成多层级语义刻画,搭建细粒度内容标签体系,解决特定场景素材语义理解等问题; 2、多模态算法全链路研发落地:负责构建离线算法实验与在线模型评估体系,保障模型指标与业务目标对齐; 3、前沿技术与Agent落地探索:探索多模态大模型内容理解、内容生成、算法智能Agent等创新方案,完成模型评测、算法工程化落地,协同团队迭代内容认知底座。
作为AI智慧观赛产品团队的核心算法成员,负责驱动体育赛事视频内容理解技术的研发与创新。目标是让系统精准、实时地识别赛事中的核心元素与关键事件,为AI智能解说、多维赛场智瞰等核心功能提供高质量底层数据支撑,最终打造业界领先的AI观赛体验。 1. 核心视觉模型研发:负责体育赛事视频理解核心模型的构建、训练与优化,重点研究实时目标检测与跟踪(球员、球、裁判、场地标识等)、行为动作识别(射门、传球、运球、击球等)、关键事件检测(进球、犯规、得分、暂停等)技术,确保赛事核心信息捕获的准确性与实时性。 2. 多场景适配与鲁棒性优化:针对足、篮、乒等不同赛事的运动特性、场地规则差异,以及光照变化、遮挡、快速运动模糊等复杂场景,优化模型的泛化能力与鲁棒性,保障跨赛事、跨场景的稳定识别效果。 3. 视频语义信息提取:设计并实现赛事结构化数据生成方案,从视频流中提取球员轨迹、攻防转换节奏、战术阵型变化等语义信息,将原始视频数据转化为可被大模型理解的结构化特征与事件标签。 4. 实时性与工程化落地:优化模型推理速度与资源占用,结合TensorRT等推理加速框架,实现视频理解算法的端到端高效部署,满足赛事直播
1、负责快手短视频多模态内容理解工作,应用计算机视觉、NLP、多模态融合等技术,提升短视频内容体系建设、推荐、搜索的效果和体验; 2、基于多模态模型在下游业务上的应用,包括并不限于多模态分类、标签、caption等文本生成等; 3、负责计算机多模态理解方向前沿问题的研究,参与建设并持续保持部门在多模态业界的技术先进性,保持创新的同时将业界SOTA模型持续优化并落地至线上获得收益。
1.多模态内容理解与违规识别:构建融合商品标题文本、主图/详情图、视频素材、商家资质文件等多模态信息的理解与审核算法,实现对违禁商品、资质不符、山寨侵权等风险的自动化精准识别; 2.业务大模型研发与训练:基于电商入驻审核场景的海量数据,将商品、店铺等垂类审核知识注入基础大模型,通过指令微调(SFT)、偏好对齐(RLHF/DPO)、CoT推理等技术,训练具备精准识别垂类违规能力的业务大模型,持续提升机审决策率与准确率; 3.人机协同提效:设计机审辅助人审的技术方案,通过置信度分层、违规线索高亮、审核理由自动生成、难例智能路由等机制,为人审团队提供结构化决策支持,全面提升人工审核效率与准确度; 4.审核系统基建优化:持续优化微信电商入驻审核系统的工程架构,提升审核链路的可用性、时效性与吞吐能力,保障审核服务在高并发场景下的稳定运行; 5.数据闭环与效果监控:建立模型评测基准与效果监控体系,构建"模型预测→badcase归因→数据标注→策略迭代→模型升级"的完整闭环,驱动审核能力的持续进化; 6.前沿技术探索:跟踪大模型(LLM/VLM)、多模态预训练模型、RAG、Agent等前沿技术进展,探索其在电商审核场景(如少样本违规检测、审核规则自动生成、知识图谱辅助决策等)中的创新应用。