哔哩哔哩【B-UP】多模态数据平台研发工程师(实习)
任职要求
1. 计算机、软件工程、大数据、人工智能等相关专业,本科及以上学历; 2. 熟练掌握 Go / Python / Java至少一门后端开发语言,具备良好代码风格,了解基础数据结构、计算机网络、操作系统知识。 3. 了解分布式系统基础概念,熟悉数据库(MySQL)、缓存(Redis)等常用中间件基础原理与实践。 4. 了解大模型基础链路,对 AI 数据集、数据标注、模型评测、训练任务流程有基本认知优先。 5. 优秀的逻辑思维、沟通协作能力,具备较强自驱力与学习能力,乐于接受复杂业务场景挑战。 加分项 1. 有大厂或 AI 公司内部数据平台、评估平台的建设经验;有数据平台(如数据开发平台、任务调度平台、标注平台)的设计或开发经验。 2. 参与过大规模多模态数据预处理、清洗、合成等流水线平台的建设,服务于大模型 Pretrain/SFT/RLHF。 3. 参…
工作职责
1. 面向多模态模型全生命周期,构建面向文本、图像、视频、音频、结构化数据等多模态数据的统一数据平台,支撑海量异构数据的高效采集、存储、处理与分发,支持 PB 级数据管理,保障大规模数据训练任务的高吞吐与低延迟。 2. 参与建设多模态数据处理管线,实现跨模态数据的清洗、标注、增强、特征提取、向量化与可视化;探索跨模态数据的对齐、融合与联合分析技术。 3. 参与平台架构演进,构建面向 AI-Native 的 Data Agent 基础设施,探索智能调度、自动修复、自适应优化等能力,推动数据平台从"工具化"向"智能化"演进,重新定义数据平台的交互与运维范式。 4. 关注平台研发效能与开发者体验,设计标准化的 API/SDK、可观测性体系及自动化运维工具,降低业务接入成本,提升平台易用性。
1、你将建设面向视频生产的多模态智能体系统,让 agent 能够理解用户需求、分析素材、生成脚本、规划镜头、调用生成模型、检查结果、自动编辑、失败重试并交付成片。 2、你会设计 content-centric harness, tool use、planner、memory、workflow、multi-agent collaboration、human-in-the-loop 和 evaluation environment。 3、协同优化agentic理解模型和生成模型,使得系统实现高质量及高效率生产面向专业场景的成品视频。
1. 分布式模型训练:深度参与B站搜推模型分布式训练框架的设计与演进,优化数据并行与模型并行策略,提升训练吞吐与稳定性,支撑千亿级稀疏参数的高效训练; 2. 高并发在线推理:设计并优化支撑毫秒级延迟、高QPS的模型Serving架构,涉及计算图优化(XLA/图融合)、算子融合、模型量化及异步流水线调度,满足搜推实时打分需求; 3. 超大Embedding存储与检索:突破千亿规模Embedding表的存储、分片(Sharding)、增量更新及高频检索的技术瓶颈,优化GPU显存管理与Host-Device数据搬运效率; 4. GPU异构计算与Scaling:优化GPU多卡/多机训练与推理的横向扩展性,结合CUDA Kernel优化、TensorRT部署及编译优化技术,支撑超长用户行为序列(10K+)建模与模型参数持续Scaling Up; 5. 下一代智能分发系统:参与构建面向大模型时代的智能内容分发架构,探索LLM与搜推系统的融合,用技术创造快乐,一起构建支撑亿万年轻人内容消费的智能引擎。
1.探索视频多模态大模型的前沿技术,负责数据建设、模型训练与评测框架搭建。 2.深入研究并实践视频多模态大模型的全套训练流程,包括pretraining、mid-training、SFT、RL、on-policy distillation等。 3.跟踪并复现主流的开源视频多模态模型,进行前沿论文的调研、复现与创新。 4.协助优化视频内容理解、dense video caption、视频生成/编辑中的用户意图理解等相关任务上的模型效果,持续提高算法的性能与效率。
面向高性能 GPU 大卡集群、AI 训练 / 推理集群,聚焦集群全栈性能优化、网络异常检测、服务器故障定位,支撑大模型训练、分布式算力业务稳定高效运行 团队通用职责: 1、参与大规模 GPU 集群日常压测、基线梳理、运维保障,配合完成集群扩容、版本升级、环境标准化工作 2、基于 Prometheus、Grafana、DCGM 等工具搭建集群监控大盘,输出性能报表、故障分析报告与优化方案 3、编写 Shell/Python 自动化脚本、运维 SOP、故障处理手册,沉淀技术知识库 4、协同算法、平台、网络团队,联动定位集群全链路问题,保障大模型训练、分布式任务稳定运行 5、跟踪 GPU 集群、RDMA 网络、分布式通信前沿技术,持续优化集群架构与运行效率 岗位具体职责: 聚焦硬件、驱动、通信库、调度、框架全维度性能优化,提升集群算力利用率与任务吞吐,细分具体工作内容: 1、负责 GPU 硬件栈调优:完成 GPU 驱动、CUDA、cuDNN、固件版本选型与参数调优,优化 GPU 功耗、显存占用、卡间 NVLink 通信效率,解决 GPU 降频、算力跑不满问题 2、分布式通信优化:针对 NCCL 集合通信库做参数调优,优化多机多卡分布式训练通信逻辑,降低通信时延、提升集合通信吞吐 3、系统与内核调优:基于 Linux 操作系统做内核参数、内存、IO、进程调度优化,适配高负载 GPU 集群运行场景 4、算力调度优化:配合 Slurm/K8s 算力调度平台,优化任务队列、资源配额、负载均衡策略,减少任务排队、资源碎片问题 5、AI 框架适配调优:对接 PyTorch、TensorFlow、vLLM 等主流框架,完成训练 / 推理场景参数调优,实现计算与通信重叠,提升端到端任务性能 6、集群基准测试:使用行业标准压测工具完成集群算力、吞吐、时延基准测试,定位性能瓶颈并落地优化方案