logo of bilibili

哔哩哔哩【B-UP】多模态智能体工程师(实习)

实习兼职技术类地点:上海状态:招聘

任职要求


1、熟悉 LLM/VLM agent、tool calling、RAG、workflow orchestration 等相关技术
2、能快速搭建 demo,也能把 demo 变成稳定系统;能分析 agent 在长链路任务…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


1、你将建设面向视频生产的多模态智能体系统,让 agent 能够理解用户需求、分析素材、生成脚本、规划镜头、调用生成模型、检查结果、自动编辑、失败重试并交付成片。
2、你会设计 content-centric harness, tool use、planner、memory、workflow、multi-agent collaboration、human-in-the-loop 和 evaluation environment。
3、协同优化agentic理解模型和生成模型,使得系统实现高质量及高效率生产面向专业场景的成品视频。
包括英文材料
大模型+
还有更多 •••
相关职位

logo of bilibili
实习技术类

1. 分布式模型训练:深度参与B站搜推模型分布式训练框架的设计与演进,优化数据并行与模型并行策略,提升训练吞吐与稳定性,支撑千亿级稀疏参数的高效训练; 2. 高并发在线推理:设计并优化支撑毫秒级延迟、高QPS的模型Serving架构,涉及计算图优化(XLA/图融合)、算子融合、模型量化及异步流水线调度,满足搜推实时打分需求; 3. 超大Embedding存储与检索:突破千亿规模Embedding表的存储、分片(Sharding)、增量更新及高频检索的技术瓶颈,优化GPU显存管理与Host-Device数据搬运效率; 4. GPU异构计算与Scaling:优化GPU多卡/多机训练与推理的横向扩展性,结合CUDA Kernel优化、TensorRT部署及编译优化技术,支撑超长用户行为序列(10K+)建模与模型参数持续Scaling Up; 5. 下一代智能分发系统:参与构建面向大模型时代的智能内容分发架构,探索LLM与搜推系统的融合,用技术创造快乐,一起构建支撑亿万年轻人内容消费的智能引擎。

更新于 2026-06-23上海
logo of bilibili
实习技术类

1.探索视频多模态大模型的前沿技术,负责数据建设、模型训练与评测框架搭建。 2.深入研究并实践视频多模态大模型的全套训练流程,包括pretraining、mid-training、SFT、RL、on-policy distillation等。 3.跟踪并复现主流的开源视频多模态模型,进行前沿论文的调研、复现与创新。 4.协助优化视频内容理解、dense video caption、视频生成/编辑中的用户意图理解等相关任务上的模型效果,持续提高算法的性能与效率。

更新于 2026-06-22上海
logo of bilibili
实习技术类

面向高性能 GPU 大卡集群、AI 训练 / 推理集群,聚焦集群全栈性能优化、网络异常检测、服务器故障定位,支撑大模型训练、分布式算力业务稳定高效运行 团队通用职责: 1、参与大规模 GPU 集群日常压测、基线梳理、运维保障,配合完成集群扩容、版本升级、环境标准化工作 2、基于 Prometheus、Grafana、DCGM 等工具搭建集群监控大盘,输出性能报表、故障分析报告与优化方案 3、编写 Shell/Python 自动化脚本、运维 SOP、故障处理手册,沉淀技术知识库 4、协同算法、平台、网络团队,联动定位集群全链路问题,保障大模型训练、分布式任务稳定运行 5、跟踪 GPU 集群、RDMA 网络、分布式通信前沿技术,持续优化集群架构与运行效率 岗位具体职责: 聚焦硬件、驱动、通信库、调度、框架全维度性能优化,提升集群算力利用率与任务吞吐,细分具体工作内容: 1、负责 GPU 硬件栈调优:完成 GPU 驱动、CUDA、cuDNN、固件版本选型与参数调优,优化 GPU 功耗、显存占用、卡间 NVLink 通信效率,解决 GPU 降频、算力跑不满问题 2、分布式通信优化:针对 NCCL 集合通信库做参数调优,优化多机多卡分布式训练通信逻辑,降低通信时延、提升集合通信吞吐 3、系统与内核调优:基于 Linux 操作系统做内核参数、内存、IO、进程调度优化,适配高负载 GPU 集群运行场景 4、算力调度优化:配合 Slurm/K8s 算力调度平台,优化任务队列、资源配额、负载均衡策略,减少任务排队、资源碎片问题 5、AI 框架适配调优:对接 PyTorch、TensorFlow、vLLM 等主流框架,完成训练 / 推理场景参数调优,实现计算与通信重叠,提升端到端任务性能 6、集群基准测试:使用行业标准压测工具完成集群算力、吞吐、时延基准测试,定位性能瓶颈并落地优化方案

更新于 2026-06-24上海
logo of bilibili
实习技术类

1. 分布式训练底座 (Training Infra) 框架优化: 负责维护和优化基于 Megatron-LM, FSDP, VeRL的分布式训练框架,通过多维并行策略提高训练吞吐。 算子优化: 参与多模态大模型训练核心算子的设计与优化,包括 Attention、MoE、算子融合等方向,持续提升模型训练效率和硬件利用率。 通信优化: 深入优化 H/NCCL通信库,解决 RDMA/RoCE 网络下的通信瓶颈,提升多机多卡并行效率(DP/PP/TP/CP/EP)。 稳定性保障: 构建自动容错与快速恢复系统(Checkpoint 优化、故障自动检测与接续),确保千卡集群在数月跨度的训练中保持极高可用性。 2. 推理加速与工程化 (Inference Infra) 高性能引擎: 负责基于 vLLM、TensorRT-LLM、SGLang、Triton Inference Server 等推理框架的开发与优化,提升大模型在线服务的吞吐、时延和资源利用率。 算子优化: 参与 Transformer 核心算子的开发与性能优化,包括 Attention、KV Cache、量化推理、算子融合等方向,探索 CUDA/Triton 等高性能实现方案。 推理架构: 参与构建面向大规模生产环境的推理服务体系,支持高并发、低延迟和高可用的模型服务部署与运维。 3. 存储与算力管理 (Storage & Compute) I/O 优化: 优化超大规模数据集的加载速度,解决训练过程中的存储带宽瓶颈(如利用 GPFS, Lustre 或 JuiceFS)。 稳定性保障: 构建大规模集群故障检测、自动恢复与容灾体系,提升训练与推理服务的可靠性、高可用性及运维效率。 资源调度: 构建面向训练与推理场景的 GPU 资源调度体系,支持多租户资源共享、弹性扩缩容、任务优先级管理及异构算力调度,提高集群整体

更新于 2026-06-24上海