logo of bilibili

哔哩哔哩多模态数据平台研发实习生

实习兼职技术类地点:上海状态:招聘

任职要求


1. 计算机、软件工程、大数据、人工智能等相关专业,本科及以上学历;
2. 熟练掌握 Go / Python / Java至少一门后端开发语言,具备良好代码风格,了解基础数据结构、计算机网络、操作系统知识。
3. 了解分布式系统基础概念,熟悉数据库(MySQL)、缓存Redis)等常用中间件基础原理与实践。
4. 了解大模型基础链路,对 AI 数据集、数据标注、模型评测、训练任务流程有基本认知优先。
5. 优秀的逻辑思维、沟通协作能力,具备较强自驱力与学习能力,乐于接受复杂业务场景挑战。

加分项
1. 有大厂或 AI 公司内部数据平台、评估平台的建设经验;有数据平台(如数据开发平台、任务调度平台、标注平台)的设计或开发经验。
2. 参与过大规模多模态数据预处理、清洗、合成等流水线平台的建设,服务于大模型 Pretrain/SFT/RLHF。
3. 参…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


1. 面向多模态模型全生命周期,构建面向文本、图像、视频、音频、结构化数据等多模态数据的统一数据平台,支撑海量异构数据的高效采集、存储、处理与分发,支持 PB 级数据管理,保障大规模数据训练任务的高吞吐与低延迟。
2. 参与建设多模态数据处理管线,实现跨模态数据的清洗、标注、增强、特征提取、向量化与可视化;探索跨模态数据的对齐、融合与联合分析技术。
3. 参与平台架构演进,构建面向 AI-Native 的 Data Agent 基础设施,探索智能调度、自动修复、自适应优化等能力,推动数据平台从"工具化"向"智能化"演进,重新定义数据平台的交互与运维范式。
4. 关注平台研发效能与开发者体验,设计标准化的 API/SDK、可观测性体系及自动化运维工具,降低业务接入成本,提升平台易用性。
包括英文材料
大数据+
学历+
Go+
Python+
Java+
后端开发+
数据结构+
分布式系统+
MySQL+
缓存+
Redis+
还有更多 •••
相关职位

logo of bilibili
实习技术类

1. 面向多模态模型全生命周期,构建面向文本、图像、视频、音频、结构化数据等多模态数据的统一数据平台,支撑海量异构数据的高效采集、存储、处理与分发,支持 PB 级数据管理,保障大规模数据训练任务的高吞吐与低延迟。 2. 参与建设多模态数据处理管线,实现跨模态数据的清洗、标注、增强、特征提取、向量化与可视化;探索跨模态数据的对齐、融合与联合分析技术。 3. 参与平台架构演进,构建面向 AI-Native 的 Data Agent 基础设施,探索智能调度、自动修复、自适应优化等能力,推动数据平台从"工具化"向"智能化"演进,重新定义数据平台的交互与运维范式。 4. 关注平台研发效能与开发者体验,设计标准化的 API/SDK、可观测性体系及自动化运维工具,降低业务接入成本,提升平台易用性。

更新于 2026-07-24上海
logo of bilibili
社招技术类

1. 面向多模态模型全生命周期,构建面向文本、图像、视频、音频、结构化数据等多模态数据的统一数据平台,支撑海量异构数据的高效采集、存储、处理与分发,支持 PB 级数据管理,保障大规模数据训练任务的高吞吐与低延迟。 2. 建设多模态数据处理管线,实现跨模态数据的清洗、标注、增强、特征提取、向量化与可视化;探索跨模态数据的对齐、融合与联合分析技术。 3. 主导平台架构演进,构建面向 AI-Native 的 Data Agent 基础设施,探索智能调度、自动修复、自适应优化等能力,推动数据平台从"工具化"向"智能化"演进,重新定义数据平台的交互与运维范式。 4. 关注平台研发效能与开发者体验,设计标准化的 API/SDK、可观测性体系及自动化运维工具,降低业务接入成本,提升平台易用性。

更新于 2026-07-23上海
logo of alibaba
社招5年以上技术类-开发

负责多模态数据存储管道研发及数据处理能力研发: 1. 主导EB级大规模非结构化数据传输功能及多模态数据管理系统设计和开发; 2. 参与高性能计算引擎架构设计:基于CPU+GPU异构计算环境,设计并研发面向多模态数据(图像、音视频、文本等)的分布式计算引擎,实现高效部署与运维; 3. 参与核心算子研发与优化:结合多模态数据特征,设计并开发高性能数据处理算子,涵盖数据清洗、特征提取、格式转换等关键环节,保障算法效率与准确性; 4. 构建数据处理最佳实践体系:针对多模态数据存储、处理特点及场景,给出算子最佳实践,如卡型选择、CPU/GPU选择等。

更新于 2026-05-22杭州
logo of xiaohongshu
社招3-5年数据引擎

1.负责模型预训练、微调、部署及推理过程中的数据准备、模型和数据加速、数据集存储及管理,为大模型提供高效稳定的多模态数据预处理能力,构建高质量的AI数据迭代链路。 2.探索AI Native的多模数据存储格式,支持AI数据高效存储、读取和分析,提升数据的使用价值。 3.跟进LLM、多模态大模型的前沿发展,探索数据如何更好驱动模型迭代。

更新于 2026-08-01北京|上海|杭州