哔哩哔哩多模态数据平台研发实习生
任职要求
1. 计算机、软件工程、大数据、人工智能等相关专业,本科及以上学历; 2. 熟练掌握 Go / Python / Java至少一门后端开发语言,具备良好代码风格,了解基础数据结构、计算机网络、操作系统知识。 3. 了解分布式系统基础概念,熟悉数据库(MySQL)、缓存(Redis)等常用中间件基础原理与实践。 4. 了解大模型基础链路,对 AI 数据集、数据标注、模型评测、训练任务流程有基本认知优先。 5. 优秀的逻辑思维、沟通协作能力,具备较强自驱力与学习能力,乐于接受复杂业务场景挑战。 加分项 1. 有大厂或 AI 公司内部数据平台、评估平台的建设经验;有数据平台(如数据开发平台、任务调度平台、标注平台)的设计或开发经验。 2. 参与过大规模多模态数据预处理、清洗、合成等流水线平台的建设,服务于大模型 Pretrain/SFT/RLHF。 3. 参…
工作职责
1. 面向多模态模型全生命周期,构建面向文本、图像、视频、音频、结构化数据等多模态数据的统一数据平台,支撑海量异构数据的高效采集、存储、处理与分发,支持 PB 级数据管理,保障大规模数据训练任务的高吞吐与低延迟。 2. 参与建设多模态数据处理管线,实现跨模态数据的清洗、标注、增强、特征提取、向量化与可视化;探索跨模态数据的对齐、融合与联合分析技术。 3. 参与平台架构演进,构建面向 AI-Native 的 Data Agent 基础设施,探索智能调度、自动修复、自适应优化等能力,推动数据平台从"工具化"向"智能化"演进,重新定义数据平台的交互与运维范式。 4. 关注平台研发效能与开发者体验,设计标准化的 API/SDK、可观测性体系及自动化运维工具,降低业务接入成本,提升平台易用性。
1. 面向多模态模型全生命周期,构建面向文本、图像、视频、音频、结构化数据等多模态数据的统一数据平台,支撑海量异构数据的高效采集、存储、处理与分发,支持 PB 级数据管理,保障大规模数据训练任务的高吞吐与低延迟。 2. 参与建设多模态数据处理管线,实现跨模态数据的清洗、标注、增强、特征提取、向量化与可视化;探索跨模态数据的对齐、融合与联合分析技术。 3. 参与平台架构演进,构建面向 AI-Native 的 Data Agent 基础设施,探索智能调度、自动修复、自适应优化等能力,推动数据平台从"工具化"向"智能化"演进,重新定义数据平台的交互与运维范式。 4. 关注平台研发效能与开发者体验,设计标准化的 API/SDK、可观测性体系及自动化运维工具,降低业务接入成本,提升平台易用性。
1. 面向多模态模型全生命周期,构建面向文本、图像、视频、音频、结构化数据等多模态数据的统一数据平台,支撑海量异构数据的高效采集、存储、处理与分发,支持 PB 级数据管理,保障大规模数据训练任务的高吞吐与低延迟。 2. 建设多模态数据处理管线,实现跨模态数据的清洗、标注、增强、特征提取、向量化与可视化;探索跨模态数据的对齐、融合与联合分析技术。 3. 主导平台架构演进,构建面向 AI-Native 的 Data Agent 基础设施,探索智能调度、自动修复、自适应优化等能力,推动数据平台从"工具化"向"智能化"演进,重新定义数据平台的交互与运维范式。 4. 关注平台研发效能与开发者体验,设计标准化的 API/SDK、可观测性体系及自动化运维工具,降低业务接入成本,提升平台易用性。
负责多模态数据存储管道研发及数据处理能力研发: 1. 主导EB级大规模非结构化数据传输功能及多模态数据管理系统设计和开发; 2. 参与高性能计算引擎架构设计:基于CPU+GPU异构计算环境,设计并研发面向多模态数据(图像、音视频、文本等)的分布式计算引擎,实现高效部署与运维; 3. 参与核心算子研发与优化:结合多模态数据特征,设计并开发高性能数据处理算子,涵盖数据清洗、特征提取、格式转换等关键环节,保障算法效率与准确性; 4. 构建数据处理最佳实践体系:针对多模态数据存储、处理特点及场景,给出算子最佳实践,如卡型选择、CPU/GPU选择等。