哔哩哔哩多模态数据平台研发工程师
任职要求
职位要求 1. 精通 Python、Java、Go 等至少一种编程语言,具备扎实的分布式系统基础。 2. 深入理解以下至少一种技术体系,并具备线上平台化实践经验: - 计算引擎(Ray)及其平台化封装; - 数据湖/湖仓一体方案(Iceberg/Paimon/Lance)及元数据管理; - 分布式调度系统、资源管理(YARN/K8s)或工作流编排平台。 3. 理解大模型训练与推理全链路中的数据流转机制,熟悉数据从…
工作职责
1. 面向多模态模型全生命周期,构建面向文本、图像、视频、音频、结构化数据等多模态数据的统一数据平台,支撑海量异构数据的高效采集、存储、处理与分发,支持 PB 级数据管理,保障大规模数据训练任务的高吞吐与低延迟。 2. 建设多模态数据处理管线,实现跨模态数据的清洗、标注、增强、特征提取、向量化与可视化;探索跨模态数据的对齐、融合与联合分析技术。 3. 主导平台架构演进,构建面向 AI-Native 的 Data Agent 基础设施,探索智能调度、自动修复、自适应优化等能力,推动数据平台从"工具化"向"智能化"演进,重新定义数据平台的交互与运维范式。 4. 关注平台研发效能与开发者体验,设计标准化的 API/SDK、可观测性体系及自动化运维工具,降低业务接入成本,提升平台易用性。
1. 面向多模态模型全生命周期,构建面向文本、图像、视频、音频、结构化数据等多模态数据的统一数据平台,支撑海量异构数据的高效采集、存储、处理与分发,支持 PB 级数据管理,保障大规模数据训练任务的高吞吐与低延迟。 2. 参与建设多模态数据处理管线,实现跨模态数据的清洗、标注、增强、特征提取、向量化与可视化;探索跨模态数据的对齐、融合与联合分析技术。 3. 参与平台架构演进,构建面向 AI-Native 的 Data Agent 基础设施,探索智能调度、自动修复、自适应优化等能力,推动数据平台从"工具化"向"智能化"演进,重新定义数据平台的交互与运维范式。 4. 关注平台研发效能与开发者体验,设计标准化的 API/SDK、可观测性体系及自动化运维工具,降低业务接入成本,提升平台易用性。
负责多模态数据存储管道研发及数据处理能力研发: 1. 主导EB级大规模非结构化数据传输功能及多模态数据管理系统设计和开发; 2. 参与高性能计算引擎架构设计:基于CPU+GPU异构计算环境,设计并研发面向多模态数据(图像、音视频、文本等)的分布式计算引擎,实现高效部署与运维; 3. 参与核心算子研发与优化:结合多模态数据特征,设计并开发高性能数据处理算子,涵盖数据清洗、特征提取、格式转换等关键环节,保障算法效率与准确性; 4. 构建数据处理最佳实践体系:针对多模态数据存储、处理特点及场景,给出算子最佳实践,如卡型选择、CPU/GPU选择等。
1.负责模型预训练、微调、部署及推理过程中的数据准备、模型和数据加速、数据集存储及管理,为大模型提供高效稳定的多模态数据预处理能力,构建高质量的AI数据迭代链路。 2.探索AI Native的多模数据存储格式,支持AI数据高效存储、读取和分析,提升数据的使用价值。 3.跟进LLM、多模态大模型的前沿发展,探索数据如何更好驱动模型迭代。