logo of minimax

MiniMax预训练数据 Pipeline 工程师

社招全职数据挖掘地点:北京 | 上海状态:招聘

工作描述


为什么加入我们

  1. 你会直接参与大模型训练前最核心的数据生产链路,数据质量、吞吐和覆盖度会影响模型能力上限。
  2. 这里不是传统离线数仓,而是面向预训练数据构建的大规模分布式数据基础设施。
  3. 你会在真实海量数据场景中使用 Spark 等分布式计算技术,解决解析、清洗、过滤、去重、质量评估和采样的工程问题。

我们在做什么
  MiniMax 正在建设面向大模型预训练的数据生产体系,支撑文本、音频、视频、多模态等数据从采集、解析、清洗、过滤、去重、质量评估到数据资产管理的完整链路

  这不是普通的数据处理岗位,而是要把海量非结构化数据转化为可训练、可追踪、可评估、可持续供给的高质量预训练数据资产。你会深度参与预训练数据 Pipeline、分布式 计算…
登录查看完整工作描述
微信扫码,1秒登录

包括英文材料
大模型+
Spark+
学历+
分布式系统+
Python+
Java+
Go+
C+++
还有更多 •••
相关职位

logo of deepseek
社招全栈开发/算法

【团队使命】 预训练数据开采自人类世界全部已有知识所沉积的富矿,是驱动模型强大能力的核心燃料。 预训练数据团队围绕大模型预训练,构建了从数据采集、清洗处理到底层基础设施的完整数据体系,持续为模型训练输

北京|杭州
logo of deepseek
社招1年以上深度学习研究员

【团队使命】 1.探索智能的本质,持续追求 AGI,通过对算法和数据策略的深入研究,构建更强和更快的模型,并确保其始终服务于全人类的共同利益与福祉。 2.专注于软硬件协同的模型结构创新、高效优化器与训

北京
logo of bilibili
实习技术类

工作职责: 1. 分析大规模视频、图像及文本数据的内容分布、质量、多样性、冗余度、长尾覆盖和缺失模式。 2. 建设多模态数据理解能力,包括 embedding、检索、聚类、分类、标签体系、Captio

更新于 2026-09-14上海
logo of zhipuai
社招

【岗位职责】 1. 参与大模型预训练数据建设,围绕图文合训、多模态理解及视觉能力训练,探索高质量数据构建和规模化扩展方案。 2. 负责图文及视觉数据的分析、清洗、去重、筛选和结构化处理,提升训练数据的

更新于 2026-09-03北京