logo of deepseek

深度求索预训练数据工程师

社招全职全栈开发/算法地点:北京 | 杭州状态:招聘

工作描述


【团队使命】
预训练数据开采自人类世界全部已有知识所沉积的富矿,是驱动模型强大能力的核心燃料。
预训练数据团队围绕大模型预训练,构建了从数据采集、清洗处理到底层基础设施的完整数据体系,持续为模型训练输送高质量、规模化、多模态的数据燃料,不断拓展模型的世界知识边界。
如何寻找蒙尘的富矿,并淘洗炼制成可用的智能燃料,是一门极难的硬功夫。我们以亿万数据筑就模型智能的坚实底座,更要用普惠的方式,把这份属于全人类的财富,重新还给全人类。
招聘方向【实习/全职】:数据采集 pipeline 方向、语言数据处理方向、多模态数据方向、数据基建方向。

数据采集 pipeline 方向
【岗位职责】
1.全网数据选取策略设计开发
(1)根据数据清洗反馈信号设计全网数据选取、调度系统,包括链接质量预估、属性聚合、站点抓取配额、数据优先级等,保证数据多样性,最大化数据覆盖,为模型训练提供丰富的世界知识。
(2)面向 RAG 等时效场景,负责时效性种子挖掘、调度与有效性验证,保障关键信息的新鲜度。
2.全网数据采集环路
(1)负责全网数据采集环路的设计与开发,包括但不限于下载、任务调度、流式数据处理、DNS、连通性等核心组件,构建高吞吐、可容错的分布式采集系统。
3.链接规模控制
(1)通过识别低质站群、重复镜像站点、清洗 URL 冗余参数、规范化链接等手段,控制链接规模、去除重复与噪声,提升链接库的有效性与数据纯净度。
【岗位要求】
1.计算机或数学相关专业,本科及以上学历。
2.熟练使用至少一种编程语言,包括但不限于 Python/C++/Rust。
【加分项】
1.数学或信息学竞赛中取得优秀成绩。
2.有大规模数据采集、爬虫或数据 pipeline 系统研发经验。

语言数据处理方向
【岗位职责】
1.参与大模型预训练语料清洗框架研发,建设稳定、高效、可扩展的大规…
登录查看完整工作描述
微信扫码,1秒登录

包括英文材料
学历+
Python+
C+++
Rust+
大模型+
算法+
RAG+
Pandas+
Spark+
数据结构+
还有更多 •••
相关职位

logo of moonshot
社招技术类/Tech

岗位职责 设计和优化大规模 Web 爬虫的 URL 发现与调度系统,持续扩大数据覆盖面 建设多因子抓取优先级体系,在有限资源下最大化高质量页面的获取效率 主导反爬对抗和动态渲染方案,提升核心站点的抓取

更新于 2026-06-09北京
logo of pinduoduo
社招研发类

1)扎实的编程能力(Python必须,Java / Golang / Javascript 至少一种),良好的数据结构和算法基础; 2)熟悉软件工程基本流程(构建 / 调试 / 测试 / CI); 3

更新于 2026-09-08上海
logo of zhipuai
社招

【岗位职责】 1. 参与大模型预训练数据建设,围绕图文合训、多模态理解及视觉能力训练,探索高质量数据构建和规模化扩展方案。 2. 负责图文及视觉数据的分析、清洗、去重、筛选和结构化处理,提升训练数据的

更新于 2026-09-03北京
logo of minimax
社招数据挖掘

为什么加入我们 1. 你会直接参与大模型训练前最核心的数据生产链路,数据质量、吞吐和覆盖度会影响模型能力上限。 2. 这里不是传统离线数仓,而是面向预训练数据构建的大规模分布式数据基础设施。

更新于 2026-08-10北京|上海