logo of deepseek

深度求索预训练数据工程师

社招全职全栈开发/算法地点:北京 | 杭州状态:招聘

任职要求


1.计算机或数学相关专业,本科及以上学历。
2.熟练使用至少一种编程语言,包括但不限于 Python/C++/Rust。
【加分项】
1.数学或信息学竞赛中取得优秀成绩。
2.有大规模数据采集、爬虫或数据 pipeline 系统研发经验。

语言数据处理方向
【岗位职责】
1.参与大模型预训练语料清洗框架研发,建设稳定、高效、可扩展的大规模数据处理平台,建设面向海量数据的离…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


【团队使命】
预训练数据开采自人类世界全部已有知识所沉积的富矿,是驱动模型强大能力的核心燃料。
预训练数据团队围绕大模型预训练,构建了从数据采集、清洗处理到底层基础设施的完整数据体系,持续为模型训练输送高质量、规模化、多模态的数据燃料,不断拓展模型的世界知识边界。
如何寻找蒙尘的富矿,并淘洗炼制成可用的智能燃料,是一门极难的硬功夫。我们以亿万数据筑就模型智能的坚实底座,更要用普惠的方式,把这份属于全人类的财富,重新还给全人类。
招聘方向【实习/全职】:数据采集 pipeline 方向、语言数据处理方向、多模态数据方向、数据基建方向。

数据采集 pipeline 方向

1.全网数据选取策略设计开发
(1)根据数据清洗反馈信号设计全网数据选取、调度系统,包括链接质量预估、属性聚合、站点抓取配额、数据优先级等,保证数据多样性,最大化数据覆盖,为模型训练提供丰富的世界知识。
(2)面向 RAG 等时效场景,负责时效性种子挖掘、调度与有效性验证,保障关键信息的新鲜度。
2.全网数据采集环路
(1)负责全网数据采集环路的设计与开发,包括但不限于下载、任务调度、流式数据处理、DNS、连通性等核心组件,构建高吞吐、可容错的分布式采集系统。
3.链接规模控制
(1)通过识别低质站群、重复镜像站点、清洗 URL 冗余参数、规范化链接等手段,控制链接规模、去除重复与噪声,提升链接库的有效性与数据纯净度。
包括英文材料
学历+
Python+
C+++
还有更多 •••
相关职位

logo of pinduoduo
社招技术类

1)设计并实施大规模语料采集与处理系统,覆盖网页、书籍、代码、对话等多源异构数据; 2)制定数据清洗与去重等各类数据处理策略,提升语料多样性与质量; 3)开发数据质量评估与筛选体系,综合运用多维度方法对语料进行自动化打分与分级淘汰。包括困惑度过滤、质量分类器、内容安全过滤、数据配比与采样等; 4)主导合成数据的设计与生产,覆盖预训练增强与后训练两大场景,提升稀缺领域与长尾能力的数据覆盖,丰富推理、代码相关语料; 5)通过数据消融实验验证数据效果及数据配比策略,推动模型效果提升; 6)分析 MMLU / CMMLU / Humaneval 等开闭源训练指标,指导数据优化方向; 7)维护数据版本管理与数据血缘追踪系统,确保训练数据的可复现性。

更新于 2026-04-30上海
logo of deepseek
社招1年以上深度学习研究员

【团队使命】 1.探索智能的本质,持续追求 AGI,通过对算法和数据策略的深入研究,构建更强和更快的模型,并确保其始终服务于全人类的共同利益与福祉。 2.专注于软硬件协同的模型结构创新、高效优化器与训练动力学研究,建立科学的 scaling law 指导规划,攻克训练与推理加速瓶颈,并探索非共识的新型网络架构,持续推动预训练领域的基础理论边界。 3.如何寻找蒙尘的富矿,并淘洗炼制成可用的智能燃料,是一门极难的硬功夫。我们以亿万数据筑就模型智能的坚实底座,更要用普惠的方式,把这份属于全人类的财富,重新还给全人类。 4.致力于搭建真实世界与 AGI 之间的数据桥梁,构建高质量、可追溯、可复现的数据资产,打通从数据治理到智能涌现的确定性路径;建立严谨的数据质量体系与配比策略,通过数据的桥梁将世界知识、任务结构、行为轨迹和反馈信号输送进模型,为模型赋予跨领域理解、推理、规划、工具使用和对齐的能力。 招聘方向【实习/全职】:预训练算法研究方向、预训练数据研究方向 预训练算法研究方向 1.针对实际的问题和瓶颈,软硬件协同地设计强大和高效的模型结构。 2.设计高性能和鲁棒的优化器,研究模型训练过程中的动力学和稳定性问题。 3.建立科学的 scaling law,对模型的 scaling 行为建立认知,并进行合理的预测和规划。 4.研究各种训练和推理加速算法。 5.探索开拓性的新型模型结构和训练方法。 6.保持对领域前沿的学习和跟进,持续推动和预训练相关的基础研究。 预训练数据研究方向 1.持续搭建和改进现有的数据生产管线,与数据上下游保持紧密合作。 2.设计和建立科学、严谨、能落地的数据治理体系,持续优化数据配比与筛选策略。 3.通过数据实验持续挖掘已有不足并补齐,建立数据与智能之间的纽带。 4.构建多维度模型评估体系(自动+人工),覆盖通用能力及垂直场景。 5.研究数据的合成与 scaling 行为。 6.垂类数据研究:多模态数据、agent 数据、用户反馈数据、高质量学术数据等。 7.保持对领域前沿的学习和跟进,持续推动和预训练相关的基础研究。

更新于 2026-07-16北京
logo of mihoyo
实习程序&技术类

职位描述 作为一名核心的数据算法实习生,你将直接参与构建和优化我们核心大语言模型的预训练数据。你将从数据源头开始,通过科学的数据工程与算法策略,深刻影响模型的底层能力、知识广度和思想深度。 岗位职责: 数据工程与基建: 负责大模型预训练数据的全流程构建,包括多源数据发现与评估、自动化清洗与去重、结构化与内容安全处理; 数据策略与实验: 设计并执行数据配比、质量筛选、混合合成策略的对比实验,以科学方法驱动模型性能的持续提升; 前沿数据构建: 洞察模型能力的瓶颈,主动构想并构建能突破当前模型“天花板”的新型训练数据(如高质量对话、复杂推理链、代码-文本对等),探索数据创新的前沿; 数据效果分析: 分析模型在不同数据上的训练动态与性能表现,建立“数据-模型能力”的量化洞察,为数据决策提供依据。

上海
logo of meituan
实习核心本地商业-基

本课题聚焦于超大规模预训练数据的深度理解、提纯与价值挖掘,建立数据与模型能力之间的因果联系,打造下一代万亿基座模型的高效数据引擎,致力于提升基座模型的智能上限。研究内容包括但不限于: 1.研发基于模型的高效数据质量评估、去重与清洗算法,提高数据质量、多样性和覆盖度。 2.深入探究数据分布与模型能力的因果关系,建立“训练数据-模型效果”归因机制,探索并突破基座模型的能力上限。 3.探索自动化数据筛选机制、动态配比(Data Mixture)与多阶段训练范式,探索不同类型数据对模型能力的Scaling Law。 4.构建科学、多维度的基座模型能力和潜力评估,驱动预训练数据策略的优化,形成高效的数据迭代闭环。 【为什么是我们】 1.明确的技术判断:团队在原生多模态方向有非共识的长期投入,已发布 LongCat-Next 技术报告(离散自回归原生多模态),不是跟随式的能力补齐。 2.顶级资源支撑:5~6万卡计算集群,万亿参数文本基座已训练完成,多模态正在进行大规模上推验证——你将直接参与业界最前沿规模的多模态实验。 3.主线与探索并行:既承担多模态基座的核心交付工作,也推进下一代原生多模态架构的前沿探索,覆盖"数据→tokenizer→预训练→后训练→RL"全链路。

更新于 2026-06-30北京|上海