深度求索预训练(数据/算法)研究员
任职要求
整体要求 1.对世界有好奇心,对 AGI 有信仰,对研究工作有极高的热情,有自己对模型行为的独特理解。 2.有严谨的科学精神,出色的研究品味,和优秀的逻辑能力。 3.有无私的团队合作精神,认同开放共进的企业文化;善于沟通,大胆质疑,平等开放,有大局观。 预训练算法研究员 1.对算法相关的领域前沿了解深入而全面,有自己的想法和坚信的事情,能够积极地去发现并解决新的问题。 2.精通深度学习,并至少深耕一个方向,对该方向有独立且深入的认知。 3.编程能力出色,善于使用先进 AI 工具提升工作效率。 预训练数据研究员 1.认可数据是全人类的宝贵财富,能够脚踏实地做事。 2.有主见,能够积极地去发现并解决新的问题,…
工作职责
【团队使命】 1.探索智能的本质,持续追求 AGI,通过对算法和数据策略的深入研究,构建更强和更快的模型,并确保其始终服务于全人类的共同利益与福祉。 2.专注于软硬件协同的模型结构创新、高效优化器与训练动力学研究,建立科学的 scaling law 指导规划,攻克训练与推理加速瓶颈,并探索非共识的新型网络架构,持续推动预训练领域的基础理论边界。 3.如何寻找蒙尘的富矿,并淘洗炼制成可用的智能燃料,是一门极难的硬功夫。我们以亿万数据筑就模型智能的坚实底座,更要用普惠的方式,把这份属于全人类的财富,重新还给全人类。 4.致力于搭建真实世界与 AGI 之间的数据桥梁,构建高质量、可追溯、可复现的数据资产,打通从数据治理到智能涌现的确定性路径;建立严谨的数据质量体系与配比策略,通过数据的桥梁将世界知识、任务结构、行为轨迹和反馈信号输送进模型,为模型赋予跨领域理解、推理、规划、工具使用和对齐的能力。 招聘方向【实习/全职】:预训练算法研究方向、预训练数据研究方向 预训练算法研究方向 1.针对实际的问题和瓶颈,软硬件协同地设计强大和高效的模型结构。 2.设计高性能和鲁棒的优化器,研究模型训练过程中的动力学和稳定性问题。 3.建立科学的 scaling law,对模型的 scaling 行为建立认知,并进行合理的预测和规划。 4.研究各种训练和推理加速算法。 5.探索开拓性的新型模型结构和训练方法。 6.保持对领域前沿的学习和跟进,持续推动和预训练相关的基础研究。 预训练数据研究方向 1.持续搭建和改进现有的数据生产管线,与数据上下游保持紧密合作。 2.设计和建立科学、严谨、能落地的数据治理体系,持续优化数据配比与筛选策略。 3.通过数据实验持续挖掘已有不足并补齐,建立数据与智能之间的纽带。 4.构建多维度模型评估体系(自动+人工),覆盖通用能力及垂直场景。 5.研究数据的合成与 scaling 行为。 6.垂类数据研究:多模态数据、agent 数据、用户反馈数据、高质量学术数据等。 7.保持对领域前沿的学习和跟进,持续推动和预训练相关的基础研究。
作为一名核心的预训练数据算法研究员,你将直接参与构建和优化我们核心大语言模型的预训练,并侧重在 code、agentic、reasoning-heavy 类任务的高质量训练数据集搭建;包含但不限于数据收集、合成数据生成、任务行为轨迹构建等。 1.开发并生成用于大模型训练的合成任务与数据集,涵盖两类场景: 可验证类任务:代码解题、数学计算题等; 不可验证类任务:开放式逻辑推理、通用综合问题求解等。 2.搭建并规模化运行多领域数据合成流程,覆盖 agent、code、math、general reasoning; 3.参与搭建 agentic task environments 以及配套的大模型训练评测体系。
作为一名预训练数据算法研究员,你将负责开发大语言模型训练所需的大规模数据处理算法与数据学习策略。 主要负责: 1.针对多源数据设计并开发code类数据、通用文本数据清洗、增强、合成算法; 2.基于大语言模型研发并迭代数据筛选策略,提升预训练语料的数据质量; 3.搭建并规模化优化数据处理流水线,保障高并发场景下的运行性能与稳定性。
职位描述 作为一名核心的数据算法实习生,你将直接参与构建和优化我们核心大语言模型的预训练数据。你将从数据源头开始,通过科学的数据工程与算法策略,深刻影响模型的底层能力、知识广度和思想深度。 岗位职责: 数据工程与基建: 负责大模型预训练数据的全流程构建,包括多源数据发现与评估、自动化清洗与去重、结构化与内容安全处理; 数据策略与实验: 设计并执行数据配比、质量筛选、混合合成策略的对比实验,以科学方法驱动模型性能的持续提升; 前沿数据构建: 洞察模型能力的瓶颈,主动构想并构建能突破当前模型“天花板”的新型训练数据(如高质量对话、复杂推理链、代码-文本对等),探索数据创新的前沿; 数据效果分析: 分析模型在不同数据上的训练动态与性能表现,建立“数据-模型能力”的量化洞察,为数据决策提供依据。