深度求索Code Agent 数据工程师
任职要求
【团队使命】 Code 定义了 Agent 的能力边界,是 Agent 和物理世界交互的纽带。理解需求、设计方案、实现、验证,在完整的问题解决过程中,每一步都要求精确可运行。Code 能力是模型在这一过程中从“能分析”到“能执行”的关键要素,而模型在真实复杂场景中解决工程问题的能力则是通用智能最务实的度量标准。我们要做的,是通过高质量的训练环境与精准评估体系,系统性地推高这一能力的上限,直到模型真正能独立驾驭复杂软件工程的开发,那将会是我们可以预见的 AGI 临界点之一。 招聘方向【实习/全职】: Code专项、网络安全专项、Science专项 【工作职责】 1.构建强化学习环境:将真实的代码工程、网络安全或科研场景转化为可训练的 RL 环境,设计合理的奖励信号,与研究员紧密合作探索不同环境设计对模型 Agent 能力的影响。 2.评估模型的 Agent 能力:在个人擅长的方向上设计高质量评测任务,量化模型在复杂真实场景中的表现。 3.补全模型的能力短板:基于真实用户数据与反馈,定位模型当前的能力缺陷,针对性构建训练环境与数据,推动模型在弱项上持续进步。 【岗位细分要求】 Code专项: 1.具备 Claude Code、Codex 等 AI 编程工具的重度使用经验,有代码品味。 2.自驱力强,能独立发现、定义并推动解决问题;善于跨团队协作沟通。 3.对大…
工作职责
无
我们致力于用科技创新为用户和生态伙伴创造超预期的交互体验和效率提升,依托生活服务领域多样化且复杂的业务场景,聚焦基座技术与公司战略级应用方向的深度融合,持续推动前沿技术的落地,同时积极探索和挑战技术的无人区,不断定义并刷新行业的最先进技术标准。 1、异构数据理解与数值推理:突破大模型在Table+文本混合形态下的信息丢失与幻觉瓶颈 2、Agentic RL与数据环境交互:构建基于代码执行沙盒与真实数据计算结果反馈的强化学习闭环 3、复杂推理与过程奖励(PRM):构建细粒度过程奖励模型,研究Test-Time Compute策略与MCTS搜索
1. Code Agent 强化学习训练体系设计与落地 负责大规模语言模型在后训练阶段(Post-Training)面向 Code Agent 场景的核心算法研发,设计端到端的 RL 训练流程,涵盖代码生成、代码编辑、调试修复、测试驱动开发等多环节 Agent 行为的策略学习,探索在超长代码上下文与多轮工具交互场景下的训练稳定性与样本效率。 2. 代码环境交互与多步决策优化 构建真实且可扩展的代码执行沙箱环境(Sandbox),支持 Agent 与编译器、终端、测试框架、版本控制系统等工具的闭环交互;研究多步代码推理与规划算法(如 Tree-of-Thought、Monte Carlo Tree Search 在代码任务中的适配),提升模型在跨文件编辑、大型仓库级代码理解与修改、复杂 Debug 链路上的决策质量。 3. 代码奖励信号设计与奖励模型构建 设计多层次、细粒度的代码奖励信号体系,融合可执行性验证(编译通过、测试用例通过率)、代码质量评估(可读性、效率、安全性)、需求对齐度等多维度反馈;研究如何利用自动化测试生成、变异测试(Mutation Testing)、静态分析工具等构建可靠的过程奖励模型(Process Reward Model),解决代码场景中奖励稀疏、奖励欺骗(Reward Hacking)以及部分可观测性等核心难题。 4. 泛化性与迁移能力提升 研究如何通过后训练阶段的课程学习(Curriculum Learning)、跨语言/跨领域任务混合训练、元学习(Meta-Learning)等策略,提升 Code Agent 在未见编程语言、未见框架、未见任务类型上的零样本与少样本泛化能力;探索代码推理能力向通用推理(数学、逻辑、科学问题)的正向迁移路径,推动模型整体 AGI 泛化水平。 5. 数据飞轮与自我进化机制 设计 Code Agent 的自我对弈与自我改进闭环:通过 Agent 自主探索生成高质量训练轨迹(Trajectory),结合拒绝采样(Rejection Sampling)、自我验证(Self-Verification)、自我修复(Self-Repair)等机制构建可持续的数据飞轮,实现模型能力的迭代自举(Bootstrapping),减少对人工标注数据的依赖。 6. 大规模分布式训练系统与工程协同 与基础架构团队紧密协作,针对 Code Agent 训练中环境交互延迟高、轨迹长度动态变化、Action Space 复杂等特点,设计并优化异步/同步混合的大规模分布式 RL 训练架构;解决长序列代码上下文下的显存瓶颈与吞吐效率问题,实现算法创新与系统性能的高效协同。
1.负责Code和Agent相关数据构建与治理,构建高质量、多样化的Code/Agent训练数据集,搭建数据迭代闭环,通过数据飞轮持续优化数据质量; 2.负责Agent运行环境与训练环境的构建与优化,构建高可用、可扩展的Agent仿真环境,保障Agent训练、测试及落地的稳定性与高效性; 3.负责Agentic RL在Code/Agent场景的训练,参与Agentic RL Infra建设及优化、Agentic RL 算法优化,持续提升Agentic RL训练的效率和稳定性。