阿里巴巴数据技术及产品部-RL Data工程师-Work(千问C端领域)
任职要求
1. 对千问 C 端产品或类似 C 端 AI 助手场景有系统性理解,能对模型输出做准确的对错与体验裁定。 2. 有团队管理或专家协作经验,能带 5~10 人规模的数据交付。 3. 有 AI/模型背景,能读懂模型 benchmark、定位能力短板并反推数据需求。 4. Taxonomy 与 insta…
工作职责
1. 场景任务与数据构造设计:针对千问 C 端多种真实使用场景(对话/问答、办公类任务、安全对齐等)做结构化拆解,明确一级场景 → 二级任务 → instance 模板,产出可复用的数据体系。 2. 数据来源组织:组织线上真实需求、合成任务、专家标注、公开语料等多路数据供给;对齐产品侧的需求分布,让数据贴合真实用户使用形态。 3. Rubric 共建:与 Rubric 团队一起把主观体验类(回答质量、有用性、安全性)判断拆成可自动化验证的评分规则,识别本方向 rubric 上的领先能力点。 4. 外部专家管理:分配任务、答疑、抽检验收,把控专家产能与交付质量;给出清晰的标注规范、边界案例与仲裁依据。 5. 数据 → 模型 → 评测 闭环:读得懂千问 C 相关 benchmark 与线上指标,定位模型能力短板并反推所需数据;周期性输出数据质量报告,驱动数据补充与评测修正。 6. 跨团队对接:对接产品经理、模型算法、评测团队,把千问 C 端的用户诉求与模型能力短板转化为可执行的数据任务。
我们正在从 0 到 1 搭建 Work(AI 协同办公)方向的 RL/RFT 训练数据体系,覆盖多个专业领域。端到端负责一个(或多个)领域的数据集从任务定义、instance 构造、reasoning 生成到分层验证的全链路,是模型训练飞轮里承上启下的关键位置。 1. 领域任务体系搭建(Taxonomy 设计) 对陌生专业领域做结构化拆解:一级领域 → 二级场景 → 任务类型 → instance 模板,产出可复用、可扩展的标注体系。 2. Instance 与 Reasoning 构造 设计 instance 结构(instruction + context + reasoning + output),并针对不同任务选择合适的 reasoning 获取路径(强模型蒸馏、模板化拆解、真实文本抽取、人机协作等)。保证 reasoning 是 SFT/RFT 训练可直接使用的高质量推理链。 3. 分层验证方案设计 针对不同任务定义分层校验机制:规则硬匹配 → 结构完整性 → LLM-as-judge(将主观判断拆解为 yes/no 子问题)。把"评价推理质量"这类模糊问题降维为可自动化、可追溯的子任务。 4. Rubric 与评分标准建设 制定各方向 Rubric、评分分级与标注案例库,定义黄金集(golden sets)和奖励信号(reward signals),确保训练数据质量可量化、可迭代。擅长大批量生成高质量 rubric,而不是拍脑袋写几条规则。 5. 轨迹标注与 Bad Case 归因 对模型 Rollout 产出的多步执行轨迹进行逐步标注(正确性 / 必要性 / 思考质量 / 整体 Reward),并对失败步骤做根因分类(模型能力不足 / 评测标准缺陷 / 任务定义模糊 / 运行依赖缺失),输出结构化改进清单驱动训练数据补充与评测体系修正。 6. 标注质量管控 建立双标一致性校验、金标抽检、系统性偏差检测与分歧仲裁机制,管理外部数据供应商交付质量、运营内部专家产能,确保标注间一致率 ≥80%,数据可直接用于 Reward Model 训练。 7. 外部协作与专家资源整合 与高校老师、领域专家协作定义验收标准、评审样本、迭代规范,把外部资源转化为规模化精标数据;管理供应商时能给出清晰的标注规范、边界案例和仲裁依据。 8. 数据 → 模型 → 评测 闭环 周期性输出数据质量报告,识别模型能力薄弱区间,指导算法团队调整 Rollout 抽样策略与难度分布;随模型迭代补充更高难度标注数据,保持 Reward Model 区分度。
1. 端到端负责RL数据(coding 方向)项目:从方案设计、数据有效性验证到规模化生产 ,帮助模型在性能上达到业界SOTA。 2. 定义评分标准(rubrics)、黄金集(golden sets)和奖励信号(reward signals),确保训练数据质量可量化、可追溯、可迭代。 3. 协同算法团队闭环:与模型训练/RL算法团队紧密配合,将模型效果反馈翻译为数据改进策略,驱动数据→模型→评测的飞轮。 4. 数据体系设计:负责主导 Code 方向标注规范的制定与持续迭代,覆盖代码生成、代码补全、debug、代码解释、代码审查等多类任务;设计 Agentic 场景下的标注框架,包括 multi-step reasoning、tool use、planning、self-correction 等复杂任务链的拆解与评估标准;基于模型表现与研究进展,持续优化标注指南,确保数据质量与训练目标对齐; 5. 数据质量管控:对标注员产出进行专家级审核,重点识别代码逻辑错误、安全漏洞、风格一致性问题;建立 Code / Agentic 数据质量评估体系,定义量化指标并追踪质量趋势;设计并执行标注一致性校验流程(IAA),提升跨标注员的数据稳定性; 6. 标注团队赋能:为标注员提供技术培训,将复杂的代码和 Agent 概念转化为可操作的标注实践;担任技术难题的终极裁判,解决边界案例和歧义问题;参与标注工具需求设计,提升代码标注效率; 7. 探索更科学的评测指标、更高效的评测方法。
1. 通过分析主流Benchmark及模型评测结果等方式,结合训练需求确定 RL 数据的能力覆盖范围与优先级;从多种渠道的海量数据里筛选挖掘样本并构建出清晰、可执行的问题描述,作为后续rollout数据生产的起点。 2. 针对 Coding 及 Work 等场景,以人机协作的方式设计并构建Agent的运行环境,以及可量化的 Verifier 或多维度打分 Rubric。需要保证环境和Judge的正确性、完整性、鲁棒性,且持续迭代以应对 Reward Hacking等各类挑战,确保评估信号与训练目标对齐。 3. 端到端搭建批量化的数据生产与验证 Pipeline,涵盖任务生成、轨迹采样、自动校验和质量过滤;构建 QA 框架,对rollout结果进行预校验与失败模式分析,保障进入训练的数据可信、可追溯。 4. 与领域专家和算法/训练等团队紧密配合,将模型效果反馈转化为数据策略调整(任务难度、Reward 信号、标注规范等);与标注、工程等团队协作,推动产线持续优化,形成"评测 → 数据 → 训练 → 评测"的闭环飞轮。
1. Rubric 与 Reward 设计:和领域专家一起,把领域的专业判断(漏洞是否成立、时序是否收敛、回答是否可用等)拆成可自动化验证的评分规则;覆盖硬验证(工具退出码/规则)+ 数值指标 + milestone + LLM judge 的多层组合。 2. Reward Hacking 规避:识别评分规则里可能被模型钻空子的路径,设计验证规则闭环;对已上线的 rubric 做持续的 hacking 检测与规则加固。 3. 训练验证与反查:用设计出的 rubric 与数据真实训练模型(SFT/RFT/RL),从训练曲线与 benchmark 结果反查 rubric 与数据的问题,形成"设计→训练→反查"迭代闭环。 4. RL 数据筛选:对海量候选数据做面向 RL 的精筛,识别"表面合理但实际错误"、难度合适、覆盖度合理的样本;设计筛选阈值与采样策略,平衡数据规模与质量。 5. 领域标注 → RL 数据的转化:把领域标注的标准与规范转成可用于 RL 训练的评分模板、reward 计算逻辑与训练样本;与领域专家共同定义黄金集与奖励信号。 6. 效果验收:持续跟踪 rubric 上线后对训练效果的实际提升,输出 rubric 版本管理与效果对比报告,给出下一版迭代方向。