阿里巴巴晓天衡宇-大模型标注评测工程师-金融/法律/医疗
任职要求
1. 本科及以上学历,在 AI 评测、RLHF / RL 轨迹标注、rubric 设计等领域有实际项目经验;具备金融、法律或医疗领域 3 年以上从业或研究经历,能独立判断专业内容的准确性与合规性。 2. 对标注质量和 reward signal 分布敏感,能通过科学方法发现问题(如 verifier 漏洞、LLM Judge 偏好拟合等),推动业务指标达成;对金融数据合规、法律条文准确性或医疗知识专业性有敏锐判断。…
工作职责
1. 负责金融 / 法律 / 医疗方向 AI 训练数据(SFT / RL 阶段)的标注管理与质检工作;与算法及产品团队协作,理解 RM 训练和 rollout 打分的数据诉求,交付满足研发需求的高质量数据。 2. 设计并落地覆盖金融分析、法律合规、医疗问答等场景的标注与质检流程,持续优化 rubric 与 verifier,推动双标一致率等核心指标达成。 3. 统筹本方向的评测方案与数据生产方案,为 rubric 设计、verifier 校验、轨迹打分等环节制定可操作的标准;定期开展 pass 与非 pass 双向抽检,迭代标注规范。 4. 构建并维护本方向的数据质量管理体系,对轨迹根因归因(模型能力 / 评测缺陷 / 任务定义)的闭环负责;警惕分数虚高等隐性风险,持续优化迭代。 5. 管理标注专家团队,统筹日常任务分配与产能调度;与上下游(算法、产品、领域专家)充分协作,把个人判断力沉淀为团队方法论。
1. 验收 DevOps/运维方向 AI Coding 数据质量 — 对 CI/CD 配置、故障排查、build-release-config 等任务数据进行质量验收,核查任务设计的真实性、难度合理性与运维场景还原度。 2. 标注规范与数据设计:负责主导 Code 方向标注规范的制定与持续迭代,覆盖代码生成、代码补全、debug、代码解释、代码审查等多类任务;设计 Agentic 场景下的标注框架,包括 multi-step reasoning、tool use、planning、self-correction 等复杂任务链的拆解与评估标准;基于模型表现与研究进展,持续优化标注指南,确保数据质量与训练目标对齐; 3. 数据质量管控:对标注员产出进行专家级审核,重点识别代码逻辑错误、安全漏洞、风格一致性问题;建立 Code / Agentic 数据质量评估体系,定义量化指标并追踪质量趋势;设计并执行标注一致性校验流程(IAA),提升跨标注员的数据稳定性; 4. 标注团队赋能:为标注员提供技术培训,将复杂的代码和 Agent 概念转化为可操作的标注实践;担任技术难题的终极裁判,解决边界案例和歧义问题;参与标注工具需求设计,提升代码标注效率; 5. 探索更科学的评测指标、更高效的评测和标注方法。
1. 验收系统底层方向 AI Coding 数据质量 — 对底层 bug-fix、性能优化、内存/并发问题修复、嵌入式功能开发等任务数据进行质量验收,核查任务设计的真实性、难度合理性与工程场景还原度。 2. 标注规范与数据设计:负责主导 Code 方向标注规范的制定与持续迭代,覆盖代码生成、代码补全、debug、代码解释、代码审查等多类任务;设计 Agentic 场景下的标注框架,包括 multi-step reasoning、tool use、planning、self-correction 等复杂任务链的拆解与评估标准;基于模型表现与研究进展,持续优化标注指南,确保数据质量与训练目标对齐; 3. 数据质量管控:对标注员产出进行专家级审核,重点识别代码逻辑错误、安全漏洞、风格一致性问题;建立 Code / Agentic 数据质量评估体系,定义量化指标并追踪质量趋势;设计并执行标注一致性校验流程(IAA),提升跨标注员的数据稳定性; 4. 标注团队赋能:为标注员提供技术培训,将复杂的代码和 Agent 概念转化为可操作的标注实践;担任技术难题的终极裁判,解决边界案例和歧义问题;参与标注工具需求设计,提升代码标注效率; 5. 探索更科学的评测指标、更高效的评测和标注方法。
1. 验收数据工程方向 AI Coding 数据质量 — 对数据处理 bug-fix、pipeline feature 开发等任务数据进行质量验收,核查任务的真实性、难度合理性与工程场景还原度。 2. 标注规范与数据设计:负责主导 Code 方向标注规范的制定与持续迭代,覆盖代码生成、代码补全、debug、代码解释、代码审查等多类任务;设计 Agentic 场景下的标注框架,包括 multi-step reasoning、tool use、planning、self-correction 等复杂任务链的拆解与评估标准;基于模型表现与研究进展,持续优化标注指南,确保数据质量与训练目标对齐; 3. 数据质量管控:对标注员产出进行专家级审核,重点识别代码逻辑错误、安全漏洞、风格一致性问题;建立 Code / Agentic 数据质量评估体系,定义量化指标并追踪质量趋势;设计并执行标注一致性校验流程(IAA),提升跨标注员的数据稳定性; 4. 标注团队赋能:为标注员提供技术培训,将复杂的代码和 Agent 概念转化为可操作的标注实践;担任技术难题的终极裁判,解决边界案例和歧义问题;参与标注工具需求设计,提升代码标注效率; 5. 探索更科学的评测指标、更高效的评测和标注方法。
1. 负责 Office / 电商方向 AI 训练数据(SFT / RL 阶段)的标注管理与质检工作;与算法及产品团队协作,理解 RM 训练和 rollout 打分的数据诉求,交付满足研发需求的高质量数据。 2. 设计并落地覆盖办公生产力(文档、PPT、Excel)和电商运营场景的标注与质检流程,持续优化 rubric 与 verifier,推动双标一致率等核心指标达成。 3. 统筹本方向的评测方案与数据生产方案,为 rubric 设计、verifier 校验、轨迹打分等环节制定可操作的标准;定期开展 pass 与非 pass 双向抽检,迭代标注规范。 4. 构建并维护本方向的数据质量管理体系,对轨迹根因归因(模型能力 / 评测缺陷 / 任务定义)的闭环负责;警惕分数虚高等隐性风险,持续优化迭代。 5. 管理标注专家团队,统筹日常任务分配与产能调度;与上下游(算法、产品、领域专家)充分协作,把个人判断力沉淀为团队方法论。