logo of bytedance

字节跳动AI训练数据与评测专家 - AI数据与安全

社招全职A191413地点:北京状态:招聘

任职要求


1、本科及以上学历,计算机、人工智能、数据科学、统计学、数学、语言学等相关专业优先,具备经济、金融、法律、医疗、教育等垂直行业背景者更佳,这类背景有助于更深入理解复杂专业场景下的数据生产与评测需求;
2、对大模型、AI应用、数据生产或模型评测有浓厚兴趣,愿意深入理解业务场景并推动问题解决;
3、具备良好的逻辑分析能力、结构化表达能力和跨团队沟通协作能力,能够把复…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


团队介绍:AI 数据与安全团队为 Seed 基座模型及 AI 原生应用提供跨模态数据服务,覆盖数据生产全流程,包含模型评估标准的制定、数据规模化生产、数据飞轮搭建,不断提升数据质量,支持模型快速迭代。
团队由产品经理、数据工程、数据运营等跨职能人才组成,并通过与 Seed 研究员、行业专家、全球顶尖数据供应商紧密合作,从真实场景中收集反馈并分析模型表现数据,解决 AI 前沿突破过程中的复杂数据问题,推动模型性能与用户体验的双重提升。我们既是帮助模型技术迭代的一线贡献者,也是模型和 AI 产品的一手用户。

1、负责大语言模型在通用能力、生产力、多模态&世界模型、Coding&Agent等场景下的训练数据建设与模型评测工作,支持SFT、RL、偏好数据及专项能力数据的生产和迭代,深入理解不同业务场景及用户需求,设计训练数据方案和评估方案,包括数据挖掘、数据构造、清洗去重、标注规范制定、质量验收及评估集建设,分析训练数据的分布、覆盖度、多样性及质量问题,识别数据偏差、能力缺口和长尾场景,持续优化数据配比、生产策略和质量标准;
2、基于大语言模型的调用链路、检索结果、工具调用、模型回复及中间过程等信息,开展负面案例分析、错误定位与根因归类,判断问题来源于训练数据、模型能力、策略、检索或工程链路,结合模型实验结果,分析不同数据批次、数据类型及训练策略对模型效果的影响,闭环验证数据有效性,推动训练数据持续迭代;
3、设计并完善训练数据和模型评测的自动化流程,包括数据预处理、Prompt设计、数据合成、自动化打标、质量检查、结果聚类及分析报告生成等,提升数据生产和评估效率;
4、作为项目POC,与算法、产品、策略及数据团队紧密协作,负责需求澄清、方案设计、项目排期、资源协调、质量验收、风险管理及结果交付;
5、沉淀训练数据方法论、评估框架、错误分类体系、质量Rubric、项目SOP及分析模板,推动数据能力、评估标准和自动化工具复用。
包括英文材料
学历+
数据科学+
还有更多 •••
相关职位

logo of xd
社招3年以上技术大类

1. 构建UGC违规样本数据体系(文本、图片、用户行为); 2. 设计与维护数据加工流程(清洗、去噪、去重、标注、标签管理); 3. 搭建AI训练数据回流系统(人工纠错 → 样本更新 → 模型优化); 4. 建设内容风控指标体系(准确率、漏判率、错杀率、人工介入率); 5. 支持AI模型评估、版本对比与效果复盘; 6. 构建可复用数据资产管理系统; 7. 设计及维护审核系统的数据底层支撑; 8. 配合策略专家沉淀高质量违规样本库。

更新于 2025-12-24上海
logo of alibaba
社招3年以上技术类-数据

我们在做面向真实跨境贸易场景的 AI Agent,覆盖买家采购、商家经营、Research、商品发布、跨平台运营、物流跟踪等复杂任务。 岗位核心不是传统数仓/ETL,而是构建 Agent 训练数据、轨迹数据、评测数据与数据闭环系统。 你会做什么 1. 搭建 Agent / LLM 数据生产 Pipeline:采集、清洗、切分、去重、结构化、版本管理。 2. 构建 SFT、Preference、Tool Use、Function Call、多步规划、任务轨迹等训练数据。 3. 从 Query、对话、商品、行为日志、操作轨迹中挖掘高价值样本。 4. 建设 Agent Benchmark / Eval 数据集,覆盖任务完成率、工具调用准确率、多语言质量等。 5. 建立数据质检、抽检、异常发现、标注协同与自动化评测机制。 6. 和算法/产品/工程一起做“数据-训练-评测-线上反馈”闭环。

更新于 2026-06-26杭州
logo of alibaba
实习阿里巴巴2027

这是一个综合的AI推理、优化的技术岗位,适合希望从事以下工作的候选人投递: ● 希望从事AI应用构建与模型优化工作的候选人 ● 希望从事AI应用数据构建与自动化评测工作的候选人 ● 希望从事多模态AI应用构建与算法优化工作的候选人 围绕真实业务核心场景,参与AI应用的系统化构建与优化,把AI变为业务增长引擎,具体职责包括以下相关方向的一项或多项: 1、AI应用全生命周期演进:深度参与业务问题建模、应用架构设计、上下文工程、训练数据构建、自动化评估体系、模型后训练优化等; 2、数据飞轮构建:打造高质量数据生产链路,探索合成数据(Synthetic Data)与高效蒸馏技术方案,跑通“业务-模型-反馈”迭代闭环; 3、评测体系构建:面向业务目标,设计完备的AI应用效果评估体系,构建自动化评估框架,建立离线评估与在线业务指标联动的量化评估能力; 4、强化学习与奖励机制设计:构建可工程化的Reward体系与RL训练环境,提升模型在垂直业务场景中的可控性与泛化能力; 5、AI外部能力体系搭建:实现AI应用所需的知识库(RAG)、长短期记忆系统(Memory)、工具调用、多Agent协作框架等 6、多模态AI应用开发:构建AI应用的多模态感知与推理能力,解决在UI自动化、视觉理解与审核、多模态会话等场景的落地应用问题。

更新于 2026-03-19北京|杭州
logo of alibaba
社招3年以上技术类-数据

我们正在搭建 Work(AI 协同办公)方向的 RL/RFT 训练数据体系。这个岗位的核心职责是从线上回流数据中挖掘高价值样本:清洗、筛选、合成、发现 bad case,把海量线上数据变成模型训练和数据标注真正能用的东西。 职位描述 1. 线上数据回流与清洗 对接模型线上 rollout 产生的原始数据(轨迹、日志、用户反馈、执行结果等),设计清洗 pipeline,去重、去噪、过滤无效样本,把脏数据变成结构化可用的样本集。 2. 高价值数据挖掘 从海量线上数据中挖掘对模型训练有价值的样本:高难度任务、罕见场景、模型易错 case、用户真实需求分布。建立挖掘策略(规则 + 模型 + LLM 多信号融合),提升高价值样本的召回率。 3. Bad Case 发现与归因 系统性发现 bad case:模型执行失败、输出低质量、轨迹异常、用户投诉等。对 bad case 做根因分类(模型能力问题 / 数据分布问题 / 任务定义问题 / 环境依赖问题),输出结构化报告驱动数据补充和评测修正。 4. 数据合成与增强 设计数据合成策略:基于 LLM 对已有样本做变体生成、难度扩展、场景泛化,补充模型训练数据中的稀缺类型;验证合成数据质量,确保合成样本可直接用于训练。 5. LLM 驱动的精细化筛选 用 LLM-as-judge、质量评分模型等方式对海量数据做精筛,识别"表面合理但实际错误"的样本,把数据质量从"能看"升级到"能训"。设计筛选阈值与采样策略,平衡数据规模与质量。 6. 数据标注前置处理 为下游标注团队准备可标注的数据包:去重、预分类、标注难度分级、边界 case 标记,降低标注成本、提升标注效率。定期输出数据分布报告,指导标注优先级。 7. 数据 Pipeline 与基础设施 搭建端到端的数据处理 pipeline:采集 → 清洗 → 挖掘 → 合成 → 筛选 → 输出。保证数据可追溯(血缘管理)、可复现(版本管理)、可观测(关键指标监控)。 8. 协同算法与标注团队 与模型训练团队对齐"下一轮需要什么数据",与标注团队对齐"什么样的数据值得标",把数据挖掘变成模型能力提升的持续供给。

更新于 2026-07-08杭州