logo of aligenie

智能互联数据技术及产品部-AI 具身智能领域数据架构师-杭州/北京

社招全职5年以上技术类-数据地点:北京 | 杭州状态:招聘

任职要求


1. 计算机、人工智能、机器人、自动化等相关专业本科及以上学历。
2. 5年以上 AI 数据相关经验,其中至少 2 年机器人、自动驾驶或具身智能领域的数据建设经验。
3. 精通数据采集 Pipeline 设计;熟悉机器人数据格式及处理工具,具备仿真平台使用经验,了解机器学习基础,理解 VLA、Diffusi…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


负责搭建并管理面向具身智能模型的全链路数据体系,包括数据采集、清洗、标注、仿真生成及质量评估。作为算法团队与数据采集团队的核心桥梁,确保高质量、多样化的物理交互数据供给,直接支撑模仿学习、强化学习及 VLA模型的训练需求。你将参与定义下一代智能机器人数据标准的机会,与顶尖具身智能算法团队紧密协作,以数据直接驱动模型迭代,参与建设覆盖真机集群与大规模仿真算力的数据基础设施。
岗位主要内容包括以下:

1. 数据战略与体系搭建:设计并落地具身智能的数据金字塔架构(基础技能数据→复杂任务数据→长程规划数据);制定真机数据采集与仿真数据生成的混合策略;构建多模态数据标准:视觉、关节状态、力触觉、动作轨迹的时序对齐规范
2. 数据采集与标注管理:搭建真机数据采集流水线:管理遥操作团队或动作捕捉外包,建立人机协作的高效采集 SOP;设计自动化标注工具链:开发/引入基于 SLAM、关键点检测、自动分段(Segmentation)的半自动标注方案,降低人工标注成本;建立数据因果一致性校验机制:确保动作-视觉-语言指令的时序对齐与物理合理性
3. 仿真数据生态构建:主导高保真仿真环境的数据生成 pipeline;设计程序化生成方案:自动创建多样化场景、物体姿态、物理参数(摩擦、质量)的仿真数据;建立 Sim2Real Gap 评估体系,通过域适应技术提升仿真数据利用率
4. 数据质量与合规:制定数据质量评估指标体系:覆盖率、多样性、动作平滑度、物理可行性;建立数据版本管理(与血缘追踪,支持模型训练的可复现性;确保数据采集的隐私合规(如室内场景脱敏、人体数据伦理审查)
5. 团队建设与管理:组建并管理数据采集团队(含外包标注团队、遥操作员、仿真工程师);建立与算法团队的数据需求对接机制:将模型训练需求转化为采集任务;持续优化数据生产的 ROI,降低单位数据的采集与标注成本。
包括英文材料
学历+
还有更多 •••
相关职位

logo of aligenie
社招3年以上

1.构建C端AI助手(如千问、悟空、QoderWork)的产品评测体系:围绕对话式AI助手的核心体验,从真实用户场景出发,设计评测维度、构建高质量评测集与评分标准,确保评测结果能真实反映产品的市场竞争力与用户体感。 2.驱动评测体系的产品化与平台化:负责将评测所需要的场景用例、评测流程与结果洞察封装,线上维护评测结果、对比与可视化看板,降低产品与算法团队的评测门槛,支撑快速迭代。 3.Agent与工具调用评测环境搭建:针对AI助手中的搜索联网、插件调用与Agent规划能力,搭建端到端的仿真运行环境与MCP工具层,实现外部工具接口的标准化注册、调用链路追踪与结果校验,确保多步骤任务评测的可复现性。 4.评测Benchmark建设:接入并适配主流开源评测集,同时持续挖掘用户真实Bad Case,沉淀并构建符合国内C端用户习惯的专属业务评测数据集,完成数据解析与评分逻辑对齐。 5.跨团队协同与体验闭环:作为评测体验专家,与产品经理、算法研究团队紧密协作,将产品侧的体验诉求转化为可量化的工程评测方案,并通过评测数据反哺产品迭代方向,以打造最受欢迎的AI应用为目标。

更新于 2026-06-17北京|杭州
logo of alibaba
社招1年以上技术类-数据

1、参与集团级AI数据引擎:负责多模态数据(文本、音频、图像、视频)的采集、清洗、处理、治理与资产化管理,打造可复用、可观测、可解释的 EB 级数据体系,支撑大模型训练与推理的高质量数据供给; 2、多模态数据智能化处理:主导音频/视频/图像等模态的自动理解、标签体系构建、语义特征抽取、质量建模与自动化治理;设计并训练分类、识别、预测等多模态模型; 3、AI Native数据Pipeline建设:使用LLM+Agent框架构建智能数据Pipeline,实现数据分渠道过滤、去重、质量诊断、调度编排和异常告警等环节的自动化,显著降低人力成本; 4、数据&模型闭环迭代:基于评测反馈的短板,设计对应的专项数据集,并在训练过程中构建可观测指标,量化数据对模型能力提升的贡献,动态更新数据集,实现数据 → 模型 → 评测 → 数据的循环优化; 5、数据资产治理:负责元数据、数据血缘、分类分级、质量评分、数据标准、价值评估等治理框架的设计与落地,推动数据资产的可视化与可运营化,让数据可管理、可复用、可增长; 6、与模型团队协作,参与训练数据构造、数据反哺、短板挖掘和评测闭环建设,通过数据驱动模型能力提升,成为AI模型训练的数据核心驱动力;

更新于 2026-06-18杭州
logo of alibaba
社招2年以上技术类-数据

1、参与集团级AI数据引擎:负责多模态数据(文本、音频、图像、视频)的采集、清洗、处理、治理与资产化管理,打造可复用、可观测、可解释的 EB 级数据体系,支撑大模型训练与推理的高质量数据供给; 2、多模态数据智能化处理:主导音频/视频/图像等模态的自动理解、标签体系构建、语义特征抽取、质量建模与自动化治理;设计并训练分类、识别、预测等多模态模型; 3、AI Native数据Pipeline建设:使用LLM+Agent框架构建智能数据Pipeline,实现数据分渠道过滤、去重、质量诊断、调度编排和异常告警等环节的自动化,显著降低人力成本; 4、数据&模型闭环迭代:基于评测反馈的短板,设计对应的专项数据集,并在训练过程中构建可观测指标,量化数据对模型能力提升的贡献,动态更新数据集,实现数据 → 模型 → 评测 → 数据的循环优化; 5、数据资产治理:负责元数据、数据血缘、分类分级、质量评分、数据标准、价值评估等治理框架的设计与落地,推动数据资产的可视化与可运营化,让数据可管理、可复用、可增长; 6、算法与工程一体化协作:与模型团队协作,参与训练数据构造、数据反哺、短板挖掘和评测闭环建设,通过数据驱动模型能力提升,成为AI模型训练的数据核心驱动力;

更新于 2026-07-30杭州
logo of alibaba
社招3年以上

1.构建C端AI助手(如千问、悟空、QoderWork)的产品评测体系:围绕对话式AI助手的核心体验,从真实用户场景出发,设计评测维度、构建高质量评测集与评分标准,确保评测结果能真实反映产品的市场竞争力与用户体感。 2.驱动评测体系的产品化与平台化:负责将评测所需要的场景用例、评测流程与结果洞察封装,线上维护评测结果、对比与可视化看板,降低产品与算法团队的评测门槛,支撑快速迭代。 3.Agent与工具调用评测环境搭建:针对AI助手中的搜索联网、插件调用与Agent规划能力,搭建端到端的仿真运行环境与MCP工具层,实现外部工具接口的标准化注册、调用链路追踪与结果校验,确保多步骤任务评测的可复现性。 4.评测Benchmark建设:接入并适配主流开源评测集,同时持续挖掘用户真实Bad Case,沉淀并构建符合国内C端用户习惯的专属业务评测数据集,完成数据解析与评分逻辑对齐。 5.跨团队协同与体验闭环:作为评测体验专家,与产品经理、算法研究团队紧密协作,将产品侧的体验诉求转化为可量化的工程评测方案,并通过评测数据反哺产品迭代方向,以打造最受欢迎的AI应用为目标。

更新于 2026-06-17北京|杭州