阿里巴巴晓天衡宇-世界模型数据运营-具身智能
任职要求
本科及以上,具备数据交付或项目管理经验;熟练项目管理全流程与工具(飞书多维表格、Jira、甘特图工具)。 具备以下任一领域纵深(二选一): 1.影视方向:懂影视制作流程与镜头/剪辑/光影语言,能从创作视角理解画面构成与语义层次; 2.游戏方向:游戏 3D 开发或策划背景,懂游戏机制(战斗、交互、关卡等),熟悉 UE/Unity 与 3D 建模软件(Blender…
工作职责
1.负责世界模型数据项目全周期交付:需求拆解、排期(WBS/甘特图)、里程碑验收,产出可执行的项目计划与交付节奏。 2.结合影视或游戏领域认知,参与定义世界模型数据的采集、标注标准与质量口径,沉淀可复用的标注 SOP。 3.打通算法端、采集端、供应商与业务端的数据流转,建立稳定的跨端协作机制与问题闭环。 4.监控项目在进度、产能、质量、成本上的风险,产出量化看板并推动治理落地。 5.推动标注流程的自动化/数字化提效。
1. 负责世界模型 / 视频生成模型的评测体系建设:搭建并迭代端到端评测框架,覆盖画面、动作、时序一致性、指令遵循、音画协同等多维度,支撑模型版本迭代决策与能力短板定位。 2. 制定评测标准与规则:定义评测维度体系与打分口径(rubric),牵头产品、算法、评测多方对齐,形成可复用、可量化的评测基准。 3. 构建与维护评测集:面向影视 / 剧情 / 表演等真实场景,结合线上数据分布构建分场景、分难度的评测题库,并持续迭代。 4. 组织评测执行与质量管理:统筹人工评审流程(多轮评审 + 定标),管理评测团队与供应商,建立复盘培训机制保障评测一致性。 5. 推动评测提效:探索 LLM / 多模态大模型自动化评测(机评)与人评结合,降低评测成本、提升出数速度;沉淀竞品对标分析。
1、世界模型生成效果评测:主导世界模型生成内容的质量评测,组织标注团队完成任务分发与结果分析,针对画面质量、运动质量、一致性等维度进行精细化标注,归纳高频 Bad Case 并明确模型"崩塌点"与优化方向,输出结构化反馈支撑算法侧持续优化 2、物理一致性/时空连贯性分析:针对动作流畅性、物体运动轨迹、空间遮挡关系、时间连续性等维度建立系统化评测标准,精准识别"动作突变""物体穿模""重力异常""镜头跳切"等不合理现象,完成 Bad Case 归因与评测维度拆解 3、游戏场景评测:统筹游戏方向的数据采集与评测,采集策略制定与采集质量评估,与算法工程师对接基于模型训练反馈快速调整采集方向 4、游戏交互与场景一致性分析:深入理解角色与环境的交互逻辑、物理碰撞、动态反馈机制,建立游戏交互一致性的评测方法论,确保游戏场景中交互行为与物理规则的合理性评估有据可依 5、评测标准制定与团队管理:制定并维护各方向评测标准、评分规则与SOP,组织团队标尺对齐讨论确保多人评判一致性;管理评测与数据团队,独立构建质量监督方案,对评测数据的交付数量与质量负责
1. 负责大模型的高质量的数据构造及模型评测工作,主要聚焦在通用模型能力(创作、指令遵循、角色体验)等各垂域(医疗、法律、金融等)数据任务,与算法团队密切合作,理解算法需求,提供满足算法研发需求的数据; 2. 设计和实现各领域标注方向AI训练流程,并不断优化迭代,高效完成标注和内容生产项目; 3. 统筹各领域核心知识点分类框架、回答思维模式、推理问答、权威教材教研资料、前沿科研论文专著等关键要素。依据多元数据集设计需求与应用场景,为数据集标准环节制定详实、完备且极具可操作性的标准。定期对数据集开展阶段性质量检测,持续迭代体系化标注标准,助力打造行业标杆级数据集; 4. 构建并维护一套完善的各领域AI数据内容质量管理体系,积极推动组织流程及交付流程优化,全面把控内容质量并对结果负责,并不断进行优化迭代; 5. 开展LLM及各垂域大模型及应用的评测建设,能够从各领域专业层面设计专业评测方案、开展专业的评测服务; 6.承担本方向数据处理、数据清洗、数据蒸馏、数据合成等多样数据工程工作。
1. 负责AI原生应用的数据构造及应用评测工作,主要聚焦在用户体验,端到端效果评测提升,与产品及算法团队密切合作,理解算法需求,提供满足算法研发需求的数据; 2. 设计和实现各领域标注方向AI训练流程,并不断优化迭代,高效完成标注和内容生产项目; 3. 统筹ai应用各领域评测方案及数据生产方案。依据多元数据集设计需求与应用场景,为数据集标准环节制定详实、完备且极具可操作性的标准。定期对数据集开展阶段性质量检测,持续迭代体系化标注标准,助力打造行业标杆级数据集。 4. 构建并维护一套完善的各领域AI数据内容质量管理体系,积极推动组织流程及交付流程优化,全面把控内容质量并对结果负责,并不断进行优化迭代;