logo of alibaba

阿里巴巴AI创新事业部-多模态大模型数据评测专家-未来生活实验室

社招全职3年以上技术类-综合地点:北京 | 杭州状态:招聘

任职要求


1、本科及以上学历,影视、编导、美学设计等相关专业优先;
2、具有2年及以上大模型项目经验,作为多模态大模型的深度用户,对文生图,文生视频大模型有丰富的实际操作经验,能提供对应的AIGC生图/生视频的作品优先;
3、有较好的美学…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


1、评测体系建设
深入理解公司 AI 产品业务场景,结合多模态大模型技术发展趋势,设计并持续完善模型评测体系,包括评测维度、指标定义、评测流程与方法论,确保评测结果能够客观反映模型能力变化与关键问题。
2、数据与评测标准建设
负责多模态大模型训练与评测数据的质量体系建设,包括数据标注规范制定、评测标准设计及数据集构建与优化,沉淀高质量数据资产,为模型训练与评测提供可靠基础。
3、模型评测与效果分析
联合产品与算法团队开展离线评测、场景评测及对比评测,系统分析模型表现与能力边界,输出结构化评测报告,支持模型迭代与产品优化。
4、评测场景与Benchmark构建
围绕核心业务场景构建评测任务与Benchmark体系,持续扩展评测覆盖范围,确保评测体系能够真实反映用户场景与模型能力。
5、数据驱动的优化闭环与行业对标
与算法、产品和数据团队协作,通过评测定位模型问题并推动数据补充与模型优化,建立“评测—分析—优化—复评”的迭代闭环,同时持续跟踪行业评测方法与Benchmark,优化内部评测框架。
包括英文材料
学历+
大模型+
AIGC+
还有更多 •••
相关职位

logo of tongyi
社招3年以上技术类-综合

1、评测体系建设 深入理解公司 AI 产品业务场景,结合多模态大模型技术发展趋势,设计并持续完善模型评测体系,包括评测维度、指标定义、评测流程与方法论,确保评测结果能够客观反映模型能力变化与关键问题。 2、数据与评测标准建设 负责多模态大模型训练与评测数据的质量体系建设,包括数据标注规范制定、评测标准设计及数据集构建与优化,沉淀高质量数据资产,为模型训练与评测提供可靠基础。 3、模型评测与效果分析 联合产品与算法团队开展离线评测、场景评测及对比评测,系统分析模型表现与能力边界,输出结构化评测报告,支持模型迭代与产品优化。 4、评测场景与Benchmark构建 围绕核心业务场景构建评测任务与Benchmark体系,持续扩展评测覆盖范围,确保评测体系能够真实反映用户场景与模型能力。 5、数据驱动的优化闭环与行业对标 与算法、产品和数据团队协作,通过评测定位模型问题并推动数据补充与模型优化,建立“评测—分析—优化—复评”的迭代闭环,同时持续跟踪行业评测方法与Benchmark,优化内部评测框架。

更新于 2026-07-03北京|杭州
logo of aligenie
社招3年以上技术类-综合

评测体系建设 深入理解公司 AI 产品业务场景,结合多模态大模型技术发展趋势,设计并持续完善模型评测体系,包括评测维度、指标定义、评测流程与方法论,确保评测结果能够客观反映模型能力变化与关键问题。 数据与评测标准建设 负责多模态大模型训练与评测数据的质量体系建设,包括数据标注规范制定、评测标准设计及数据集构建与优化,沉淀高质量数据资产,为模型训练与评测提供可靠基础。 模型评测与效果分析 联合产品与算法团队开展离线评测、场景评测及对比评测,系统分析模型表现与能力边界,输出结构化评测报告,支持模型迭代与产品优化。 评测场景与Benchmark构建 围绕核心业务场景构建评测任务与Benchmark体系,持续扩展评测覆盖范围,确保评测体系能够真实反映用户场景与模型能力。 数据驱动的优化闭环与行业对标 与算法、产品和数据团队协作,通过评测定位模型问题并推动数据补充与模型优化,建立“评测—分析—优化—复评”的迭代闭环,同时持续跟踪行业评测方法与Benchmark,优化内部评测框架。

更新于 2026-03-31北京|杭州
logo of aligenie
社招2年以上

1. 负责多模态大模型的高质量的数据构造及模型评测工作,与算法团队密切合作,理解算法需求,提供满足算法研发需求的数据; 2. 设计和实现各领域标注方向AI训练流程,并不断优化迭代,高效完成标注和内容生产项目; 3. 构建并维护一套完善的各领域AI数据内容质量管理体系,全面把控内容质量并对结果负责,并不断进行优化迭代; 4. 积极推动组织流程及交付流程优化,对接数据标注供应商。负责组织培训、试标、通过持续培训和反馈提升供应商标注质量与效率; 5.1开展多模态大模型及应用的评测建设,能够从各领域专业层面设计专业评测方案、开展专业的评测服务。

更新于 2026-03-31杭州
logo of alibaba
社招2年以上

1. 主导面向文生图/文生视频等多模态生成场景评测体系设计,定义核心能力维度,将模型生成能力转化为可量化指标。 2. 设计覆盖文生视频、图生视频、多模态条件生成、创意内容生成等真实场景的评测任务,覆盖写实、艺术风格、特效、动画等多种方向。 3. 主导基座模型评测方案的设计与执行,包括 Arena 对战评测(ELO 排名)、GSB(Good/Same/Bad)对比评测、MOS(Mean Opinion Score)主观质量评分等,确保评测方法的统计显著性与结果可信度。 4. 深入创作者社区收集反馈与失败案例,对 Bad Case 做分类与归因形成产品问题清单。 5. 建立评测数据质量管控与版本管理机制,定期更新评测集以覆盖新创意方向与产品功能。 6. 与产品、设计、算法团队紧密协作,在新模型上线前完成评测,提供数据驱动的优先级建议。

更新于 2026-07-14北京|杭州