logo of alibaba

阿里巴巴AI创新事业部-语音大模型数据评测专家-未来生活实验室

社招全职3年以上技术类-综合地点:北京 | 杭州状态:招聘

任职要求


1、本科及以上学历,3年以上互联网产品/运营或大模型数据运营、模型评测经验(语音经验优先),语言类&计算机交叉类专业优先(例如:计算语言学、语言智能、数字语言学);
2、对大模型、数据、评测有深刻的理解和认知,具备独立构建评测标准和评测题…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


1、搭建具有通用性和可拓展性的语音大模型数据标注和模型评测框架(NLP、TTS、ASR等方向),与算法团队对齐标准、撰写相关培训方案,根据模型迭代方向提供高质量数据,对自动化链路搭建、数据质量评估及外部资源管理负责;
2、结合行业趋势及业务应用场景,迭代更新评测标准、构建评测题库,负责语音大模型效果评测,定期反馈评估结果,产出评估报告,确保大模型评估结果置信;
3、通过PE、代码、Workflow、Agent完成数据预处理、分析和清洗,按照训练需求进行标注、分析和验证调优,提升模型效果;
4、与产品算法团队协同,积极探索自动化数据生产/模型评估、数据合成等方法,提高数据标注/评测效率,持续跟踪大模型技术进展,持续探索智能高效的数据生产模式。
包括英文材料
学历+
大模型+
还有更多 •••
相关职位

logo of tongyi
社招3年以上技术类-综合

1、搭建具有通用性和可拓展性的语音大模型数据标注和模型评测框架(NLP、TTS、ASR等方向),与算法团队对齐标准、撰写相关培训方案,根据模型迭代方向提供高质量数据,对自动化链路搭建、数据质量评估及外部资源管理负责; 2、结合行业趋势及业务应用场景,迭代更新评测标准、构建评测题库,负责语音大模型效果评测,定期反馈评估结果,产出评估报告,确保大模型评估结果置信; 3、通过PE、代码、Workflow、Agent完成数据预处理、分析和清洗,按照训练需求进行标注、分析和验证调优,提升模型效果; 4、与产品算法团队协同,积极探索自动化数据生产/模型评估、数据合成等方法,提高数据标注/评测效率,持续跟踪大模型技术进展,持续探索智能高效的数据生产模式。

更新于 2026-07-03北京|杭州
logo of aligenie
社招3年以上技术类-综合

1、搭建具有通用性和可拓展性的语音大模型数据标注和模型评测框架(NLP、TTS、ASR等方向),与算法团队对齐标准、撰写相关培训方案,根据模型迭代方向提供高质量数据,对自动化链路搭建、数据质量评估及外部资源管理负责; 2、结合行业趋势及业务应用场景,迭代更新评测标准、构建评测题库,负责语音大模型效果评测,定期反馈评估结果,产出评估报告,确保大模型评估结果置信; 3、通过PE、代码、Workflow、Agent完成数据预处理、分析和清洗,按照训练需求进行标注、分析和验证调优,提升模型效果; 4、与产品算法团队协同,积极探索自动化数据生产/模型评估、数据合成等方法,提高数据标注/评测效率,持续跟踪大模型技术进展,持续探索智能高效的数据生产模式。

更新于 2026-04-03北京|杭州
logo of alibaba
社招5年以上

1. 负责语音大模型评测体系的系统性建设,围绕ASR、TTS、音频理解、语音对话等核心能力,设计全面、科学、可持续迭代的评测方案。 2. 主导音频评测数据集的建设工作,深入调研前沿音频评测基准,负责数据需求规划、采集方案设计、标注规范制定与质量审核全流程,持续优化评测维度与指标体系。 3. 设计音频领域自动评分与人工评审相结合的混合评测方案,制定主观听感评测标准,建设自动化评测链路,持续验证自动化及人工评测结果的一致性。 4. 输出高质量评测报告,从语言学/语音信号专业视角清晰呈现模型在各维度的能力表现,识别模型的典型失败案例与能力边界,为模型迭代提供具体可操作的改进建议。 5. 与模型研发、数据、产品等团队紧密协作,将评测结论有效转化为模型优化建议,形成评测驱动模型迭代的良性闭环。

更新于 2026-06-30北京|杭州
logo of aligenie
社招5年以上技术类-数据

1.开展音频模型能力评测建设,基于评测的错误类型、分布,能针对性构建音频数据,提高模型特定表现,并能够通过对数据有效性的评测,验证数据有效性; 2.建设AI音频应用业务评测维度、指标体系、业务评测集并开展深入的评测分析工作。产出评测报告,学术benchmark等有影响力的创新工作。

更新于 2026-06-04北京|杭州