千问语音大模型数据实习生
任职要求
1、语言学、语音学、方言学、计算机语言学等专业背景; 2、有戏剧、编剧、播音主持、表演等经验优先; 3、对语言和声音有高敏感度,具备优秀的文本创作能力和音质审美,普通话标准。熟练使用方言或第二…
工作职责
1、负责为不同角色设计人设并撰写富有表现力的文本语料,旨在为合成语音注入情感、表现力和角色特质。从声学及表演角度参与发音人筛选; 2、参与构建专业的数据生产流程,制定语言学标注标准。对录音数据进行质量检查。整理并制定发音和韵律规则; 3、参与搭建语音合成效果的主观与客观评价流程。从音质、自然度、表现力、发音准确度等维度进行专业评测并提供优化建议。
1.根据项目需求,与数据专家及算法团队一起制定数据方案(中文&英文)。参与语音数据的录制、标注、校验与质量评估,保证数据工作的质量和准确性。 2.参与设计语音模型评测方案,跟进模型训练各阶段的模型效果评估,撰写评测/反馈报告。 3.关注主流语音模型及AI产品的相关信息,进行市场调研与用户研究,撰写调研报告。 4.与上下游相关部门协作,跨团队沟通协调,保证项目顺利推进。
1、搭建具有通用性和可拓展性的语音大模型数据标注和模型评测框架(NLP、TTS、ASR等方向),与算法团队对齐标准、撰写相关培训方案,根据模型迭代方向提供高质量数据,对自动化链路搭建、数据质量评估及外部资源管理负责; 2、结合行业趋势及业务应用场景,迭代更新评测标准、构建评测题库,负责语音大模型效果评测,定期反馈评估结果,产出评估报告,确保大模型评估结果置信; 3、通过PE、代码、Workflow、Agent完成数据预处理、分析和清洗,按照训练需求进行标注、分析和验证调优,提升模型效果; 4、与产品算法团队协同,积极探索自动化数据生产/模型评估、数据合成等方法,提高数据标注/评测效率,持续跟踪大模型技术进展,持续探索智能高效的数据生产模式。
1、搭建具有通用性和可拓展性的语音大模型数据标注和模型评测框架(NLP、TTS、ASR等方向),与算法团队对齐标准、撰写相关培训方案,根据模型迭代方向提供高质量数据,对自动化链路搭建、数据质量评估及外部资源管理负责; 2、结合行业趋势及业务应用场景,迭代更新评测标准、构建评测题库,负责语音大模型效果评测,定期反馈评估结果,产出评估报告,确保大模型评估结果置信; 3、通过PE、代码、Workflow、Agent完成数据预处理、分析和清洗,按照训练需求进行标注、分析和验证调优,提升模型效果; 4、与产品算法团队协同,积极探索自动化数据生产/模型评估、数据合成等方法,提高数据标注/评测效率,持续跟踪大模型技术进展,持续探索智能高效的数据生产模式。