千问千问C端事业群-语音大模型数据策略运营-杭州
任职要求
1、本科以上学位,语言学、语音学、计算语言学、语用学、心理学、汉语言等相关专业优先;
2、2-3年以上语音数据相关工作经验,熟悉音视频创作、智能语音交互场景,有大语言模型相关的科研项目或工作经历…工作职责
1、负责语音大模型的数据构建,搭建高效高质的数据生产Pipeline和数据标准,用高质量数据提升算法和业务落地的效果; 2、负责语音大模型语音录制、数据寻源、音色数据筛选,搭建科学敏捷的筛选评测Pipeline,包括但不限于排期安排、资源调配以及跨部门沟通协作,确保每个项目都能高效、高质量地完成。 灵活应对录音人选状态变化,适时调整录制计划以保证声音效果。 3、深度理解模型,有敏锐的声音判断能力,设计与业务目标贴合的数据与评测方案;与产品算法团队协同,积极探索自动化数据生产/模型评估、数据合成等方法,提高数据探寻、标注效率; 4、做好数据和评测项目的人力、成本、进度等管理,协调项目资源,推动跨部门沟通合作,达成项目目标。 5、数据音色寻源判断,可自带资源
1、负责为不同角色设计人设并撰写富有表现力的文本语料,旨在为合成语音注入情感、表现力和角色特质。从声学及表演角度参与发音人筛选; 2、参与构建专业的数据生产流程,制定语言学标注标准。对录音数据进行质量检查。整理并制定发音和韵律规则; 3、参与搭建语音合成效果的主观与客观评价流程。从音质、自然度、表现力、发音准确度等维度进行专业评测并提供优化建议。
1、搭建具有通用性和可拓展性的语音大模型数据标注和模型评测框架(NLP、TTS、ASR等方向),与算法团队对齐标准、撰写相关培训方案,根据模型迭代方向提供高质量数据,对自动化链路搭建、数据质量评估及外部资源管理负责; 2、结合行业趋势及业务应用场景,迭代更新评测标准、构建评测题库,负责语音大模型效果评测,定期反馈评估结果,产出评估报告,确保大模型评估结果置信; 3、通过PE、代码、Workflow、Agent完成数据预处理、分析和清洗,按照训练需求进行标注、分析和验证调优,提升模型效果; 4、与产品算法团队协同,积极探索自动化数据生产/模型评估、数据合成等方法,提高数据标注/评测效率,持续跟踪大模型技术进展,持续探索智能高效的数据生产模式。
1、搭建具有通用性和可拓展性的语音大模型数据标注和模型评测框架(NLP、TTS、ASR等方向),与算法团队对齐标准、撰写相关培训方案,根据模型迭代方向提供高质量数据,对自动化链路搭建、数据质量评估及外部资源管理负责; 2、结合行业趋势及业务应用场景,迭代更新评测标准、构建评测题库,负责语音大模型效果评测,定期反馈评估结果,产出评估报告,确保大模型评估结果置信; 3、通过PE、代码、Workflow、Agent完成数据预处理、分析和清洗,按照训练需求进行标注、分析和验证调优,提升模型效果; 4、与产品算法团队协同,积极探索自动化数据生产/模型评估、数据合成等方法,提高数据标注/评测效率,持续跟踪大模型技术进展,持续探索智能高效的数据生产模式。