logo of antgroup

蚂蚁金服蚂蚁集团-语音大模型评测工程师-健康事业群

社招全职3年以上技术类-算法地点:北京 | 杭州状态:招聘

任职要求


本科及以上学历,语音、计算机、人工智能、机器学习、多模态等相关专业,2年以上语音算法、语音测试、模型评测或相关工作经验。
熟悉语音相关核心技术原理,理解语音前端、唤醒、VAD、ASRTTS、语音通话处理、端到端语音模型及原生多模态模型的基本机制与常见问题。
具备语音模型评测体系设计经验,能够独立设计评测维度、指标体系、测试方案和数据集,具备较强的问题分析与效果归因能力。
熟悉语音交互系统或语音产品落地流程,了…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


团队介绍
负责医疗语音大模型的研发和应用,覆盖语音前端DSP、3A、VAD、ASR、TTS等核心技术方向,并持续探索原生多模态等前沿技术方案,推动语音与多模态能力在医疗场景中的技术突破。
聚焦医疗健康领域核心场景,打造行业领先的AI产品,包括泛医疗助手、医护办事等应用,提升医疗行业用户体验与服务效率,助力支付宝医疗健康迈向智能化新时代。
研究和跟踪语音智能、大模型、多模态等前沿技术发展,探索AI助力医疗普惠、医疗服务智能化的新范式。
职位描述
负责医疗语音大模型及相关语音能力的评测体系建设,围绕S2T/ASR/TTS、语音通话、数字人、医疗语音交互等场景,设计评测方案、构建评测标准并持续优化。
结合业务目标与模型能力,定义核心评测指标,包括但不限于识别准确率、延迟、稳定性、自然度、可懂度、鲁棒性、安全合规性、医疗场景可用性等,并建立可量化、可追踪的评测机制。
负责搭建语音大模型离线评测、在线评测与专项评测能力,建设测试集、基准集和场景化评测集,覆盖真实医疗场景中的口音、噪声、术语、通话链路、长语音、多轮交互等复杂问题。
与语音算法、数据、产品、工程团队紧密协同,深入分析模型效果问题,定位性能瓶颈,推动ASR/TTS/语音大模型在医疗业务中的效果优化与目标达成。
参与评测自动化平台、评测工具链和数据闭环建设,推动评测流程标准化、工程化和规模化,提升模型迭代效率。
持续跟踪语音大模型、多模态、数字人、智能通话等方向的前沿评测方法与行业最佳实践,推动评测体系不断升级。
包括英文材料
学历+
机器学习+
算法+
语音识别+
语音合成+
数字人+
还有更多 •••
相关职位

logo of tongyi
社招3年以上技术类-算法

1. 针对语音通用大模型,设计和建设规划科学、全面的评估体系,涵盖评估指标与具体方法。 2. 基于大模型评测,评估不同算法/数据对于模型在不同能力上的效果,指导模型和数据选型。

更新于 2025-10-18北京|杭州
logo of aligenie
社招3年以上技术类-综合

1、搭建具有通用性和可拓展性的语音大模型数据标注和模型评测框架(NLP、TTS、ASR等方向),与算法团队对齐标准、撰写相关培训方案,根据模型迭代方向提供高质量数据,对自动化链路搭建、数据质量评估及外部资源管理负责; 2、结合行业趋势及业务应用场景,迭代更新评测标准、构建评测题库,负责语音大模型效果评测,定期反馈评估结果,产出评估报告,确保大模型评估结果置信; 3、通过PE、代码、Workflow、Agent完成数据预处理、分析和清洗,按照训练需求进行标注、分析和验证调优,提升模型效果; 4、与产品算法团队协同,积极探索自动化数据生产/模型评估、数据合成等方法,提高数据标注/评测效率,持续跟踪大模型技术进展,持续探索智能高效的数据生产模式。

更新于 2026-04-03北京|杭州
logo of alibaba
社招5年以上

1. 负责语音大模型评测体系的系统性建设,围绕ASR、TTS、音频理解、语音对话等核心能力,设计全面、科学、可持续迭代的评测方案。 2. 主导音频评测数据集的建设工作,深入调研前沿音频评测基准,负责数据需求规划、采集方案设计、标注规范制定与质量审核全流程,持续优化评测维度与指标体系。 3. 设计音频领域自动评分与人工评审相结合的混合评测方案,制定主观听感评测标准,建设自动化评测链路,持续验证自动化及人工评测结果的一致性。 4. 输出高质量评测报告,从语言学/语音信号专业视角清晰呈现模型在各维度的能力表现,识别模型的典型失败案例与能力边界,为模型迭代提供具体可操作的改进建议。 5. 与模型研发、数据、产品等团队紧密协作,将评测结论有效转化为模型优化建议,形成评测驱动模型迭代的良性闭环。

更新于 2026-06-30北京|杭州
logo of alibaba
社招3年以上技术类-综合

1、搭建具有通用性和可拓展性的语音大模型数据标注和模型评测框架(NLP、TTS、ASR等方向),与算法团队对齐标准、撰写相关培训方案,根据模型迭代方向提供高质量数据,对自动化链路搭建、数据质量评估及外部资源管理负责; 2、结合行业趋势及业务应用场景,迭代更新评测标准、构建评测题库,负责语音大模型效果评测,定期反馈评估结果,产出评估报告,确保大模型评估结果置信; 3、通过PE、代码、Workflow、Agent完成数据预处理、分析和清洗,按照训练需求进行标注、分析和验证调优,提升模型效果; 4、与产品算法团队协同,积极探索自动化数据生产/模型评估、数据合成等方法,提高数据标注/评测效率,持续跟踪大模型技术进展,持续探索智能高效的数据生产模式。

更新于 2026-06-11北京|杭州