logo of antgroup

蚂蚁金服研究型实习生-语音端到端交互算法研究

实习兼职研究型实习生地点:北京 | 杭州状态:招聘

任职要求


研究领域:
-目前正在攻读计算机科学或相关STEM领域的学士,硕士或博士学位
-具有一种或多种通用编程语言的经验,包括但不限于: Java,C/C ++ 、Python、JavaScriptGo
-具有上述研究领域的…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


研究领域:
  人工智能
项目简介:
  实时语音交互在大模型应用落地中对于提升用户对话体验,提升用户留存(豆包app加入语音对话后留存率提升明显)具有重要作用;在AI硬件领域(AI眼镜、戒指等),实时语音交互是直接的、天然的交互方式,且对语音理解的准确率、语音生成的自然度、对话准确率、交互响应速度都有较高的要求
包括英文材料
学历+
Java+
还有更多 •••
相关职位

logo of alibaba
实习淘天集团研究型实

1. 探索语音大模型,包括语音合成、音色克隆、端到端合成、情感化语音合成等技术,实现细粒度控制的语音合成; 2. 参与全双工多模态交互系统研发; 3. 将以上技术落地到淘天业务,考虑模型性能与效率。

更新于 2025-08-14北京|杭州
logo of amap
实习高德研究型实习生

团队介绍: 高德语音技术部,是负责高德全栈语音技术的综合性团队。团队核心技术能力包括:自研TTS基座大模型、端侧模型、多语种、RTC流式语音、语音内容生成、语音识别、多模态模型、模型服务与推理。业务支撑面向高德全部核心场景,包括语音导航、AI领航员、IP语音定制、国际化、AI语音助手、智能外呼、内容生成等。 团队定位是通过前沿语音技术的研究和落地,赋能下一代AI产品创新。近期部分技术(https://arxiv.org/abs/2507.12197)和产品进展介绍(https://mp.weixin.qq.com/s/cCeHbNW0jbC_LNVPZlGeHg) 具体职责: 1. 协助语音大模型的数据构建,搭建高效高质的语音数据生产Pipeline 和数据标准,优化Pipeline算子,用高质量数据提升技术预研和业务落地的效果; 2. 参与语音大模型的端到端评测,搭建科学敏捷的评测Pipeline和评测标准,用全面真实的评测推动模型效果优化提升; 3. 深度理解对话交互、音视频创作的技术和产品趋势,设计与业务目标贴合的数据与评测方案;与团队协同,积极探索自动化数据生产/模型评估、数据合成等方法,提高数据标注/评测效率;

更新于 2025-12-09北京
logo of antgroup
实习研究型实习生

研究领域: 人工智能 项目简介: 原生多模态大模型中的实时语音交互相对传统的端到端交付在对话延迟、模态融合等带来能力提升,但是语音多模态对话中的情感的识别和表达还没有形成完善方案,同时工具调用等能力也需要单独进行加训、提升。

杭州
logo of tongyi
实习通义研究型实习生

多语言语音交互以其直观便捷的特性,在同声传译、跨国沟通及多语言辅助工具等领域展现出超越文本的自然互动优势。语音的独特价值在于它蕴含情感、语调、环境背景乃至说话者的性别与方言信息,这些额外维度极大丰富了信息内容。OpenAI的GPT4o及Google的Astra等前沿成果,彰显了卓越的多语言语音助手性能,震撼业界。我们拟探索多语言文本语音对齐技术,构建多语言、低延迟、可控的多语言同声传译翻译系统。

更新于 2024-11-14北京|杭州