
智能互联智能互联-端侧语音交互算法专家-杭州
任职要求
1.数学、计算机、声学及其相关专业,具备扎实的数学功底和编程能力,熟悉常用的端侧语音相关算法,有端侧唤醒、识别等项目的落地经验;
2.具有一定的计算机架构基础,熟悉常见…工作职责
1.负责端侧语音算法(本地唤醒和识别等)的算法研发、工程化验证,以及性能优化; 2.负责端侧语音交互模型(双工、端侧大模型等)的算法研发、工程化验证,以及性能优化。

1.负责端侧语音算法(本地唤醒和识别等)的算法研发、工程化验证,以及性能优化; 2.负责端侧语音交互模型(双工、端侧大模型等)的算法研发、工程化验证,以及性能优化。
1、负责端侧语音交互模型(语音+语义双工)算法研发、协同工程团队落地和性能优化。 2、负责AI产品的语音识别、语音合成算法的应用和落地,提升识别准确率语与语音合成流畅度,及根据业务场景调优音色和综合的用户体验。 3、跟踪前沿语音AI技术和大语言模型在语音领域的结合应用,跟踪业界端到端的语音大模型能力,评估适配方案并推动技术落地。 4、与产品、后端研发团队协作,推动语音AI技术的快速迭代和业务落地。
1. 负责面向AI手机、智能座舱等ToB场景的多模态交互模型研发,包括语音基础模型、视觉-语言模型(VLM)、全模态大模型的后训练(CPT/SFT/RL)与推理优化。 2. 研发基于神经网络、扩散模型或大模型的端侧音频信号处理算法(如语音增强、降噪、去混响),提升复杂声学环境下的语音交互质量。 3. 构建支持自然打断、精准判停、上下文感知的实时双工交互模型,实现低延迟、高鲁棒性的流式对话体验。 4. 针对端侧资源约束,开展模型压缩、量化、蒸馏及高效部署,确保算法在DSP/NPU等嵌入式平台稳定运行。 5. 与系统、产品团队紧密协作,推动算法从原型验证到大规模商用落地。
语音是人机交互中最自然、最便捷的模态。随着大模型时代的到来,语音AI的研究正从单一任务向多模态、高自然度交互演进。在阿里巴巴,我们的语音技术已深度植入流媒体、直播互动、智能客服、办公会议、AIoT及数字人等多元场景。我们正在寻找志同道合的伙伴,共同探索语音技术在复杂场景下的极限。在这里,你不仅能触达海量的真实数据,更能亲手打造影响亿万用户的交互体验。一段更具挑战、更有成就感的旅程正待开启! 岗位职责: 1. 核心算法研发: 负责语音信号处理领域的前沿算法研究与落地,包括但不限于语音识别(ASR)、语音合成(TTS)、说话人识别与分离(Speaker Verification/Diarization)、语音增强及端到端语音交互方案; 2. 专项技术突破: ● 声纹与属性识别: 负责声纹识别、语种识别以及情绪识别(Emotion Recognition)的算法优化,提升在真实业务场景下的识别精度与跨域泛化能力; ● 音频内容理解: 基于语义与声学特征,深度挖掘语音中的情感、意图及环境信息,赋能直播审核、内容分析等业务; ● AI-VAD: 研发基于深度学习的高鲁棒性语音活动检测(VAD)算法,解决强噪声、多语者叠加、远场等复杂环境下的起停点检测痛点; 3. 模型工程化落地: 推动算法在云端或端侧的部署优化,在保障性能(精度/鲁棒性)的同时,平衡算力消耗与推理延迟; 4. 技术预研: 跟踪并探索语音领域前沿技术(如大语言模型与语音的结合、Speech-to-Speech原生端到端交互等)。