通义通义实验室-语音处理算法专家-通义百聆
任职要求
1. 硕士及以上学历,电子、通信和计算机相关专业。 2. 三年以上语音算法开发经验,精通基于深度神经网络的语音算法,熟悉麦克风阵列处理、自适应滤波等算法原理,深入参与过语音交互类全链路产品建设,熟悉 ASR/TTS/LLM 等语音 AI 相关技术原理。掌握 AI 产品开发的开源工具和框架(如TensorFlow、PyTorch…
工作职责
1. 负责通义实验室语音团队的语音处理算法研发,通过深入理解全链路技术挑战和推动语音前后端协作,不限于语音增强、回声消除、麦克风阵列(波束形成、声源定位等)、语音唤醒、多模检测、轻量化ASR/TTS/LLM等任务,打造行业领先的语音处理算法。 2. 持续关注行业前沿动态,通过专利申请、论文和技术报告等形式提升团队的技术影响力。
1. 负责通义实验室语音团队的语音处理算法研发,通过深入理解全链路技术挑战和推动语音前后端协作,不限于语音增强、回声消除、麦克风阵列(波束形成、声源定位等)、语音唤醒、多模检测、轻量化ASR/TTS/LLM等任务,打造行业领先的语音处理算法。 2. 持续关注行业前沿动态,通过专利申请、论文和技术报告等形式提升团队的技术影响力。

1. 负责通义实验室语音团队的语音处理算法研发,通过深入理解全链路技术挑战和推动语音前后端协作,不限于语音增强、回声消除、麦克风阵列(波束形成、声源定位等)、语音唤醒、多模检测、轻量化ASR/TTS/LLM等任务,打造行业领先的语音处理算法。 2. 持续关注行业前沿动态,通过专利申请、论文和技术报告等形式提升团队的技术影响力。
1、探索并构建面向语音交互场景的端到端对话大模型,实现多轮语音对话的语义理解、上下文管理与智能回复生成,打造流畅自然的人机对话体验,对标 GPT-4o、Gemini Live 等前沿产品; 2、负责语音、文本、图像等多模态信息的联合建模与跨模态对齐研究,基于 LLM/VLM 骨干网络(如 Qwen、GLM、seed 等)构建统一的多模态对话理解框架,提升模型在视听融合场景下的推理与交互能力; 3、参与对话大模型的预训练(Pre-training)、有监督微调(SFT)及基于人类反馈的强化学习(RLHF/RLAIF)全流程;重点攻克多轮对话上下文建模、语音-文本跨模态对齐、低延迟流式推理等核心技术难题; 4、设计并实施大规模语音对话数据的采集、清洗、合成与质量评估方案;构建高质量的多轮对话指令数据集(Instruction Tuning Data),包括语音问答、情感对话、多模态指令跟随等多类型数据; 5、持续追踪 ACL、EMNLP、NAACL、Interspeech、ICLR、NeurIPS 等顶会最新进展,快速复现并将 Chain-of-Thought、RAG、Agent、语音语言模型等前沿技术迁移至内部产品场景,推动模型能力持续迭代。