通义通义实验室-语音识别/语音大模型算法专家-通义百聆
社招全职3年以上技术类-算法地点:北京 | 杭州状态:招聘
任职要求
1. 计算机科学、信号处理、语音处理、人工智能等相关领域硕士及以上学历。 2. 2年以上音频AI研发经验,包括但不限于 音频识别及理解、音频生成、数字人、多模态交互 等方向。 3. 扎实的深度学习基础,熟练掌握PyTorch/TensorFlow等框架。 4. 优秀的编程能力(Pyt…
登录查看完整任职要求
微信扫码,1秒登录
工作职责
1. 主导多模态理解/音频大模型的前沿算法研究及产业落地。 2. 音频理解方向: (1)研发语音识别、语音翻译以及音频分析等理解算法。 (2)开发跨模态(语音/文本/视觉)的音频语义理解系统。 (3)探索音频大模型架构设计。 (4)推动算法成果转化:通过ModelScope开源社区创造研究价值,或通过阿里云产品体系创造商业价值。 (5)持续跟踪国际前沿技术动态(ICASSP/Interspeech/NeurIPS/ICLR等),参与国际会议、研讨会,与全球顶级团队进行交流合作。
包括英文材料
学历+
数字人+
https://www.youtube.com/watch?v=42_lCOayS6s
Taking chatbots to the next level, with emotion recognition and gesture control.
https://www.youtube.com/watch?v=DFHuV7nOgsI&list=PL05umP7R6ij13it8Rptqo7lycHozvzCJn
This lecture covers the history of virtual humans, from early models form the 80s until the more recent ones.
深度学习+
https://d2l.ai/
Interactive deep learning book with code, math, and discussions.
PyTorch+
https://datawhalechina.github.io/thorough-pytorch/
PyTorch是利用深度学习进行数据科学研究的重要工具,在灵活性、可读性和性能上都具备相当的优势,近年来已成为学术界实现深度学习算法最常用的框架。
https://www.youtube.com/watch?v=V_xro1bcAuA
Learn PyTorch for deep learning in this comprehensive course for beginners. PyTorch is a machine learning framework written in Python.
还有更多 •••
相关职位
社招3年以上技术类-算法
1. 主导多模态理解/音频大模型的前沿算法研究及产业落地。 2. 音频理解方向: (1)研发语音识别、语音翻译以及音频分析等理解算法。 (2)开发跨模态(语音/文本/视觉)的音频语义理解系统。 (3)探索音频大模型架构设计。 (4)推动算法成果转化:通过ModelScope开源社区创造研究价值,或通过阿里云产品体系创造商业价值。 (5)持续跟踪国际前沿技术动态(ICASSP/Interspeech/NeurIPS/ICLR等),参与国际会议、研讨会,与全球顶级团队进行交流合作。
更新于 2026-04-02北京|杭州

社招3年以上技术类-算法
1. 主导多模态理解/音频大模型的前沿算法研究及产业落地。 2. 音频理解方向: (1)研发语音识别、语音翻译以及音频分析等理解算法。 (2)开发跨模态(语音/文本/视觉)的音频语义理解系统。 (3)探索音频大模型架构设计。 (4)推动算法成果转化:通过ModelScope开源社区创造研究价值,或通过阿里云产品体系创造商业价值。 (5)持续跟踪国际前沿技术动态(ICASSP/Interspeech/NeurIPS/ICLR等),参与国际会议、研讨会,与全球顶级团队进行交流合作。
更新于 2026-04-02北京|杭州
社招2年以上技术类-算法
1. 负责语音识别和语音对话大模型的算法研发与优化,包括声学模型、LLM模型和解码器等,探索新的算法架构,建设高效率、低时延的语音应用系统。 2. 结合业务需求,持续改进现有模型的性能,确保其在不同应用场景下的准确性和鲁棒性,提升语音助手和语音智能体用户体验。 3. 构建和管理大规模语音识别和语音对话语料库,用于训练、验证和测试模型。 4. 跟踪前沿技术和研究动态,提出新颖的算法思路和解决方案。
更新于 2026-01-19北京|杭州