通义通义实验室-语音多模态大模型算法工程师-通义百聆
社招全职3年以上技术类-算法地点:北京 | 杭州状态:招聘
任职要求
1. 硕士及以上学历,计算机、人工智能等相关专业,3年以上语音大模型/多模态/跨模态相关的算法经验。 2. 深入掌握深度学习、强化学习、表示学习等建模方法,在多模态建模和跨模态对齐等方面有深入研究。 3. 在国际顶级计算机会议/期刊(如NeurIPS、ICLR、ICML、CVPR、ECCV、InterSpeech、ACL等)以一作身份发表过多篇论文;或在开源社区、竞赛中展示出引领性的研究成果。 4. 良好的工程与实验思维:熟…
登录查看完整任职要求
微信扫码,1秒登录
工作职责
1. 语音多模态大模型算法创新:面向下一代语音多模态通用大模型,探索并定义统一的技术范式,开展文本、语音等多模态的联合建模与协同推理研究,系统性解决多模态对齐、跨模态推理、Agentic 能力等核心挑战,持续推动模型能力与泛化上限。 2. 场景驱动的算法创新:紧密结合真实业务场景(如智能交互、内容生成、跨模态检索等),设计并优化多模态大模型架构与训练策略,在保证效果领先的同时,持续提升模型效率、稳定性与鲁棒性,推动技术在复杂场景中的规模化落地。 3. 前沿应用技术探索:跟踪并深度参与 LLM、多模态模型、Diffusion Models、强化学习等方向的前沿研究,快速完成技术验证与实验迭代,探索新建模范式与训练范式,持续刷新相关任务的 SOTA。"
包括英文材料
学历+
大模型+
https://www.youtube.com/watch?v=xZDB1naRUlk
You will build projects with LLMs that will enable you to create dynamic interfaces, interact with vast amounts of text data, and even empower LLMs with the capability to browse the internet for research papers.
https://www.youtube.com/watch?v=zjkBMFhNj_g
算法+
https://roadmap.sh/datastructures-and-algorithms
Step by step guide to learn Data Structures and Algorithms in 2025
https://www.hellointerview.com/learn/code
A visual guide to the most important patterns and approaches for the coding interview.
https://www.w3schools.com/dsa/
深度学习+
https://d2l.ai/
Interactive deep learning book with code, math, and discussions.
强化学习+
https://cloud.google.com/discover/what-is-reinforcement-learning?hl=en
Reinforcement learning (RL) is a type of machine learning where an "agent" learns optimal behavior through interaction with its environment.
https://huggingface.co/learn/deep-rl-course/unit0/introduction
This course will teach you about Deep Reinforcement Learning from beginner to expert. It’s completely free and open-source!
https://www.kaggle.com/learn/intro-to-game-ai-and-reinforcement-learning
Build your own video game bots, using classic and cutting-edge algorithms.
NeurIPS+
https://neurips.cc/
还有更多 •••
相关职位
社招A31384
1、负责语音多模态模型算法方案研发、迭代和落地应用 2、负责大规模、多模态数据集的构建、清洗、标注和管理 3、持续跟踪国际前沿的语音、多模态及大模型技术动态
更新于 2025-11-25北京
实习阿里巴巴2027
1. 负责语音生成/语音识别/语音合成/声纹/语种/情感等方向的算法研究和开发; 2. 负责语音信号处理的相关算法研究和开发,包括语音增强、回声消除、混响消除、自动增益控制、波达方向估计、波束形成等; 3. 负责口语语言理解/用户意图理解/对话模型/语音交互等算法研究和开发; 4. 语音统一多模态大模型:研究下一代多模态通用大模型技术范式,实现文本、语音、视觉模态的联合建模。
更新于 2026-03-22北京|杭州|上海
实习
1、负责语音大模型、多模态大模型算法研发与迭代,涵盖语音理解、语音生成、语音对齐、音频文本多模态融合等核心技术研发工作; 2、参与语音大模型预训练、微调、Prompt优化与模型对齐实验,针对语音降噪、语音合成、口语理解、多模态交互等场景优化模型效果; 3、调研跟进语音大模型、多模态融合领域前沿论文与业界方案,完成算法复现、实验对比、方案迭代,解决语音模型泛化差、推理精度不足等场景问题; 4、负责语音数据集清洗、构建、标注优化,完成模型训练、评测、复盘,输出实验文档与技术报告,协助推进多模态语音模型业务落地。
更新于 2026-04-27北京