logo of tongyi

通义Token Foundry-语音多模态大模型算法工程师-Qwen Audio

社招全职3年以上技术类-算法地点:北京 | 杭州状态:招聘

任职要求


1. 硕士及以上学历,计算机、人工智能等相关专业,3年以上语音大模型/多模态/跨模态相关的算法经验。
2. 深入掌握深度学习强化学习、表示学习等建模方法,在多模态建模和跨模态对齐等方面有深入研究。
3. 在国际顶级计算机会议/期刊(如NeurIPS、ICLR、ICML、CVPR、ECCV、InterSpeech、ACL等)以一作身份发表过多篇论文;或在开源社区、竞赛中展示出引领性的研究成果。
4. 良好的工程与实验思维:熟…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


1. 语音多模态大模型算法创新:面向下一代语音多模态通用大模型,探索并定义统一的技术范式,开展文本、语音等多模态的联合建模与协同推理研究,系统性解决多模态对齐、跨模态推理、Agentic 能力等核心挑战,持续推动模型能力与泛化上限。
2. 场景驱动的算法创新:紧密结合真实业务场景(如智能交互、内容生成、跨模态检索等),设计并优化多模态大模型架构与训练策略,在保证效果领先的同时,持续提升模型效率、稳定性与鲁棒性,推动技术在复杂场景中的规模化落地。
3. 前沿应用技术探索:跟踪并深度参与 LLM、多模态模型、Diffusion Models、强化学习等方向的前沿研究,快速完成技术验证与实验迭代,探索新建模范式与训练范式,持续刷新相关任务的 SOTA。"
包括英文材料
学历+
大模型+
算法+
深度学习+
强化学习+
NeurIPS+
还有更多 •••
相关职位

logo of tongyi
社招3年以上技术类-算法

1.参与前沿语音生成大模型的研发,涵盖数据体系设计、模型架构设计、训练优化等。 2.探索语音合成、声学建模、自然语言处理等多模态融合技术,提升模型在语音质量、自然度及逻辑推理能力上的表现。 3.针对实际应用场景(音色克隆、情感控制等)优化模型效果和性能,解决复杂技术难题。

更新于 2026-07-29北京|杭州
logo of tongyi
社招3年以上产品类-商业型

1. 产品规划与路线设计:深度调研不同场景下的语音AI产品需求,结合语音AI技术演进与行业发展趋势,制定语音交互产品(语音输入、语音生成、语音对话、语音同传、歌声音乐生成等)的短中长期路线图,明确核心能力优先级、场景落地顺序及资源投入节奏。 2. 功能设计与优化:主导语音AI产品核心功能的设计与迭代,包括但不限于:语音音色设计、交互体验设计、场景化功能定制,持续提升产品在不同场景下的用户体验。定义和细化语音AI模型的功能和评测体系,包括但不限于:表现力、共情、自然度等。 3. 跨团队协同与项目推进:作为语音AI产品落地的核心协调者,联动算法、工程、业务及测试团队,明确各环节交付标准与时间节点,解决跨部门协作中的技术瓶颈与需求冲突,确保产品在各场景顺利落地。 4. 行业动态与竞品分析:跟踪国内外语音AI技术与产品的发展动态(如新型算法、前沿应用场景、竞品功能与策略等),定期输出分析报告,为产品策略调整提供依据,提升公司语音AI产品的竞争力。

更新于 2026-07-29北京|杭州
logo of tongyi
社招3年以上技术类-算法

1. 主导多模态理解/音频大模型的前沿算法研究及产业落地。 2. 音频理解方向: (1)研发语音识别、语音翻译以及音频分析等理解算法。 (2)开发跨模态(语音/文本/视觉)的音频语义理解系统。 (3)探索音频大模型架构设计。 (4)推动算法成果转化:通过ModelScope开源社区创造研究价值,或通过阿里云产品体系创造商业价值。 (5)持续跟踪国际前沿技术动态(ICASSP/Interspeech/NeurIPS/ICLR等),参与国际会议、研讨会,与全球顶级团队进行交流合作。

更新于 2026-07-29北京|杭州
logo of aligenie
社招3年以上技术类-开发

1. 面向ToB行业场景(如AI手机等),设计并构建可扩展、高可用的Agent编排系统,支撑多模态交互系统中复杂任务的自动化执行。 2. 深度整合阿里集团内部丰富的Agent能力,同时对接第三方生态服务,打造统一的行业级Agent应用。 3. 制定标准化的工具描述协议、Agent接入规范与开发者工具链(SDK/CLI/调试平台),降低内外部生态伙伴的接入门槛。 4. 针对移动端等资源受限环境,优化Agent调用链路的性能、延迟与鲁棒性,支持离线、弱网、低功耗等边缘场景下的可靠运行。

更新于 2026-06-15北京|杭州