通义Token Foundry-语音AI产品经理-Qwen Audio
社招全职3年以上产品类-商业型地点:北京 | 杭州状态:招聘
任职要求
1. 经验背景:3年及以上产品经理工作经验,其中至少2年以上语音相关产品经验,有TTS、语音翻译等经验者优先。熟悉语音AI技术的基本原理与产品开发流程,有操盘语音AI产品在2B服务经验的优先。 2. 技术理解能力:具备对语音AI技术的基础认知,能理解算法技术概念,可与算法、工程团队高效沟通技术方案…
登录查看完整任职要求
微信扫码,1秒登录
工作职责
1. 产品规划与路线设计:深度调研不同场景下的语音AI产品需求,结合语音AI技术演进与行业发展趋势,制定语音交互产品(语音输入、语音生成、语音对话、语音同传、歌声音乐生成等)的短中长期路线图,明确核心能力优先级、场景落地顺序及资源投入节奏。 2. 功能设计与优化:主导语音AI产品核心功能的设计与迭代,包括但不限于:语音音色设计、交互体验设计、场景化功能定制,持续提升产品在不同场景下的用户体验。定义和细化语音AI模型的功能和评测体系,包括但不限于:表现力、共情、自然度等。 3. 跨团队协同与项目推进:作为语音AI产品落地的核心协调者,联动算法、工程、业务及测试团队,明确各环节交付标准与时间节点,解决跨部门协作中的技术瓶颈与需求冲突,确保产品在各场景顺利落地。 4. 行业动态与竞品分析:跟踪国内外语音AI技术与产品的发展动态(如新型算法、前沿应用场景、竞品功能与策略等),定期输出分析报告,为产品策略调整提供依据,提升公司语音AI产品的竞争力。
包括英文材料
语音合成+
https://www.ibm.com/think/topics/text-to-speech
Text to speech (TTS) is a type of technology that converts text on a digital interface into natural-sounding audio.
算法+
https://roadmap.sh/datastructures-and-algorithms
Step by step guide to learn Data Structures and Algorithms in 2025
https://www.hellointerview.com/learn/code
A visual guide to the most important patterns and approaches for the coding interview.
https://www.w3schools.com/dsa/
相关职位
社招3年以上技术类-算法
1.参与前沿语音生成大模型的研发,涵盖数据体系设计、模型架构设计、训练优化等。 2.探索语音合成、声学建模、自然语言处理等多模态融合技术,提升模型在语音质量、自然度及逻辑推理能力上的表现。 3.针对实际应用场景(音色克隆、情感控制等)优化模型效果和性能,解决复杂技术难题。
更新于 2026-07-29北京|杭州
社招3年以上技术类-算法
1. 主导多模态理解/音频大模型的前沿算法研究及产业落地。 2. 音频理解方向: (1)研发语音识别、语音翻译以及音频分析等理解算法。 (2)开发跨模态(语音/文本/视觉)的音频语义理解系统。 (3)探索音频大模型架构设计。 (4)推动算法成果转化:通过ModelScope开源社区创造研究价值,或通过阿里云产品体系创造商业价值。 (5)持续跟踪国际前沿技术动态(ICASSP/Interspeech/NeurIPS/ICLR等),参与国际会议、研讨会,与全球顶级团队进行交流合作。
更新于 2026-07-29北京|杭州

社招3年以上技术类-开发
1. 面向ToB行业场景(如AI手机等),设计并构建可扩展、高可用的Agent编排系统,支撑多模态交互系统中复杂任务的自动化执行。 2. 深度整合阿里集团内部丰富的Agent能力,同时对接第三方生态服务,打造统一的行业级Agent应用。 3. 制定标准化的工具描述协议、Agent接入规范与开发者工具链(SDK/CLI/调试平台),降低内外部生态伙伴的接入门槛。 4. 针对移动端等资源受限环境,优化Agent调用链路的性能、延迟与鲁棒性,支持离线、弱网、低功耗等边缘场景下的可靠运行。
更新于 2026-06-15北京|杭州