通义Token Foundry-语音合成与音频生成大模型算法专家-Qwen Audio
任职要求
1.计算机科学、人工智能、电子工程、应用数学等相关专业硕士及以上学历。 2.具备扎实的机器学习、深度学习理论基础,精通语音生成相关技术。 3.熟练至少一种大模型训练框架(Deepspeed, Megatron),有大模型训练经验。 4.…
工作职责
1.参与前沿语音生成大模型的研发,涵盖数据体系设计、模型架构设计、训练优化等。 2.探索语音合成、声学建模、自然语言处理等多模态融合技术,提升模型在语音质量、自然度及逻辑推理能力上的表现。 3.针对实际应用场景(音色克隆、情感控制等)优化模型效果和性能,解决复杂技术难题。
1. 产品规划与路线设计:深度调研不同场景下的语音AI产品需求,结合语音AI技术演进与行业发展趋势,制定语音交互产品(语音输入、语音生成、语音对话、语音同传、歌声音乐生成等)的短中长期路线图,明确核心能力优先级、场景落地顺序及资源投入节奏。 2. 功能设计与优化:主导语音AI产品核心功能的设计与迭代,包括但不限于:语音音色设计、交互体验设计、场景化功能定制,持续提升产品在不同场景下的用户体验。定义和细化语音AI模型的功能和评测体系,包括但不限于:表现力、共情、自然度等。 3. 跨团队协同与项目推进:作为语音AI产品落地的核心协调者,联动算法、工程、业务及测试团队,明确各环节交付标准与时间节点,解决跨部门协作中的技术瓶颈与需求冲突,确保产品在各场景顺利落地。 4. 行业动态与竞品分析:跟踪国内外语音AI技术与产品的发展动态(如新型算法、前沿应用场景、竞品功能与策略等),定期输出分析报告,为产品策略调整提供依据,提升公司语音AI产品的竞争力。
1. 主导多模态理解/音频大模型的前沿算法研究及产业落地。 2. 音频理解方向: (1)研发语音识别、语音翻译以及音频分析等理解算法。 (2)开发跨模态(语音/文本/视觉)的音频语义理解系统。 (3)探索音频大模型架构设计。 (4)推动算法成果转化:通过ModelScope开源社区创造研究价值,或通过阿里云产品体系创造商业价值。 (5)持续跟踪国际前沿技术动态(ICASSP/Interspeech/NeurIPS/ICLR等),参与国际会议、研讨会,与全球顶级团队进行交流合作。

1. 面向ToB行业场景(如AI手机等),设计并构建可扩展、高可用的Agent编排系统,支撑多模态交互系统中复杂任务的自动化执行。 2. 深度整合阿里集团内部丰富的Agent能力,同时对接第三方生态服务,打造统一的行业级Agent应用。 3. 制定标准化的工具描述协议、Agent接入规范与开发者工具链(SDK/CLI/调试平台),降低内外部生态伙伴的接入门槛。 4. 针对移动端等资源受限环境,优化Agent调用链路的性能、延迟与鲁棒性,支持离线、弱网、低功耗等边缘场景下的可靠运行。