阿里巴巴业务技术-语音算法专家-直播
任职要求
1.计算机、人工智能、信号处理等相关专业硕士或博士学历;在语音合成、语音识别或对话系统领域有扎实的技术沉淀; 2.熟悉 全双工交互关键技术,包括高性能 VAD 算法…
工作职责
1.高表现力语音合成系统开发: 负责淘宝直播数字人的TTS系统研发,重点突破多情感、高表现力、极具电商直播感染力的语音建模,实现语速、重音、情感的动态可控; 2. 全双工交互系统构建: 设计并实现数字人全双工语音交互架构,包括语音活动检测、打断唤醒、交互逻辑控制等,提升数字人在直播场景下的即时互动感; 3. 端到端交互大模型研发: 参与并研究应用端到端语音大模型,探索流式语音输入与输出的深度融合,解决传统级联模型的语义割裂与延迟问题; 4. 极致性能优化: 针对直播实时性要求,优化语音全链路延迟,从模型压缩、推理加速到流式处理,保障低延时体验; 5. 场景化落地: 与产品和工程团队紧密配合,将全双工交互技术应用于直播间智能导购、等业务场景,提升用户留存与转化;
面向淘宝直播数字人场景,研究探索语音大模型等前沿技术,提升技术影响力: 1. 负责语音大模型等前沿算法研究,包括语音对话系统、语音理解与生成、语音强化学习等方向,参与架构设计、训练调优及迭代工作; 2. 负责端到端语音交互模型的前沿探索,优化数字人全双工语音交互架构,包括智能打断、上下文感知、情感交互理解、流式输入输出等,解决级联模型等语义割裂与延迟问题; 3. 负责高表现力语音合成算法探索,参与数字人TTS系统研发,包括多情感、高表现力的电商直播感染力语音建模,实现语音、重音、情感的动态可控; 4. 参与团队合作,与团队一起解决技术难题,推动技术落地,产出高质量学术论文和专利。
1. 负责3A核心算法的研发与迭代,包括回声消除(aec)、自动噪声抑制(ans)、自动增益控制(agc),确保算法在复杂声学环境下的鲁棒性,保障全双工通话的高保真音质与交互体验。 2. 推动3A算法的轻量化部署与端侧适配,结合深度学习与传统信号处理技术,平衡算法性能与资源消耗,支撑智能体语音交互技术基座建设。 3. 针对人机语音交互、智能体对话等前沿场景,优化VAD判停和语义完整性检查,实现“快速打断,智能判停,实时响应”的自然对话能力; 4. 研发语音识别(ASR)、语音合成(TTS)技术,并探索交互式语音模型在智能体对话中的应用,搭建可控双流模型的数据,训练和评估体系,优化对话模型的边说边听和情感识别能力; 5. 与产品、工程团队紧密合作,将算法模型落地到实际应用中,并持续优化系统性能。 6. 跟踪学术界和工业界的最新进展,探索前沿技术在对话系统中的应用。
1. 负责天猫技术在各域的Agent算法优化,包括ToB和ToP相关产品,如AI商品运营、百补AI导购、品牌商家AI访谈; 2. 主导大模型后训练与领域适配,参与Agent在各业务场景下的微调于多轮对话优化,提升模型在生意诊断、运营策略、导购方案生成、工具决策等任务中的专业性与一致性。 3. 运用SFT、RL等后训练方法,设计合理Reward Function和优化函数,提升大模型在自主规划(Planning)、多步推理、工具调用、数据问答等方面的能力; 4. 负责设计并优化检索增强(RAG)系统,从索引构建、召回排序到知识融合与上下文压缩,全面提升RAG在高准确性需求场景下的效果与稳定性。 5. 深入跟踪LLM/Agent领域前沿进展,推进前沿技术在业务中的验证与落地,重点突破工具集成复杂推理、数据洞察、AI 搜索等方向的应用创新; 6. 负责建立科学评测体系,设计覆盖功能性、合规性、一致性与业务转化的多维评估指标,系统分析模型表现,指导模型与Agent策略的精准优化。
围绕真实电商核心场景,参与AI应用的系统化构建与优化,把AI变为业务增长引擎,具体工作包括: 1)AI应用全生命周期演进:深度参与业务问题建模、应用架构设计、上下文工程、训练数据构建、自动化评估体系、模型后训练优化等 2)数据飞轮构建:打造高质量数据生产链路,探索合成数据(Synthetic Data)与高效蒸馏技术方案,跑通“业务-模型-反馈”迭代闭环 3)评测体系构建:面向业务目标,设计完备的AI应用效果评估体系,构建自动化评估框架,建立离线评估与在线业务指标联动的量化评估能力 4)强化学习与奖励机制设计:构建可工程化的Reward体系与RL训练环境,提升模型在垂直业务场景中的可控性与泛化能力 5)AI外部能力体系搭建:实现AI应用所需的知识库(RAG)、长短期记忆系统(Memory)、工具调用、多Agent协作框架等 6)多模态AI应用开发:构建AI应用的多模态感知与推理能力,解决在UI自动化、视觉理解与审核、多模态会话等场景的落地应用问题