千问语音交互算法实习生
任职要求
1.数学、计算机、声学及其相关专业,具备扎实的数学功底和编程能力,熟悉常用的语音交互相关算法;
2.拥有音频…工作职责
1.负责端侧语音交互算法的算法研发和新技术跟踪; 2.负责用户自定义唤醒词、双工交互、端侧大模型等的算法研发和关键技术研究
面向淘宝直播数字人场景,研究探索语音大模型等前沿技术,提升技术影响力: 1. 负责语音大模型等前沿算法研究,包括语音对话系统、语音理解与生成、语音强化学习等方向,参与架构设计、训练调优及迭代工作; 2. 负责端到端语音交互模型的前沿探索,优化数字人全双工语音交互架构,包括智能打断、上下文感知、情感交互理解、流式输入输出等,解决级联模型等语义割裂与延迟问题; 3. 负责高表现力语音合成算法探索,参与数字人TTS系统研发,包括多情感、高表现力的电商直播感染力语音建模,实现语音、重音、情感的动态可控; 4. 参与团队合作,与团队一起解决技术难题,推动技术落地,产出高质量学术论文和专利。
1、探索并构建面向语音交互场景的端到端对话大模型,实现多轮语音对话的语义理解、上下文管理与智能回复生成,打造流畅自然的人机对话体验,对标 GPT-4o、Gemini Live 等前沿产品; 2、负责语音、文本、图像等多模态信息的联合建模与跨模态对齐研究,基于 LLM/VLM 骨干网络(如 Qwen、GLM、seed 等)构建统一的多模态对话理解框架,提升模型在视听融合场景下的推理与交互能力; 3、参与对话大模型的预训练(Pre-training)、有监督微调(SFT)及基于人类反馈的强化学习(RLHF/RLAIF)全流程;重点攻克多轮对话上下文建模、语音-文本跨模态对齐、低延迟流式推理等核心技术难题; 4、设计并实施大规模语音对话数据的采集、清洗、合成与质量评估方案;构建高质量的多轮对话指令数据集(Instruction Tuning Data),包括语音问答、情感对话、多模态指令跟随等多类型数据; 5、持续追踪 ACL、EMNLP、NAACL、Interspeech、ICLR、NeurIPS 等顶会最新进展,快速复现并将 Chain-of-Thought、RAG、Agent、语音语言模型等前沿技术迁移至内部产品场景,推动模型能力持续迭代。
1. 深度参与雷火各旗舰游戏,实时语音交互、语音内容生产、语音创新玩法等场景研发和落地,为玩家创造崭新的互动娱乐体验; 2. 跟踪语音前沿技术,将最新的语音生成大模型、端到端语音大模型等先进技术落地至业务中; 3. 参与语音算法方案的整个生命周期,包括方案设计、算法实现、数据工程、线上服务等全流程。
