腾讯腾讯游戏-语音算法资深研究员-新星引力计划
任职要求
1.计算机、人工智能、电子工程等相关专业硕士及以上学历; 2.熟悉至少一种主流语音识别或语音合成框架,具备扎实的语音模型训练与调优实战经验; 3.掌握CNN、RNN、Transformer等深度学习方法,熟练使用PyTorch/TensorFlow框架,精通Python,具备基础C++工程能力; 4.具备至少3种及以上语种…
工作职责
1.负责GVoice游戏语音服务中多语种语音识别模型的定制化设计、训练与迭代优化,精通Conformer、Paraformer等端到端语音识别模型,显著提升不同语种识别准确率; 2.主导语音合成相关技术和算法的研发工作,包括模型训练、优化及项目全流程交付,确保语音合成效果达到行业领先水平; 3.针对多轮对话、全时全双工等跨语言交互场景,设计并优化适配多语种特性的语音处理方案,显著提升跨语言交互体验; 4.深入优化多语种模型在设备端与云端的推理性能,包括模型压缩、量化、流式部署等技术,平衡多语种支持与响应速度、资源利用率; 5.参与多语种语音数据集的构建、扩充与质量优化,搭建多语种专属评测体系,实现从训练到验证再到部署的完整闭环; 6.持续跟踪多语种语音领域前沿技术(如低资源语种建模、跨语种迁移学习等),探索并推动其在实际业务场景中的应用落地。
1、负责语音理解和语音生成算法在滴滴场景的落地使用 2、跟进最新技术,结合业务场景,提升语音识别、音频事件检测、声纹识别、语音合成等算法效果 3、探索语音大模型或多模态大模型在语音理解及语音生成场景的应用范式
1、负责语音理解和语音生成算法在滴滴场景的落地使用; 2、跟进最新技术,结合业务场景,提升语音识别、音频事件检测、声纹识别、语音合成等算法效果; 3、探索语音大模型或多模态大模型在语音理解及语音生成场景的应用范式。

第四范式是中国智能决策市场的最大参与者。公司致力于实现企业级人工智能快速规模化落地,为企业提供以“决策型AI”、“生成式AI”为核心的技术、产品及解决方案,推动传统企业的数字化转型进程。2023年2月发布自研的多模态大模型产品“式说(4Paradigm SageGPT)”,已积累了数家国内最早的AIGC产业应用。目前已上市,有机会争取股票激励。•负责语音方向的设计和研发,模型的效果优化,包括不限于:参与语音识别、语音合成、声纹识别、语音评测等方向•将语音领域的算法应用于实际场景,解决真实业务问题•将实践中的创新点以Github Repo/Paper/Tech Report等形式开源
1、探索并构建语音理解与生成统一的大模型架构(Speech Unified Modal),实现从语音到语音(S2S)、文本到语音(T2S)、语音到文本(S2T)的端到端流式交互能力,对标 GPT-4o 音频模式等前沿技术; 2、负责语音离散化(Audio Tokenizer/Neural Codec)算法的改进与优化,提升语音 Token 在语义理解与声学细节(语调、情感、音色)上的表征能力,降低压缩损耗; 3、参与语音大模型的预训练(Pre-training)、指令微调(SFT)及人类反馈强化学习(RLHF)流程;解决长序列建模、跨模态对齐及推理延迟等技术难题; 4、设计并实施大规模多模态数据(语音-文本交错数据)的清洗、合成与增强方案,构建高质量的语音指令数据集(Instruction Tuning Data); 5、追踪并复现语音与多模态领域的最新顶会论文(如 ICASSP, Interspeech, ICLR, CVPR 等),将最新的自回归(Autoregressive)或流匹配(Flow Matching)技术应用于内部模型创新。