logo of 10jqka

同花顺语音算法研究员(博士专项)

校招全职ai 算法类地点:杭州状态:招聘

任职要求


任职要求
1.计算机、语音信号处理、人工智能、电子信息、自动化等相关专业,博士优先。
2.熟悉 ASRTTS、Speaker Diarization、VAD、语音增强、语音编码、端到端语音模型等至少一个方向。
3.熟悉 Kaldi、ESPnet、WeNet、FunASR、Whisper、Paraformer、Conformer、FastSpeech、VITS、CosyVoice 等相关模型或框架。
…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


岗位方向
面向金融资讯、投研音频、会议纪要、智能客服、智能外呼、语音助手、实时语音问答等场景,建设语音识别、语音合成、语音理解和低延迟语音 Agent 能力。
岗位职责
1.负责 ASR、TTS、语音理解、说话人识别、语音增强、端点检测、实时转写等算法研发。
2.构建金融场景下的语音识别与理解能力,支持路演、会议、电话、直播、音频资讯等内容的转写、摘要、问答和结构化提取。
3.负责语音合成和播报能力建设,提升自然度、稳定性、情感表达、金融术语准确率和多音字处理能力。
4.探索低延迟实时语音交互、语音到语音模型、Voice Agent、实时翻译、实时问答等方向。
5.优化语音算法在复杂环境中的鲁棒性,包括噪声、口音、多人对话、金融专有名词、长音频切分等问题。
6.与大模型、Agent、多模态团队协作,构建语音入口的金融 AI 助手。
包括英文材料
语音识别+
语音合成+
深度学习+
PyTorch+
还有更多 •••
相关职位

logo of mihoyo
社招程序&技术类

1. 结合深度学习技术,开展高表现力语音合成的算法研究与技术创新; 2. 设计、优化并落地先进的语音生成模型,提升语音的自然度、表现力与可控性; 3. 跟踪学术与工业界前沿进展,将新技术应用于实际产品或项目中。

上海|北京
logo of tencent
社招GVoice游戏

1.负责GVoice游戏语音服务中多语种语音识别模型的定制化设计、训练与迭代优化,精通Conformer、Paraformer等端到端语音识别模型,显著提升不同语种识别准确率; 2.主导语音合成相关技术和算法的研发工作,包括模型训练、优化及项目全流程交付,确保语音合成效果达到行业领先水平; 3.针对多轮对话、全时全双工等跨语言交互场景,设计并优化适配多语种特性的语音处理方案,显著提升跨语言交互体验; 4.深入优化多语种模型在设备端与云端的推理性能,包括模型压缩、量化、流式部署等技术,平衡多语种支持与响应速度、资源利用率; 5.参与多语种语音数据集的构建、扩充与质量优化,搭建多语种专属评测体系,实现从训练到验证再到部署的完整闭环; 6.持续跟踪多语种语音领域前沿技术(如低资源语种建模、跨语种迁移学习等),探索并推动其在实际业务场景中的应用落地。

更新于 2026-06-10上海
logo of tencent
社招3年以上元宝技术

1.本职位承接元宝2c和2b场景各类实时和离线语音内容理解工作。进一步提升内容识别和理解质量,包括但不限于结合降噪的语音识别,富语言信息识别,多语种内容识别等; 2.从长度和内容的丰富度上,研发超长音频,超长上下文,多说话人,多语种,多方言,多轮,连续语流场景下,全面理解音视频内容的大模型方案; 3.从可利用的信息上,充分利用各类多模态输入信息,提升元宝各类产品语音理解内容理解的质量和效率; 4.研发和工程优化模型小型化,边缘计算,完赛模型的PaaS能力,赋能司内各类元宝生态下的音频理解基础能力。

更新于 2025-12-17上海
logo of tencent
社招1年以上内容AIGC服务

1.负责游戏领域语音合成算法研发与落地,包括不限于情绪表达控制编辑和多样化语音合成; 2.推动语音合成技术在游戏场景中的应用,实现自然且富有情绪的语音输出,为游戏端内外提供更智能化的能力; 3.研究和探索情感建模、多说话人风格迁移、情感迁移等前沿技术,储备并应用新技术能力; 4.追踪业界前沿的语音合成及相关技术,并探索应用落地。

更新于 2026-01-26深圳