logo of pingantech

平安科技算法工程师(语音合成方向)

社招全职计算机网络技术类地点:深圳状态:招聘

任职要求


1. 计算机、人工智能、信号处理、语音工程或相关专业硕士及以上学历。  
2. 熟悉主流TTS模型架构,掌握PyTorch框架,具备模型训练与调优经验。  
3. 熟悉语音信号处理基础(如梅尔频谱、STFT、声码器等)。  
4. 具备…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


1. 负责语音合成(Text-to-Speech, TTS)模型训练与线上优化。
2. 深入研究并应用深度学习技术,提升合成语音的自然度、表现力和稳定性,支持多音色、多语种、情感语音等高级功能。
3. 参与语音前端处理模块开发,包括文本归一化、分词、音素预测、韵律预测等任务。
4. 与语音识别、语音增强、产品等团队协作,推动TTS技术在实际场景中的落地(如智能助手、有声阅读、导航播报等)。
5. 跟踪学术界和工业界最新进展,持续优化模型性能,降低推理延迟,提升合成效率。
6. 编写高质量的技术文档,参与模型版本管理和工程化部署(如ONNX、TensorRT、Triton等)。
包括英文材料
学历+
语音合成+
还有更多 •••
相关职位

logo of jd
实习数据与算法类

1. 负责京东语音识别/合成方向的算法研究和开发工作; 2. 负责将前沿语音算法落地到京东业务场景并取得应用效果。

更新于 2024-03-01北京
logo of xiaohongshu
社招后端开发

【职位描述】 1、设计和实现机器学习平台业务系统, 包括工具链/组件等AI基础设施, 落地业务功能需求; 2、高效优化和部署 计算机视觉、语音识别、语音合成、自然语言处理 等业务模型; 3、与公司各算法部门深度合作, 分析业务性能瓶颈和系统架构特征, 软硬件结合优化, 实现极致性能。

北京|上海
logo of bytedance
社招1年以上A247041

团队介绍:字节跳动豆包大模型团队成立于 2023 年,致力于开发业界最先进的 AI 大模型技术,成为世界一流的研究团队,为科技和社会发展作出贡献。 豆包大模型团队在AI领域拥有长期愿景与决心,研究方向涵盖NLP、CV、语音等,在中国、新加坡、美国等地设有实验室和研究岗位。团队依托平台充足的数据、计算等资源,在相关领域持续投入,已推出自研通用大模型,提供多模态能力,下游支持豆包、扣子、即梦等50+业务,并通过火山引擎开放给企业客户。目前,豆包APP已成为中国市场用户量最大的AIGC应用。 1、团队负责公司大模型的研发和应用,研究相关技术在搜索、推荐、广告、创作、对话和客服等领域的全新应用和解决方案,满足用户不断增长的智能交互需求,全面提升用户在未来世界的生活和交流方式;主要工作方向包括: 1)优化&创新RLHF算法训练效率与模型泛化能力; 2)Long CoT技术的实现和应用; 3)多模态大模型(文本、图像、语音)的Posttraining算法; 4)构建高质量、多领域的数据合成方法; 5)探索LLM在情感对话、创作等场景的应用。

更新于 2025-02-18上海
logo of xiaohongshu
社招大模型

在算力驱动的 AGI 和人文精神的烟火气交汇之处,我们真诚邀请对大模型 Omni Model 有热情的同学加入,共同打造更具影响力的智能系统。你会成为团队的一员,并和其他同事协作,共同研发 SOTA 的 Omni Model。期待你以务实和客观的科学态度来推进技术的进展,不被过往经验裹挟、不被主观偏好影响。期待你除了算法外仍然是为出色的工程师。期待你对技术有强烈的好奇心和开放心态。 区别于传统 ASR / TTS 级联技术,我们希望打造端到端的 Omni Model 在实时交互中释放大模型的智力水平,彻底改变以 Chatbot 文字为主的人机交互界面 岗位说明:你会负责围绕大模型 Omni Model 构建语音模态的相关研究工作,包括但不限于如下事项 海量的语音数据处理和构建:定性分析、定量评估数据质量,并给出 scalable 的改进方案;探索跨模态(文字/视觉/语音)混合训练的最佳实践; 探索更加高效且合理的模型架构,让模型更加理解音频,同时让模型具备更好的语音合成能力 研究并探索基于 Omni Model 的 Post Train,包含但不限于 SFT 和 RL

北京|上海