logo of xiaohongshu

小红书语音大模型算法研究员

社招全职3-5年多媒体算法地点:北京 | 上海状态:招聘

任职要求


1.AI、EE、CS相关专业; 
2.在语音识别/理解、语音合成/编辑等泛语音方向均有一定经验; 
3.对工业级大规模数据有实际处理经验,有使用海量数据优化实际业务模型的动手经验; 
4.良好的团队沟通…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


1.自研语音大模型算法在小红书丰富业务场景的落地,并持续优化语音大模型预训练、后训练效果,保持业内SOTA水平。 
2.跟进最领先的大模型语音技术,包括但不限于提出新的语音大模型算法框架、改进现有的算法、持续提升相关技术及业务指标,鼓励撰写论文及申请专利。
包括英文材料
语音识别+
语音合成+
相关职位

logo of meituan
社招1年以上核心本地商业-基

你将做什么: 1. 语音识别、声纹技术研发; 2. 优化在线语音识别服务,提升语音识别在客服、出行、美团App 等具体业务中的识别准确率; 3. 语音大模型、多模态等前沿技术探索。

更新于 2026-05-28北京|上海
logo of tencent
社招3年以上微信输入法技术

1.负责研发具有多任务能力的语音合成(TTS)大模型; 2.负责TTS大模型的预训练及后训练相关的数据和算法工作; 3.推动TTS大模型在产品中应用落地(如朗读/对话/配音等场景),及针对这些场景进行模型优化。

更新于 2026-06-29北京
logo of meituan
校招核心本地商业-基

LongCat 是美团基础研发自主研发的大模型,覆盖语言、视觉、语音、具身全栈。LongCat 相继推出 LongCat-Flash、LongCat-Flash-Thinking、LongCat-Flash-Omni 等系列模型,正在构建支撑 LongCat全场景的语音大模型。加入团队你将参与如下工作: 1. LLM-ASR 模型演进,研究端到端语音识别大模型的架构与训练范式,攻克复杂声学、多说话人、专业术语热词等核心场景。 2. 下一代 TTS 模型探索,研发上下文感知的语音合成大模型,攻克音色 / 情绪 / 语速 / 方言多属性可控、首包延时与自然度的平衡,逼近真人级表达力。 3. 声纹与说话人建模,研究大规模声纹基座模型与多说话人分离算法,构建早期注入、多场景泛化的声纹能力底座。 4. 语音与多模态融合探索,研究语音表征与 LLM、视觉模态的统一建模范式,作为 Omni 模型的语音底座,支撑下一代多模态实时交互。 【为什么是我们】 1.全栈顶配算力支持,依托美团大规模算力集群,提供千卡至万卡级算力支持,具备成熟的分布式训练与低延迟推理优化栈,保障 世界动作模型与 VLA 大规模训练。 2.与优秀人才同行,你将与行业顶尖的大模型研究员及机器人领域专家并肩作战,共同攻克具身智能的技术难点。

更新于 2026-06-03北京|上海
logo of mi
校招

1、大规模语音模态预训练 研究如何用千万小时级别语音数据在百亿级别参数模型上进行高效预训练,有效提取与利用通用声学与语义特征,提升语言理解及语音生成的一致性和自然度; 2、多语言语音理解与生成 研究跨语言语音数据的共享表示方法,提升语音模型对多语言、方言的适配能力; 3、噪声环境及复杂声学场景下的处理能力 研究语音大模型在嘈杂、混响、远场等典型场景下的泛化性; 4、探索高效语音信息压缩方法 研究语音模态压缩方法,以实现长时理解,并适配不同类型的设备(云侧和端侧)的部署需求。

更新于 2026-06-02北京