小红书语音大模型算法研究员
社招全职3-5年多媒体算法地点:北京 | 上海状态:招聘
任职要求
1.AI、EE、CS相关专业; 2.在语音识别/理解、语音合成/编辑等泛语音方向均有一定经验; 3.对工业级大规模数据有实际处理经验,有使用海量数据优化实际业务模型的动手经验; 4.良好的团队沟通…
登录查看完整任职要求
微信扫码,1秒登录
工作职责
1.自研语音大模型算法在小红书丰富业务场景的落地,并持续优化语音大模型预训练、后训练效果,保持业内SOTA水平。 2.跟进最领先的大模型语音技术,包括但不限于提出新的语音大模型算法框架、改进现有的算法、持续提升相关技术及业务指标,鼓励撰写论文及申请专利。
包括英文材料
语音识别+
https://developer.nvidia.com/blog/essential-guide-to-automatic-speech-recognition-technology/
Over the past decade, AI-powered speech recognition systems have slowly become part of our everyday lives, from voice search to virtual assistants in contact centers, cars, hospitals, and restaurants.
语音合成+
https://www.ibm.com/think/topics/text-to-speech
Text to speech (TTS) is a type of technology that converts text on a digital interface into natural-sounding audio.
相关职位
社招1年以上核心本地商业-基
你将做什么: 1. 语音识别、声纹技术研发; 2. 优化在线语音识别服务,提升语音识别在客服、出行、美团App 等具体业务中的识别准确率; 3. 语音大模型、多模态等前沿技术探索。
更新于 2026-05-28北京|上海
社招3年以上微信输入法技术
1.负责研发具有多任务能力的语音合成(TTS)大模型; 2.负责TTS大模型的预训练及后训练相关的数据和算法工作; 3.推动TTS大模型在产品中应用落地(如朗读/对话/配音等场景),及针对这些场景进行模型优化。
更新于 2026-06-29北京
校招核心本地商业-基
LongCat 是美团基础研发自主研发的大模型,覆盖语言、视觉、语音、具身全栈。LongCat 相继推出 LongCat-Flash、LongCat-Flash-Thinking、LongCat-Flash-Omni 等系列模型,正在构建支撑 LongCat全场景的语音大模型。加入团队你将参与如下工作: 1. LLM-ASR 模型演进,研究端到端语音识别大模型的架构与训练范式,攻克复杂声学、多说话人、专业术语热词等核心场景。 2. 下一代 TTS 模型探索,研发上下文感知的语音合成大模型,攻克音色 / 情绪 / 语速 / 方言多属性可控、首包延时与自然度的平衡,逼近真人级表达力。 3. 声纹与说话人建模,研究大规模声纹基座模型与多说话人分离算法,构建早期注入、多场景泛化的声纹能力底座。 4. 语音与多模态融合探索,研究语音表征与 LLM、视觉模态的统一建模范式,作为 Omni 模型的语音底座,支撑下一代多模态实时交互。 【为什么是我们】 1.全栈顶配算力支持,依托美团大规模算力集群,提供千卡至万卡级算力支持,具备成熟的分布式训练与低延迟推理优化栈,保障 世界动作模型与 VLA 大规模训练。 2.与优秀人才同行,你将与行业顶尖的大模型研究员及机器人领域专家并肩作战,共同攻克具身智能的技术难点。
更新于 2026-06-03北京|上海