logo of meituan

美团LongCat - 语音大模型算法研究员

社招全职1年以上核心本地商业-基础研发平台地点:北京 | 上海状态:招聘

任职要求


期望的你是这样的:
1.有扎实的工程基础,熟练掌握 python 或者 C++;
2.具备机器学习经验基础,熟悉常见机器学习、深度学习算法,并对于未知算法有技术…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


你将做什么:
1. 语音识别、声纹技术研发;
2. 优化在线语音识别服务,提升语音识别在客服、出行、美团App 等具体业务中的识别准确率;
3. 语音大模型、多模态等前沿技术探索。
包括英文材料
Python+
C+++
机器学习+
还有更多 •••
相关职位

logo of meituan
校招核心本地商业-基

LongCat 是美团基础研发自主研发的大模型,覆盖语言、视觉、语音、具身全栈。LongCat 相继推出 LongCat-Flash、LongCat-Flash-Thinking、LongCat-Flash-Omni 等系列模型,正在构建支撑 LongCat全场景的语音大模型。加入团队你将参与如下工作: 1. LLM-ASR 模型演进,研究端到端语音识别大模型的架构与训练范式,攻克复杂声学、多说话人、专业术语热词等核心场景。 2. 下一代 TTS 模型探索,研发上下文感知的语音合成大模型,攻克音色 / 情绪 / 语速 / 方言多属性可控、首包延时与自然度的平衡,逼近真人级表达力。 3. 声纹与说话人建模,研究大规模声纹基座模型与多说话人分离算法,构建早期注入、多场景泛化的声纹能力底座。 4. 语音与多模态融合探索,研究语音表征与 LLM、视觉模态的统一建模范式,作为 Omni 模型的语音底座,支撑下一代多模态实时交互。 【为什么是我们】 1.全栈顶配算力支持,依托美团大规模算力集群,提供千卡至万卡级算力支持,具备成熟的分布式训练与低延迟推理优化栈,保障 世界动作模型与 VLA 大规模训练。 2.与优秀人才同行,你将与行业顶尖的大模型研究员及机器人领域专家并肩作战,共同攻克具身智能的技术难点。

更新于 2026-06-03北京|上海
logo of meituan
实习核心本地商业-基

下一代智能体将彻底打破“键盘与屏幕”的束缚,语音将成为人类与AI协作最自然、最高效的入口。这要求模型不仅能“听懂”字面意思,还要能感知语气、情绪与环境音,并基于这些多维度的语音信息直接进行思考、规划与行动。本课题聚焦于构建端到端(End-to-End)的语音原生大模型,并将其深度融入Agentic工作流,打造“边听、边想、边说、边做”的新一代语音智能体,推动AI从传统的“级联式语音助手(ASR+LLM+TTS)”走向具备极低延迟、全双工交互与复杂任务执行能力的真实世界数字伙伴。 具体地,我们关注如下研究方向: 1.端到端语音-语言统一建模与理解: 摒弃传统的级联架构,探索将连续的音频流(包含语音、副语言特征、环境音)与离散的文本Token在统一的自回归/非自回归架构下进行联合建模。使Agent能够无损保留语音中的情绪、重音、语速等声学特征,并在极低延迟下实现跨模态的深度语义理解。 2.实时全双工流式交互与动态响应: 研究面向真实对话场景的流式输入输出机制,攻克语音智能体在自然对话中的“听觉注意力”问题。探索支持随时打断(Interruption)、智能插话(Backchanneling)、端点检测(VAD)与即时状态切换的底层模型架构,实现媲美真人的丝滑对话节奏。 3.语音驱动的Agent规划与工具调用(Voice-to-Action): 探索如何将模糊、口语化、包含冗余信息的自然语音指令,直接转化为精准的Agent意图与工具调用(Tool Use/API Call)序列。研究语音模态下的长上下文记忆、多轮语音交互中的意图追踪,以及“边对话边执行任务”的并行处理能力。 4.面向语音Agent的高效对齐与强化学习: 探索适用于语音大模型的训练范式与对齐策略。包括但不限于:基于人类偏好的语音强化学习(RLHF for Audio)、语音交互轨迹的大规模构建、针对“对话自然度”与“任务完成率”的多目标奖励建模,以及基于环境反馈的语音Agent自进化机制。 【为什么是我们】 1.全栈顶配算力支持,依托美团大规模算力集群,提供千卡至万卡级算力支持,具备成熟的分布式训练与低延迟推理优化栈,保障 世界动作模型与 VLA 大规模训练。 2.与优秀人才同行,你将与行业顶尖的大模型研究员及机器人领域专家并肩作战,共同攻克具身智能的技术难点。

更新于 2026-06-30北京|上海|深圳
logo of meituan
社招2年以上核心本地商业-基

1.针对大模型Coding场景,拆解代码生成、代码补全等核心能力,建立科学的代码标注和评测体系。 2. 主导代码标注资源管理与数据构建,确保数据质量和一致性,支持coding智能体训练、评测。 3. 设计自动化数据合成及清洗方案,实现规模化高质量数据生产。 4. 监测模型效果,输出系统化分析报告,持续优化数据方案。

更新于 2026-06-01北京|上海|成都
logo of meituan
社招3年以上核心本地商业-基

在 LongCat 基座大模型团队,参与探索具身智能基础模型的架构和范式,从系统架构、数据策略、模型结构、训练策略等角度切入,参与算法研究、系统工程和数据工程,打造具有更强能力和更高潜力的基座模型。包括: 1. 多源数据的合成和处理,包括:egocentric video 数据、仿真数据、UMI 采集数据、真机遥操作数据等 2. 具身智能系统的架构设计,Agent 系统、大小脑和 Monitor 等多层次结构 3. 模型泛化性探索:无需额外训练实现跨本体多任务;基于少量演示数据作为上下文,增强模型能力;基于自动探索,在线学习新技能。 4. 模型全流程,预训练、mid train、SFT、强化学习、部署和评测等 同时参与具身智能方向的前沿研究,可根据个人背景和研究兴趣选择以下方向之一深入推进: 1. 具身智能模型、数据、训练方法和系统等相关的设计 2. 仿真环境内的轨迹自动化生成方法(数据引擎/合成数据) 3. egocentric video 数据的有效使用 4. 基于多模态大模型的泛化具身智能 Agent 系统研究 5. 模型泛化性研究和主动探索研究 6. 其他你坚信路线正确的具身智能前沿方向

更新于 2026-05-29北京|上海