logo of meituan

美团Search Agent大模型算法工程师

社招全职核心本地商业-基础研发平台地点:北京 | 上海状态:招聘

任职要求


1、硕士研究生及以上学历,计算机科学、人工智能、自然语言处理等相关领域;
2、优秀的编程能力,熟悉PyTorchTensorFlow深度学习框架;
3、熟悉深度学习LLM相关的算法和技术,具备丰富的模型训练调优经验;
4、出色的分析和解决问题能力,并具有极强的学习能力…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


1、深度参与大模型Search Agent产品的研发工作,包括联网搜索、边想边搜、Deep Research等
2、跟进大模型的前沿技术,包括但不限于:Mid-Train、SFT、Generative Reward Model、RLVR、Agentic RL等,在Longcat模型上做出创新性的研究成果
3、结合大模型多模态能力,探索下一代大模型+搜索的新的技术和产品范式
包括英文材料
学历+
NLP+
PyTorch+
TensorFlow+
深度学习+
大模型+
还有更多 •••
相关职位

logo of meituan
实习核心本地商业-基

你将加入 LongCat Agent 算法团队,与一线研究员共同推进下一代智能体的范式探索。具体方向包括但不限于: 1.Agentic RL 基础算法研究:探索面向长程多步任务的强化学习训练范式,包括稀疏奖励下的信用分配、过程奖励建模、自我博弈与多智能体协同、可扩展的 reward modeling,以及训练稳定性与样本效率优化。目标是实现Agent 能力增长的主引擎; 2.Search Agent 能力构建:研发面向开放域复杂查询的搜索智能体,覆盖多轮检索规划、查询改写、证据聚合、多源信息冲突消解与可信溯源。重点突破"深度研究"类长程任务(Deep Research)的端到端 RL 训练,让模型在数十步检索-推理交织中保持目标产出高质量分析内容。 3.生活服务助理 Agent:解决美团真实业务环境中(餐饮、出行、到店、履约等多业务横跨)实现智能助理的基础问题,研究多工具长链调用、澄清和主动服务、个性化记忆与偏好建模、跨会话状态管理,以及面向真实用户反馈的RL 闭环。这里的复杂度来自亿级用户、千万级 SKU 与多步骤决策构成的真实环境。 【为什么是我们】 1.稀缺场景:直接接触亿级真实用户、跨业务多步决策的复杂环境,是当前业界最稀缺的 Agent 训练土壤; 2.充足资源:充足算力、丰富多模态数据、专属带教导师、顶级 infra 团队支持; 3.研究自由:明确鼓励技术探索,有机会参与顶会论文产出,研究成果可服务亿级真实用户实现学术与产业双闭环; 4.成长路径:北京 / 上海双地 base,扁平协作、与算法/Infra/产品高密度共事,快速成长为下一代 Agent 技术骨干。

更新于 2026-06-26北京|上海
logo of meituan
校招核心本地商业-基

你将加入 LongCat Agent 算法团队,与一线研究员共同推进下一代智能体的范式探索。具体方向包括但不限于: 1.Agentic RL 基础算法研究:探索面向长程多步任务的强化学习训练范式,包括稀疏奖励下的信用分配、过程奖励建模、自我博弈与多智能体协同、可扩展的 reward modeling,以及训练稳定性与样本效率优化。目标是实现Agent 能力增长的主引擎; 2.Search Agent 能力构建:研发面向开放域复杂查询的搜索智能体,覆盖多轮检索规划、查询改写、证据聚合、多源信息冲突消解与可信溯源。重点突破"深度研究"类长程任务(Deep Research)的端到端 RL 训练,让模型在数十步检索-推理交织中保持目标产出高质量分析内容。 3.生活服务助理 Agent:解决美团真实业务环境中(餐饮、出行、到店、履约等多业务横跨)实现智能助理的基础问题,研究多工具长链调用、澄清和主动服务、个性化记忆与偏好建模、跨会话状态管理,以及面向真实用户反馈的RL 闭环。这里的复杂度来自亿级用户、千万级 SKU 与多步骤决策构成的真实环境。 【为什么是我们】 1.稀缺场景:直接接触亿级真实用户、跨业务多步决策的复杂环境,是当前业界最稀缺的 Agent 训练土壤; 2.充足资源:充足算力、丰富多模态数据、专属带教导师、顶级 infra 团队支持; 3.研究自由:明确鼓励技术探索,有机会参与顶会论文产出,研究成果可服务亿级真实用户实现学术与产业双闭环; 4.成长路径:北京 / 上海双地 base,扁平协作、与算法/Infra/产品高密度共事,快速成长为下一代 Agent 技术骨干。

更新于 2026-06-03北京|上海
logo of meituan
社招3年以上核心本地商业-基

1. 深度参与LongCat基模Agent能力优化,包括但不限于以DeepSearch、DeepResearch等为代表的Search Agent能力,以及以生活服务等为代表的真实世界复杂任务上的Agentic能力 2. 跟进大模型的前沿技术,包括但不限于:Mid-Train、SFT、GRM、PRM、RLVR、Agentic RL、Agent自进化、Context管理/Memory等,在LongCat模型上做出创新性的研究成果 3. 结合大模型全模态能力,探索下一代大模型+Agent+搜索的新的技术和产品范式

更新于 2026-05-28北京|上海
logo of alibaba
实习阿里巴巴2027

你将深度参与到千问VQA场景的优化&探索中,核心专注于提升 SearchAgent 在复杂视觉场景下的理解、推理及反思纠错能力。具体工作包括: 1、高质量数据工程体系 设计并构建复杂 Multi-Turn VL Search Trajectory 的数据合成与生产管线,探索自动化数据生成策略,模拟真实用户的复杂多轮搜索需求,构建包括CoT、ToolUse及Reflection路径的高质量训练数据集; 2、VLM基础的感知/推理能力优化 针对 Single Step 场景,优化VLM基座模型,显著提升其对复杂图像的理解、推理能力及工具调用的准确性,负责包括MiddleTrain和PostTrain在内的完整的训练阶段优化; 3、Multi-Turn强化学习策略设计 主导SearchAgent在Multi-Turn场景下的RL工作,探索&设计创新的RL方式与Reward System,有效激发Agent的自我反思与错误修正能力,提升Agent在长程依赖任务中的决策稳定性; 4、Agent 架构优化与效率提升 研究如何在保证检索效果的前提下,极致压缩 Trajectory长度,优化Agent 的搜索策略与规划机制,提升端到端的搜索效率。

更新于 2026-03-22杭州