美团【基座大模型北斗实习】开放域智能体交互与自动化评测演进机制研究
任职要求
1、硕士及以上学历,计算机或相关专业,博士优先; 2、在 ML / NLP / RL / CV / Speech 等相关方向有扎实的研究基础,在 ACL / EMNLP / NAACL / NeurIPS / ICML / ICLR / CVPR / ICCV / ICASSP 等顶…
工作职责
简介:随着 OpenClaw、Claude Code 等 Agent 进入实战领域,传统的静态评测已无法衡量 Agent 的长程规划、自主纠错与真实环境交互能力。我们寻找对 Agent 评测范式有独特见解的同学,共同定义下一代 Agent 的考卷。你将参与的工作有: 1、评测范式研究与落地: ①针对 OpenClaw 及 Claude Code 等主流 Agent,构建基于真实生产力场景,如自动化办公、复杂代码重构、多工具协同等的动态评测沙盒环境。 ②探索从“单轮对话”转向“长程任务”的评测机制,研究如何量化 Agent 的记忆一致性与环境感知力。 2、高价值方案产出: ①设计并构建能反映用户体感的评测集,不仅关注 通过率,更深入拆解用户在交互过程中的使用体验。 ②建立 Agent 错误归因体系,针对 Agent 陷入死循环、幻觉指令、工具调用失败等典型场景进行深度诊断。 3、未来形态探索: ①跟踪前沿 Agent 发展,研究在多智能体协同、自主进化等未来形态下的 Agent 形态和相应的评测基准。 ②利用 LLM/Agent-as-a-Judge 的方式,提升自动化评测的准确性与效率。
简介:真实世界中智能体应对长周期、多步骤、开放式的任务目标仍存在瓶颈,如多日旅行规划、专业领域深度研究等任务均呈现长交互轮次、多依赖子任务、全局约束严格的特征,当前智能体易出现上下文丢失、计划漂移、误差累积等问题,难以支撑超长轮次、超长时间的超长程任务执行。本课题研究方向包括但是不限于: 1、长程任务鲁棒规划:结合思维链(CoT)、思维树(ToT)等方法,实现复杂目标的可执行子任务拆解,兼顾子任务依赖关系与全局时间/成本约束;研究基于实时环境反馈的重规划机制,解决“模拟漂移”导致的计划与现实脱节问题,提升规划鲁棒性;设计高效的上下文管理与记忆压缩技术,避免长交互过程中关键信息遗忘,支撑超长序列任务的稳定执行。 2、开放环境动态适应:探索解决真实世界中目标模糊、环境多变、突发干扰下的任务持续执行难题。 3、高效学习范式:研究真实世界开放任务reward以及过程奖励设计方法,为长程任务中间步骤提供有效反馈,解决奖励稀疏问题;研究开放环境下的持续学习方法,避免“灾难性遗忘”,增强智能体在新场景、新任务中的泛化能力。
简介:从多模态大模型基座延伸到具身智能,我们的目标是做到具身智能的“GPT时刻”,具备test-time zero-shot/few-shot的跨本体、跨任务泛化。在这个过程中,我们进行具身智能在泛化能力评测分析和关键迭代路径的探索,包括但不限于: 1、探索激发多模态大模型Training-Free泛化能力的Data-Scaling方案(包括VLA和VA),迁移人类数据到具身本体,包括latent action和unified model等方向。 2、探索通过世界模型作为物理仿真引擎的进阶,兼顾仿真和真机的优点,实现泛化评测、强化学习和多样性数据合成。 3、探索通过环境交互的在线强化学习,涉及仿真环境的搭建、数据合成和真机实验,研究通过自我进化的下一代智能提升的关键途径。
简介:我们认为,训练智能体系统的核心在于训练对任意复杂的环境进行合理交互、并在复合guidance 信号下充分进行系统级长程任务解决。这里,环境向真实物理世界演化是一个可以预见的方向,从而依赖模型在动态的、存在时序自变化的多模态环境下的探索与交互能力。为了激发这样的能力,一方面,我们认为游戏是一个高度可验证、同时充满训练潜力的场景;另一方面,如 minecraft / 原神 以至更复杂的开放世界环境更可以作为智能体系统在进行真实物理世界训练之前的一个练兵场。 具体的,我们关注如下研究目标: 1、探索通过在高度多样、丰富的游戏任务下进行大规模智能体训练,提高模型面对一般多模态场景的交互与融合模态推理能力。 2、探索趋向于真实物理世界的开放世界建模,为模型在真实物理世界下的训练和模拟训练提供坚实基础。 3、训练模型在动态、时序变化的开放世界下,自主进行感知、观察、探索、交互、任务推进的能力,并预期这样的能力作为真实物理世界训练的坚实前置基础,可以 minimize 所需的高成本真实物理世界训练量。
简介:Coding是当前 AI 技术落地最快、商业价值最大的方向之一。从代码补全到自主修复 GitHub Issue、到端到端软件工程自动化,大模型 Coding 能力的突破正在重塑整个软件开发范式。我们正在构建下一代具有强大代码生成与自主 Agent 能力的基座模型,打造可在真实工程环境中独立运作的 AI 开发者。 岗位职责 1、负责基座大模型在代码生成、代码理解、代码 debug 等方向的能力研究与提升,提升模型在Coding任务中的 Planning、长上下文理解等核心能力。 2、探索模型在 repo 级代码理解、跨文件修改、自主 debug 等复杂任务上的能力边界。 3、参与 Post-training(SFT / RL/ PRM)等 Alignment 方法在 Coding 场景的研究与落地。