logo of meituan

美团LongCat大模型 - 大模型评测平台产品经理

社招全职3年以上核心本地商业-基础研发平台地点:北京 | 上海状态:招聘

任职要求


1. 核心能力:强产品思维与用户洞察力,能精准拆解需求并转化为高可用功能,精通数据分析,具备通过指标波动、实验失败率等定位系统瓶颈的能力。
2. 技术理解:熟悉大模型评测关键技术栈,了解主流评测框架的设计逻辑与局限性。
3. 协作与执行:出色的跨团队…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


1. 平台功能设计与优化:基于用户需求,主导评测平台核心功能迭代(包括但不限于:基座训练过程追踪、评测集数据管理、评测实验自动化、多维度报表系统、动态评测榜单),优化交互体验与系统架构。
2. 评测方案科学化迭代:跟进大模型能力迭代路径,提升评测的科学性、全面性与置信度,建立指标稳定性监控体系,确保评测流程可追溯、结果可复现。
3. 评测全链路提效:协同算法/工程团队,优化评测数据建设、评测实验及评测结果追踪流程,提升实验人效。
包括英文材料
高可用+
数据分析+
还有更多 •••
相关职位

logo of meituan
社招2年以上核心本地商业-基

负责围绕AI大模型的模型评测与模型研究工作,具体工作内容包括但不限于: 1. 深入理解大规模语言模型的模型结构、训练过程以及评测方式,根据模型的训练过程以及评测结果,对大语言模型存在的问题进行研究。 2. 深入分析模型效果不符合认知的异常,根据具体的异常制定完善的研究策略,通过对比、归纳等方法,产出研究分析结论,探索突破性的优化方案,带来模型效果的迭代和突破。 3. 构建Data-Centric的数据-训练-评测闭环,探索研究包括但不限于下列方向:大模型数据、模型的Scaling Law,研究数据配比、加入方式与时机等对模型效果的影响。 4. 追踪大模型方向的前沿进展,积极主动地学习和探索新数据分析、模型训练以及模型评测方法。 5. 与各相关部门保持良好沟通,深度参与大模型预训练、SFT、RLHF和评测等阶段,共同推动大模型持续优化。

更新于 2026-05-29上海|北京
logo of meituan
社招3年以上核心本地商业-基

1. Agent能力评测体系设计:围绕 OpenClaw、Claude Code 等主流 Agent 框架,设计并落地适配长程任务场景的评测体系,确保 Agent 在真实约束下的交付稳定性与可度量性。 2. 评测流程与资源建设:设计 Coding、数据分析等核心生产力场景的端到端评测流程,搭建自动化评测数据生产与自动化 Rubrics 生成的标准化 pipeline;同时建设具备强技术背景的专家标注资源池,确保 Case 评审、效果判定等关键环节的专业度与一致性。 3.数据闭环与模型策略驱动:将评测数据转化为模型迭代的策略输入,建立"评测→归因→策略建议→效果验证"的数据驱动闭环,推动 Agent 能力持续提升形成飞轮。 4.前沿框架跟踪与评测策略适配:持续跟踪 OpenClaw、Claude Code 及行业前沿 Agent 框架的能力演进与架构变化,及时调整评测策略与度量标准,确保评测体系与 Agent 技术范式同步迭代。

更新于 2026-05-29北京|上海
logo of meituan
社招核心本地商业-基

负责围绕AI大模型算法的认知分析的研究工作,具体工作内容包括但不限于: 1. 深入理解大规模语言模型的模型结构、训练过程以及评测方式,根据模型的训练过程以及评测结果,对大语言模型存在的问题进行研究。 2. 深度参与通用生产力在claude code/OpenClaw等场景下的基座模型能力优化迭代,设计具有长路径、多步骤交互特征的评测任务集,实现从“单次问答”到“闭环任务”的评测转型。 3. 探索长周期下Agent在复杂任务的能力边界,涵盖工具调用、决策规划和记忆管理等方向,对前沿评测范式如基于沙盒环境的动态评测和多agent协同效率等进行深入研究.

更新于 2026-05-29北京|上海
logo of meituan
社招2年以上核心本地商业-基

随着AI下半场的到来,传统的评测范式已经无法适配持续提升的模型能力,针对ChatBot模型的Arena评测的有效性也遭到质疑,如何面向现阶段以及未来的模型能力进行科学有效的评估本身也是个极具挑战和价值的研究方向。OpenAI研究者也表示,AI接下来比拼的不是训练,而是“如何定义并评估真正有用的任务”。 在这样的背景下,美团大模型评测团队以指引通往AGI的道路为目标,深耕模型评测研究,系统性的理解大模型当前能力水平及未来技术发展方向,并以此为基础完善模型评测能力矩阵。团队工作方向包括但不限于:①构建科学有效的评测方案,为现阶段大模型提供有效的评测和分析手段,并面向未来模型储备评测技术,包括人机协同评测、产品化隐式评测方案、全模态交互式评测方案等;②结合训练和评测,对模型的能力进行建模及深入的理解和研究,包括能力体系构建、训练阶段分析、模型能力/问题溯源等;③探索模型能力边界,发现当前模型训练范式的局限性,寻求模型能力突破。 本岗位涉及的方向包括: 1. Agent评测构建与方案探索,包括但不限于:通用模型的Agent能力评测与探索,Computer Use、Code Agent、通用搜索等产品级Agent的评测方案和分析。 2. 长周期人机协作与Agent能力边界探索,包括但不限于:Agent的异步交互、适时思考、记忆管理、自主学习等能力的评测方案及实践探索。

更新于 2026-05-29北京|上海