美团AI算法评测实习生
任职要求
1. 本科及以上学历在读,计算机、统计学、心理学或传媒类相关专业优先,有过模型评测实习经验优先;
2. 具备极强的耐心和责任心,对数据敏感,能从数据中总结规律、敏锐发现异常;
…工作职责
1. 评测体系建设与优化:深度参与直播数字人评测标准制定的制定,协助梳理评测SOP、收集案例、完善标准细则; 2. 评测数据验收:负责评测数据的日常验收及基础答疑,把关评测数据质量,并协助提升标注人员对标准的理解; 3. 评测报告撰写:整理评测数据,协助输出高质量评测分析报告,总结归纳算法能力问题; 4. 线上巡检:对线上直播间进行常态化巡检,主动挖掘数字人画面、语音、互动等维度的体验问题;
1. 负责AI产品核心效果评估与精度度量:主导大模型及AI应用在业务场景下的效果评测全流程,包括构建多维度评测指标体系(如准确率、召回率、幻觉率、Rouge/BLEU及任务完成率),制定严谨的AB实验方案,并对评测数据进行深度统计与归因分析。 2. 构建对抗性评测与稳定性验证体系:设计并执行覆盖边界Case、长尾分布及恶意攻击的测试用例,系统性评估模型在复杂场景下的鲁棒性、安全性与语义稳定性,输出可量化的风险评估报告。 3. 推动效果回归与用户体验闭环:建立版本迭代的效果回归基线,利用自动化工具持续监控模型更新带来的精度波动;同时建立“线上数据回流-线下标注验证-模型优化”的闭环机制,推动产品体验的持续优化。 4. 设计自动化评测工具与数据飞轮:开发或集成AI自动化评测脚本(如基于API的批量推理、断言校验),建设数据标注与结果分析平台,提升效果评估的效率和可复现性;主导评测数据集的构建与管理,确保数据分布的合理性与标注一致性。
- 构建并完善大模型评测体系,包括评测标准制定,评测工具链开发和评测数据集建设; - 基于agentic业务需求设计评测方案,开展多维度模型评估,输出专业评测报告; - 参与Agent /工具调用 在垂直领域的算法工程化实现及性能评估研究; - 沉淀业务专家知识到 reward/critic 层面实现LLM-as-judge,沉淀长链数据资产;
1、负责美团食杂零售预测、供应链算法研发与建设,支持小象超市、快乐猴超市、快驴进货、Keemart等多个业态的供应链智能化运营。 2、综合运用深度学习、运筹优化、大模型等前沿技术,针对供应链全链路复杂场景(包括但不限于需求预测、库存优化、履约调度、时效预测等)构建算法方案,持续提升供应链的智能化和自动化水平,提升效率、降低成本、优化用户体验。 3、在运筹优化、机器学习/深度学习、大模型应用等算法领域持续探索与创新,沉淀通用算法能力,推进算法平台化建设,提升研发效率。 4、深入理解零售、供应链业务逻辑和运营模式,与业务、产品、工程、数据等团队紧密协同,完成从业务问题到算法问题的抽象与定义,设计指标体系,进行算法技术选型和方案设计实现,推动落地应用。 5、参与项目管理、团队建设,通过Code Review、技术分享、技术方案评审等方式,提升团队整体算法与工程能力,营造良好的技术氛围。
