蚂蚁金服蚂蚁集团-AI评测算法工程师-成都
任职要求
1. 3 年以上互联网或传统行业算法/开发/测试经验,具备 1 年以上 AI/算法类产品评测经验(大模型 / 推荐 / 搜索 / NLP);有基座模型评测工程经验者优先; 2. 熟悉算法服务测试场景(精度验证、AB 实验评估等),熟悉常用评测指标(准确率 / 召回率 /…
工作职责
1. 按照产品架构和业务要求,设计覆盖功能与非功能需求的评测策略,负责 AI/算法类产品的效果符合设计预期,保障系统稳定性; 2. 面向复杂推理、Agentic Workflows 等前沿能力构建高难度评测集;开发支持万级并发、对接训练集群的评测流水线,实现 Checkpoint 边训边评与分钟级反馈;规模化落地LLM-as-a-Judge,解决开放式生成量化难题;对 Bad Case 做算法级归因,将洞察反馈 AI Research 团队,指导数据配比与合成数据生成; 3. 研究评测相关新技术方法,攻克评测复杂技术/算法问题; 4. 能结合AI行业发展趋势,制定合适的评测技术发展规划,提升团队技术视野和技术影响力。
- 构建并完善大模型评测体系,包括评测标准制定,评测工具链开发和评测数据集建设; - 基于agentic业务需求设计评测方案,开展多维度模型评估,输出专业评测报告; - 参与Agent /工具调用 在垂直领域的算法工程化实现及性能评估研究; - 沉淀业务专家知识到 reward/critic 层面实现LLM-as-judge,沉淀长链数据资产;
1. 负责AI产品核心效果评估与精度度量:主导大模型及AI应用在业务场景下的效果评测全流程,包括构建多维度评测指标体系(如准确率、召回率、幻觉率、Rouge/BLEU及任务完成率),制定严谨的AB实验方案,并对评测数据进行深度统计与归因分析。 2. 构建对抗性评测与稳定性验证体系:设计并执行覆盖边界Case、长尾分布及恶意攻击的测试用例,系统性评估模型在复杂场景下的鲁棒性、安全性与语义稳定性,输出可量化的风险评估报告。 3. 推动效果回归与用户体验闭环:建立版本迭代的效果回归基线,利用自动化工具持续监控模型更新带来的精度波动;同时建立“线上数据回流-线下标注验证-模型优化”的闭环机制,推动产品体验的持续优化。 4. 设计自动化评测工具与数据飞轮:开发或集成AI自动化评测脚本(如基于API的批量推理、断言校验),建设数据标注与结果分析平台,提升效果评估的效率和可复现性;主导评测数据集的构建与管理,确保数据分布的合理性与标注一致性。
1. 评测体系建设与优化:深度参与直播数字人评测标准制定的制定,协助梳理评测SOP、收集案例、完善标准细则; 2. 评测数据验收:负责评测数据的日常验收及基础答疑,把关评测数据质量,并协助提升标注人员对标准的理解; 3. 评测报告撰写:整理评测数据,协助输出高质量评测分析报告,总结归纳算法能力问题; 4. 线上巡检:对线上直播间进行常态化巡检,主动挖掘数字人画面、语音、互动等维度的体验问题;
我们希望你参与 1. 建设可持续演进的大模型评测体系; 2. 提升评测自动化程度与评测效率; 3. 推动评测数据、评测框架与评测方法持续迭代; 4. 用系统化评测驱动模型能力提升。 1. 负责大语言模型(LLM)评测体系建设,包括评测方案设计、评测指标定义、评测流程标准化等,建立可持续演进的评测能力体系; 2. 负责评测框架开发与维护,建设自动化、可扩展、高可靠的评测系统,提高评测效率与覆盖度; 3. 负责 Public Benchmark 与 In-house Benchmark 的建设与维护,包括评测集构建、数据清洗、版本管理、持续迭代与优化; 4. 根据模型迭代重点与业务需求,持续补充评测维度,动态优化评测集结构,提升评测集有效性与区分度; 5. 深入分析模型能力边界与问题分布,识别模型优势、短板与退化风险,建立问题发现与质量拦截机制; 6. 跟踪行业模型发展趋势,对主流模型进行横向评测与能力分析,量化模型能力变化与行业水平; 7. 参与模型训练与迭代过程中的评测建设,支撑模型研发闭环。