小红书AI评测平台架构师
任职要求
1、本科及以上学历,计算机、软件工程、人工智能、数据科学等相关专业,具备5年以上后端、数据平台、质量平台或分布式系统研发经验。 2、主导或深度参与过评测平台、实验平台、数据平台、质量平台或大规模任务执行系统的架构设计。 3、熟练掌握 Python、Java、Go 中至少一种编程语言,具备良好的 SQL、数据处理及后端工程能力。 4、熟悉大模型和 AI Agent 应用链路,理解 Prompt、RAG、Tool Calling、ReAct、上下文工程及多轮对话等核心概念。 5、理解模型评测、Agent 评测、过程评测和端到端评测的差异,能够针对不同评测对象设计数据、指标、规则和执行方式。 6、熟悉 LLM-as-a-Judge、人工标注、人机一致率、评审偏差、基准测试和回归评测等方法。 7、具备数据资产与数据治理能力,熟悉评测集版本、数据血缘、质量校验、权限控制及敏感数据处理。 8、具备分布式任务执行系统设计能力,熟悉任务调度、并行计算、失败重试、幂等、限流、缓存及成本治理。 9、具备统计…
工作职责
1、主导 AI 评测平台总体架构设计,建设统一、可扩展的评测基础设施,支持大模型、Agent、RAG、Tool及端到端 AI 应用的质量评估。 2、建立分层评测体系,覆盖模型能力评测、Agent 推理过程评测、工具调用评测、上下文与记忆评测、RAG 评测及端到端体验评测。 3、设计评测数据资产体系,统一管理评测集、线上采样、Bad Case、人工标注、合成数据和竞品数据,支持数据清洗、去重、分层、版本、血缘及权限治理。 4、建设评测集持续演进机制,将新业务场景、线上问题、模型升级和产品变化转化为新增评测样本,保持评测覆盖度、区分度和时效性。 5、设计统一的评测指标与规则体系,支持客观指标、规则评测、模型评审和人工评审,并建立指标版本、规则版本和场景适用范围的管理机制。 6、设计自动化评测执行引擎,支持模型与 Prompt 矩阵、并行批跑、任务调度、失败重试、断点恢复、结果复用及大规模评测的成本控制。 7、建设 LLM-as-a-Judge 与评审 Agent 能力,包括评审 Prompt、评分标准、证据引用、多评审器仲裁,以及人机一致率、评审稳定性和偏差校准。 8、建设 Agent 过程评测能力,基于执行轨迹评估任务规划、推理步骤、上下文使用、工具选择、参数生成、工具结果利用和最终答案质量。 9、建立线上质量闭环,打通用户反馈、业务指标、线上 Trace、异常日志和离线评测,通过自动归因和 Case 聚类持续发现质量问题。 10、建设回归评测与发布门禁机制,对模型、Prompt、知识库、工具及 Agent 流程变更进行版本对比、基线回归、劣化检测和发布准入。 11、建设评测分析与归因平台,从模型、Prompt、Context、RAG、Tool及工程链路等维度定位问题,推动优化建议进入产品、算法和研发流程。 12、探索基于评测信号的 Agent 自进化能力,将线上反馈、执行轨迹、评测结果和归因结论转化为可验证的 Prompt、Context、Tool、知识及流程优化建议,并建立自动生成、沙箱验证、回归评测和人工确认机制。 13、制定 AI 评测数据、指标、协议和平台接入标准,推动不同业务场景复用统一评测能力,同时保留业务自定义指标与规则的扩展空间。
【构建支撑 AI 自主进化的 Agent 编排平台】 当 Agent 开始自主规划任务、调用工具、操作环境时,传统的 CI/CD 流水线与集群监控已无法满足 AI 实验的需求。我们的目标是:在 Kubernetes 上,构建一套“Agent 任务编排引擎与自动化评测底座”。让成超大规模的 Agent 能够在云原生沙箱中极速试错,让算法科学家的每一次迭代都有据可依。加入我们,打造大模型工业化生产的超级中枢! 【工作职责】 1. 超大规模 Agent 任务编排引擎 (1)定义 Agent 任务全生命周期管理,实现高并发任务的调度、优先级排队与自动容错重试。 2. 环境编排与自动化评测系统 (1)提供面向大模型强化学习与评估的自动化编排,建立 Agent 轨迹数据极速回溯体系。
1. 负责AI产品核心效果评估与精度度量:主导大模型及AI应用在业务场景下的效果评测全流程,包括构建多维度评测指标体系(如准确率、召回率、幻觉率、Rouge/BLEU及任务完成率),制定严谨的AB实验方案,并对评测数据进行深度统计与归因分析。 2. 构建对抗性评测与稳定性验证体系:设计并执行覆盖边界Case、长尾分布及恶意攻击的测试用例,系统性评估模型在复杂场景下的鲁棒性、安全性与语义稳定性,输出可量化的风险评估报告。 3. 推动效果回归与用户体验闭环:建立版本迭代的效果回归基线,利用自动化工具持续监控模型更新带来的精度波动;同时建立“线上数据回流-线下标注验证-模型优化”的闭环机制,推动产品体验的持续优化。 4. 设计自动化评测工具与数据飞轮:开发或集成AI自动化评测脚本(如基于API的批量推理、断言校验),建设数据标注与结果分析平台,提升效果评估的效率和可复现性;主导评测数据集的构建与管理,确保数据分布的合理性与标注一致性。
1、设计 AI 助手评测产品体系,覆盖大盘评估、策略迭代评估,建设自动化评估能力,让评估本身可规模化。 2、与产品和算法团队深度协作,把"产品质量"这种模糊的体感问题,拆解为可量化的指标体系与可执行的标注方案。 3、探索多模态场景下的评测方法,针对不同模态的特性设计差异化的评估框架。 4、推动评测结论真正落地——影响策略方向、影响产品决策、影响下一轮模型迭代。
我们希望你参与 1. 建设可持续演进的大模型评测体系; 2. 提升评测自动化程度与评测效率; 3. 推动评测数据、评测框架与评测方法持续迭代; 4. 用系统化评测驱动模型能力提升。 1. 负责大语言模型(LLM)评测体系建设,包括评测方案设计、评测指标定义、评测流程标准化等,建立可持续演进的评测能力体系; 2. 负责评测框架开发与维护,建设自动化、可扩展、高可靠的评测系统,提高评测效率与覆盖度; 3. 负责 Public Benchmark 与 In-house Benchmark 的建设与维护,包括评测集构建、数据清洗、版本管理、持续迭代与优化; 4. 根据模型迭代重点与业务需求,持续补充评测维度,动态优化评测集结构,提升评测集有效性与区分度; 5. 深入分析模型能力边界与问题分布,识别模型优势、短板与退化风险,建立问题发现与质量拦截机制; 6. 跟踪行业模型发展趋势,对主流模型进行横向评测与能力分析,量化模型能力变化与行业水平; 7. 参与模型训练与迭代过程中的评测建设,支撑模型研发闭环。