logo of quark

千问千问事业部-高级测试开发工程师/测试开发专家-北京

社招全职3年以上技术类-质量保证地点:北京状态:招聘

任职要求


1. 熟悉 LLM 应用架构,掌握 Prompt Engineering、RAGAgent 编排等核心技术的测试方法与局限性;
2. 精通至少一门主流编程语言(Python/Go/Java),有主导或深度参与大规模自动化评测平台/质量中台建设的经验;
3. 1年以上 AI/LLM/Agent 类产品质量保障经验,熟悉 AI 业务全生命周期质量管控流程;
4. 具备快速学习前沿技术并落地的能力,有独立技术项目(开源项目/Demo/技术博客)者…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


1. 负责智能 AI/Agent 类产品的质量保障体系建设,覆盖从需求评审、开发测试到上线监控的全生命周期;
2. 建立基于业务场景的质量评估模型,搭建自动化评测pipline,覆盖意图识别准确率、工具调用成功率、多轮对话连贯性及最终结果可用性;
3. 负责端侧业务交互链路的质量保障,确保多模态交互的流畅性、正确性等核心性能体验监控、优化推进;
4. 主导评测数据集构建与持续维护,建立 Badcase 分析与归因机制,推动算法/工程侧的质量改进闭环;
5. 规划并落地测试工具链、数据构造引擎及线上异常监控体系,将 AI 前沿技术(如 LLM-as-a-Judge、Agent 自动评测)转化为团队生产力;
6. 带领测试团队成长,提升团队对 AI 技术的敏感度与应用能力,沉淀 AI 质量保障的最佳实践。
包括英文材料
大模型+
Prompt+
RAG+
AI agent+
还有更多 •••
相关职位

logo of alibaba
社招2年以上技术类-质量保证

1. 负责大模型训练、推理、评测、部署等核心链路的质量保障体系建设。 2. 设计并实现自动化评测框架,支持多维度(如准确性、一致性、安全性、推理速度等)的模型能力评估。 3. 构建高质量、可扩展的评测数据集,制定科学、可量化的评测标准与指标体系。 4. 推动CI/CD流程在大模型工程中的落地,保障模型迭代的稳定性与可回溯性。 5. 主导Bad Case分析闭环机制,联动算法、工程与业务团队优化模型表现。

更新于 2026-07-17北京|杭州
logo of aliyun
社招3年以上云智能集团

1. 负责大模型训练、推理、评测、部署等核心链路的质量保障体系建设。 2. 设计并实现自动化评测框架,支持多维度(如准确性、一致性、安全性、推理速度等)的模型能力评估。 3. 构建高质量、可扩展的评测数据集,制定科学、可量化的评测标准与指标体系。 4. 推动CI/CD流程在大模型工程中的落地,保障模型迭代的稳定性与可回溯性。 5. 主导Bad Case分析闭环机制,联动算法、工程与业务团队优化模型表现。

更新于 2026-04-06北京|杭州
logo of aligenie
社招3年以上

1. 负责大模型训练、推理、评测、部署等核心链路的质量保障体系建设。 2. 设计并实现自动化评测框架,支持多维度(如准确性、一致性、安全性、推理速度等)的模型能力评估。 3. 构建高质量、可扩展的评测数据集,制定科学、可量化的评测标准与指标体系。 4. 推动CI/CD流程在大模型工程中的落地,保障模型迭代的稳定性与可回溯性。 5. 主导Bad Case分析闭环机制,联动算法、工程与业务团队优化模型表现。

更新于 2026-04-06北京|杭州
logo of aliyun
社招5年以上云智能集团

1. 负责阿里云百炼平台的质量保障工作,参与产品需求和技术方案评审,评估技术架构合理性和可测性。 2. 进行阿里云百炼平台的质量保障体系建设,包括功能测试、自动化测试、性能测试和稳定性测试等。 3. 配合开发团队进行问题排查和分析,解决线上用户问题,持续提升产品竞争力。

更新于 2025-12-16杭州