千问千问事业部-高级测试开发工程师/测试开发专家-北京
社招全职3年以上技术类-质量保证地点:北京状态:招聘
任职要求
1. 熟悉 LLM 应用架构,掌握 Prompt Engineering、RAG、Agent 编排等核心技术的测试方法与局限性; 2. 精通至少一门主流编程语言(Python/Go/Java),有主导或深度参与大规模自动化评测平台/质量中台建设的经验; 3. 1年以上 AI/LLM/Agent 类产品质量保障经验,熟悉 AI 业务全生命周期质量管控流程; 4. 具备快速学习前沿技术并落地的能力,有独立技术项目(开源项目/Demo/技术博客)者…
登录查看完整任职要求
微信扫码,1秒登录
工作职责
1. 负责智能 AI/Agent 类产品的质量保障体系建设,覆盖从需求评审、开发测试到上线监控的全生命周期; 2. 建立基于业务场景的质量评估模型,搭建自动化评测pipline,覆盖意图识别准确率、工具调用成功率、多轮对话连贯性及最终结果可用性; 3. 负责端侧业务交互链路的质量保障,确保多模态交互的流畅性、正确性等核心性能体验监控、优化推进; 4. 主导评测数据集构建与持续维护,建立 Badcase 分析与归因机制,推动算法/工程侧的质量改进闭环; 5. 规划并落地测试工具链、数据构造引擎及线上异常监控体系,将 AI 前沿技术(如 LLM-as-a-Judge、Agent 自动评测)转化为团队生产力; 6. 带领测试团队成长,提升团队对 AI 技术的敏感度与应用能力,沉淀 AI 质量保障的最佳实践。
包括英文材料
大模型+
https://www.youtube.com/watch?v=xZDB1naRUlk
You will build projects with LLMs that will enable you to create dynamic interfaces, interact with vast amounts of text data, and even empower LLMs with the capability to browse the internet for research papers.
https://www.youtube.com/watch?v=zjkBMFhNj_g
Prompt+
https://cloud.google.com/vertex-ai/generative-ai/docs/learn/prompts/introduction-prompt-design
A prompt is a natural language request submitted to a language model to receive a response back.
https://learn.microsoft.com/en-us/azure/ai-foundry/openai/concepts/prompt-engineering
These techniques aren't recommended for reasoning models like gpt-5 and o-series models.
https://www.youtube.com/watch?v=LWiMwhDZ9as
Learn and master the fundamentals of Prompt Engineering and LLMs with this 5-HOUR Prompt Engineering Crash Course!
RAG+
https://www.youtube.com/watch?v=sVcwVQRHIc8
Learn how to implement RAG (Retrieval Augmented Generation) from scratch, straight from a LangChain software engineer.
AI agent+
https://www.ibm.com/think/ai-agents
Your one-stop resource for gaining in-depth knowledge and hands-on applications of AI agents.
还有更多 •••
相关职位
社招2年以上技术类-质量保证
1. 负责大模型训练、推理、评测、部署等核心链路的质量保障体系建设。 2. 设计并实现自动化评测框架,支持多维度(如准确性、一致性、安全性、推理速度等)的模型能力评估。 3. 构建高质量、可扩展的评测数据集,制定科学、可量化的评测标准与指标体系。 4. 推动CI/CD流程在大模型工程中的落地,保障模型迭代的稳定性与可回溯性。 5. 主导Bad Case分析闭环机制,联动算法、工程与业务团队优化模型表现。
更新于 2026-07-17北京|杭州
社招3年以上云智能集团
1. 负责大模型训练、推理、评测、部署等核心链路的质量保障体系建设。 2. 设计并实现自动化评测框架,支持多维度(如准确性、一致性、安全性、推理速度等)的模型能力评估。 3. 构建高质量、可扩展的评测数据集,制定科学、可量化的评测标准与指标体系。 4. 推动CI/CD流程在大模型工程中的落地,保障模型迭代的稳定性与可回溯性。 5. 主导Bad Case分析闭环机制,联动算法、工程与业务团队优化模型表现。
更新于 2026-04-06北京|杭州

社招3年以上
1. 负责大模型训练、推理、评测、部署等核心链路的质量保障体系建设。 2. 设计并实现自动化评测框架,支持多维度(如准确性、一致性、安全性、推理速度等)的模型能力评估。 3. 构建高质量、可扩展的评测数据集,制定科学、可量化的评测标准与指标体系。 4. 推动CI/CD流程在大模型工程中的落地,保障模型迭代的稳定性与可回溯性。 5. 主导Bad Case分析闭环机制,联动算法、工程与业务团队优化模型表现。
更新于 2026-04-06北京|杭州