腾讯腾讯云-AI Agent测试工程师
任职要求
1.计算机相关专业本科及以上学历,5年以上测试开发或 AI 工程经验,其中 1 年以上 LLM / Agent 工程实践经验; 2.工程基础扎实,熟练掌握 Python / Go / Java 至少一门,具备中大型系统架构设计与落地经验; 3.熟悉 LangGraph / AutoGen / MCP 等 Agent 框架,理解 Context Engineering…
工作职责
1.设计并落地面向云产品测试场景的多 Agent 协作架构与 Testing Harness 工程体系,支撑用例生成、代码转化、缺陷修复、自我评估等能力协同运行; 2.将用例生成、执行转化、运行校验、置信度评估、根因定位、报告洞察等能力封装为标准化 Skill / MCP,建设跨产品线复用的智能测试能力底座; 3.建设 Agent Context Learning 与端到端评测体系,量化 AI 对测试效率、质量和 Agent 能力表现的实际提升; 4.推动 AI 能力集成到 CI/CD 流水线,形成智能化测试左移与右移闭环; 5.沉淀 AI 时代云产品测试方法论、工程规范和最佳实践,推动团队测试模式升级。

1、负责 AI Agent 平台的测试体系建设,设计和实现用例自动生成、缺陷根因分析、测试执行编排等 Agent,打造智能化质量保障平台; 2、建立 LLM 应用的测试方法论和评估体系,应对非确定性输出的测试挑战,覆盖 Prompt、RAG、Function Calling、多轮对话等场景的专项测试; 3、深入理解复杂业务系统,设计有效的测试策略和自动化框架,参与全站架构升级中的可测性建设和稳定性保障,支撑千万级用户的业务质量; 4、探索 AI 驱动的测试新范式,沉淀 Agent 协作框架、智能测试工具、模型评估体系等技术方案,推动测试工程智能化转型。

* 负责企业级 AI Agent 产品的功能测试、自动化测试及质量保障,参与产品全生命周期测试工作; * 搭建和维护 Web UI 自动化测试框架,编写自动化测试脚本,持续提升自动化测试覆盖率和稳定性; * 建设 Agent 自动评测体系,设计评测数据集、评测用例及评测指标,持续评估模型、 Agent 效果,支持版本效果对比与质量分析; * 负责 API、Web 及 Agent 服务的性能测试,分析系统瓶颈并推动性能优化; * 参与测试平台、评测平台及相关测试工具的开发与维护,推动自动化测试、评测体系与 CI/CD 流程集成; * 熟练运用 Cursor、Claude Code 等 AI 开发工具提升测试研发效率,包括自动生成测试代码、测试数据、测试计划及缺陷分析报告,利用 AI 辅助日志分析、链路溯源、根因定位、失败复现以及 LLM-as-Judge 评测规则构建,持续推动测试智能化; * 负责测试体系建设及团队管理,制定测试规范和质量标准,推动团队技术成长与工程效能提升,保障测试工作的高质量交付。
1. 负责建立多维度Agent评测指标体系与自动化评估框架,覆盖事实性、逻辑性、安全性及业务适配性等核心能力边界; 2. 构建高管决策等真实业务场景的专项评测集,通过挖掘高频Query与合成对抗性数据,确保评测基准的鲁棒性与权威性; 3. 持续监控Agent线上回答准确率与响应质量,利用全链路追踪工具定位幻觉、检索偏差等问题的根因并输出量化分析报告; 4. 推动语义层和数据层的持续优化迭代,协同算法与数据团队完善NL2SQL解析能力及知识库治理,从源头提升RAG系统的召回准确率; 5. 负责非结构化业务文档的结构化沉淀与知识萃取,将分散的业务术语、指标口径转化为Agent可精准理解与调用的标准化语义资产; 6. 熟悉大模型训练与推理流程(如SFT、RLHF),设计高质量的微调数据集与Bad Case修复方案,驱动模型在特定垂直领域的效果持续提升; 7. 掌握主流Agent开发框架(如LangChain、LlamaIndex)与自动化测试工具链,构建高并发下的Agent稳定性测试与回归测试机制。
1、构建电商Agent核心大脑与前沿技术落地:探索主流Agent框架,如LangGraph、OpenClaw、Hermes、Codex、Claude Code等,构建稳定可靠的Valley-Agent基座,重点提升任务的自动规划与调度、工具调用、多模态交互及深度研究能力;持续追踪AI Agent领域的最新进展(如Codex,OpenClaw,Hermes,ClaudeCode等),引入并验证新技术的可行性,沉淀技术文档与最佳实践,推动前沿技术在国际电商治理场景的创新应用; 2、打造电商场景Skills工具集:基于电商业务系统,构建和优化一系列高性能、可复用的Skills。这包括利用小尺寸模型打造支撑高QPS场景的基础模型工具集,也包括将复杂的业务SOP(标准作业程序)封装为稳定可调用的治理Agent(如审核、RCA、立规Agent); 3、研发与优化Agentic RL:基于主流Agent框架,并结合Post-training技术(SFT/RLHF)与强化学习(PPO/GRPO)对模型进行持续优化,建立电商大模型的Agentic RL训练体系,提升模型在复杂问题上的准确率与动态反思能力; 4、探索Agent自动化与自进化:结合Auto-Workflow与多智能体系统(MAS),一方面支持工作流的自动生成与优化,另一方面探索基于Agentic RAG和Memory机制的自进化(Self-Evolution)闭环,让Agent能够从真实交互数据中学习,持续提升其决策与执行能力; 5、构建稳定可靠的Agent基础设施:负责Agent系统的性能与稳定性优化,包括资源利用、QPS、成本控制、环境交互速度等,并沉淀通用能力,构建包含可观测性与权限体系的Agent Infra,保障系统的安全可控。