logo of quark

千问千问C端事业群-大模型智能化评测专家-杭州/深圳/上海

社招全职3年以上技术类-质量保证地点:杭州 | 深圳 | 上海状态:招聘

任职要求


1. 3-5 年测试工作经验,有多模态算法/大模型/音视频/图像算法等之一工作背景,有服务端算法测试、大模型评测,数据集构造等测试经验;
2. 具有自然语言处理计算机视觉、语言大模型、多模态大模型大模型评测、AIGC等相关经验优先;
3. 能够主导大型项目的整体测试工作,包括测试分析、测试用例落地、…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


1. 负责智能互联多模态算法测试,熟悉算法工程全链路评测,可以独立设计如图像处理算法(如目标检测、图像识别、OCR等)的评测方案,数据集,评测工程等,确保算法精度与性能符合需求;
2. 建设通用的基于大模型场景下的模型评估体系、评测框架及基础评测能力的建设,包括评测集完备性,合理性建设,评测结果智能化判定,能够基于业务需求设计评测方案,开展多维度模型评估,输出专业评测报告;
3. 追踪大模型方向前沿进展,积极主动地学习和探索新的评测及分析的方法和技术。主导项目全链路质量保障和风险识别工作,搭建质量技术保障体系、制定质量保障规范、推进测试工作执行;
4. 协同项目中多角色、多合作团队形成积极有效的沟通和互动,驱动问题解决,保障交付质量。主动创新,通过技术手段解决质量保障工作中的复杂技术问题,提升测试效能、加深质量工作技术积累。
包括英文材料
算法+
大模型+
NLP+
还有更多 •••
相关职位

logo of aligenie
社招3年以上技术类-质量保证

1. 负责智能互联多模态算法测试,熟悉算法工程全链路评测,可以独立设计如图像处理算法(如目标检测、图像识别、OCR等)的评测方案,数据集,评测工程等,确保算法精度与性能符合需求; 2. 建设通用的基于大模型场景下的模型评估体系、评测框架及基础评测能力的建设,包括评测集完备性,合理性建设,评测结果智能化判定,能够基于业务需求设计评测方案,开展多维度模型评估,输出专业评测报告; 3. 追踪大模型方向前沿进展,积极主动地学习和探索新的评测及分析的方法和技术。主导项目全链路质量保障和风险识别工作,搭建质量技术保障体系、制定质量保障规范、推进测试工作执行; 4. 协同项目中多角色、多合作团队形成积极有效的沟通和互动,驱动问题解决,保障交付质量。主动创新,通过技术手段解决质量保障工作中的复杂技术问题,提升测试效能、加深质量工作技术积累。

更新于 2026-03-30深圳|杭州|上海
logo of meituan
实习核心本地商业-基

简介:随着 OpenClaw、Claude Code 等 Agent 进入实战领域,传统的静态评测已无法衡量 Agent 的长程规划、自主纠错与真实环境交互能力。我们寻找对 Agent 评测范式有独特见解的同学,共同定义下一代 Agent 的考卷。你将参与的工作有: 1、评测范式研究与落地: ①针对 OpenClaw 及 Claude Code 等主流 Agent,构建基于真实生产力场景,如自动化办公、复杂代码重构、多工具协同等的动态评测沙盒环境。 ②探索从“单轮对话”转向“长程任务”的评测机制,研究如何量化 Agent 的记忆一致性与环境感知力。 2、高价值方案产出: ①设计并构建能反映用户体感的评测集,不仅关注 通过率,更深入拆解用户在交互过程中的使用体验。 ②建立 Agent 错误归因体系,针对 Agent 陷入死循环、幻觉指令、工具调用失败等典型场景进行深度诊断。 3、未来形态探索: ①跟踪前沿 Agent 发展,研究在多智能体协同、自主进化等未来形态下的 Agent 形态和相应的评测基准。 ②利用 LLM/Agent-as-a-Judge 的方式,提升自动化评测的准确性与效率。

更新于 2026-04-03北京|上海
logo of kuaishou
校招J1017

1、参与大模型在软件测试领域的探索与落地 ,包括但不限于:智能测试用例生成、GUI自动化Agent、代码缺陷分析、多模态异常检测等创新方向;
 2、推动大模型与质量工程的结合 ,通过Prompt工程、微调(SFT)、强化学习(RL)等技术优化测试效率和系统稳定性;
 3、构建智能化评测体系 ,参与大模型(LLM、文生图/视频模型)的评测方案设计、效果评估与迭代优化;
 4、跟进AI领域前沿技术(如Agent框架、多模态分析、数据飞轮构建),探索在技术风险防控、故障根因定位等场景的应用;
 5、与业务测试团队协作 ,推动算法模型在真实业务测试或模型应用评测场景中的落地与持续迭代。

更新于 2025-10-22北京
logo of xiaohongshu
社招3-5年内容理解

1. 基于VLM/Agent等 AI 能力,融合图文/视频笔记的文本、图像、视频、音频等多维度信号,覆盖笔记、评论、账号、交易、直播等多体裁场景的国际化内容风险识别与处置,持续提升主动召回能力,实现风险、体验、效率的协同优化。 2. 建立并持续演进 Rednote 的内容特征体系与内容分级系统,输出结果应用于治理中的处置判罚、以及搜推流控等核心链路,为 Rednote 全球生态的内容质量与安全构建长期竞争壁垒。 3. 负责面向 Rednote 治理、内容理解、编辑等核心场景的 Agent 系统端到端研发,涵盖 ReAct / Tool Use / Multi-Agent 架构、意图理解与任务规划;深度参与 Agent 效果优化——从工具设计、上下文管理、编排策略到 Agentic RL 的 Post-Training,产出效果领先的 产品。 4. 深度参与LLM/VLM 的预训练、SFT、RL 等全链路训练,参与构建多模态内容理解、编辑、生成等 AI 基础能力,推动 AI 从技术到业务价值的闭环落地。 5. 持续追踪AI Agent领域的最新进展,引入并验证新技术的可行性,沉淀技术文档与最佳实践,推动前沿技术在rednote业务中的应用,保持团队的技术领先性;,沉淀国际顶会论文(CVPR/NeurIPS/ICLR/ACL 等)

更新于 2026-06-25北京|上海|杭州