logo of tencent

腾讯资深AI评测工程师(多模态与 AIGC方向)

社招全职5年以上腾讯云技术地点:深圳状态:招聘

任职要求


1.教育背景:计算机、数学、数据科学等相关专业硕士及以上学历;
2.方法论深度:熟悉各类评测技术(如 A/B Testing, Elo Rating, LLM-as-a-Judge),能独立设计复杂的评测实验。了解 LLM、CV 及多模态模型的基本原理,知道模型在哪些地方容易“翻车”;
3.实战经验:有 Benchmark…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


1.Benchmark 构建与管理:负责高质量评测数据集的挖掘、清洗、标注与动态更新,设计长尾场景测试集,专门捕捉模型在极端或复杂指令下的失效点;
2.自动化评测流水线开发:搭建自动评测框架,集成主流开源评测工具(如 OpenCompass, VLMEvalKit 等)。开发基于模型的自动评分器,提升评测效率并保持与人工评价的高一致性;
3.AIGC 专项评测:建立图像/视频生成的质量评估体系,涵盖视觉效果、语义遵循、物理规律等维度,并解决生成内容的主观评价量化难题。
包括英文材料
数据科学+
学历+
大模型+
Prompt+
还有更多 •••
相关职位

logo of tencent
社招5年以上腾讯云-Codi

1.负责腾讯云AI Coding产品质量保障工作,深度参与产品质量体系建设,识别全链路上的质量风险,建立稳定性保障体系,推动稳定性建设落地; 2.腾讯云AI 产品相关的评测工作,包含AI算法的评测体系建设、评测集构建、以及相关评测工程化建设等; 3.负责AI算法的评测标准和评测流程制定,构建评测集,并推进评测执行,分析评测结果,对模型质量给予充分评估; 4.建设相关评测工具/平台,推动评测工程化和无人化。

更新于 2026-05-29北京
logo of transsion
社招3年以上

1、负责设计和建立全面、科学的大模型评测体系,涵盖性能、效果、安全性、可用性等多维度的指标与方法,持续追踪行业领先的大模型; 2、负责定义自研语音助手大模型和智能体的能力标准,构建评测体系和评测工具,对线上用户实际使用体验进行分析和跟踪; 3、负责横向与友商语音助手进行对比评测,分析产品优劣势,为产品迭代优化提供指导方向; 4、与模块产品、数据生产、标注、算法、测试团队通力合作,推动提升领域模型效果,牵引产品体验和能力提升;

更新于 2024-12-16上海
logo of netease
社招3-5年网易游戏(互娱)

1、负责企业级云原生机器学习平台建设,支撑模型开发、训练、部署、上线全生命周期管理; 2、负责机器学习平台核心组件落地与优化,包含分布式训练调度、模型版本管理、模型服务化推理部署; 3、负责 GPU 算力集群精细化运营,通过资源调度、弹性伸缩、异构算力管理,优化大模型训练 / 推理成本; 4、搭建平台监控、告警、可观测体系,保障机器学习集群及业务系统高可用、高稳定; 5、对接算法、业务团队,拆解需求并提供 MLOps 标准化平台解决方案。

更新于 2026-06-17广州
logo of transsion
社招5年以上

1.AI算法模型效果运营,包括: 1)负责ASR/NLU/NLP/CV等模型在真实业务中的效果监控与分析; 2)基于模型核心指标体系(如WER、CER、SlotF1等);持续跟踪模型在不同语言、不同设备、不同用户场景下的表现变化。 2.数据回流与模型优化闭环,包括: 1)主导模型运行数据的采集、分析、问题定位; 2)设计数据回流与样本筛选策略(错误样本、长尾场景、低置信度样本); 3)协同数据团队完成数据清洗、标注和质检,支持模型持续训练与优化。 3.多语言与本地化AI模型运营 1)针对多语言、多口音、多文化场景,制定模型运营与评测方案; 2)识别不同语言/国家的典型问题(如口音、语速、语义歧义); 3)与语言专家、本地团队合作,提升模型在海外市场的可用性和稳定性。 4.灰度发布与版本管理 1)参与模型版本的灰度发布、AB测试、效果对比与回滚策略; 2)评估模型版本升级对用户体验和业务指标的影响; 3)降低模型迭代带来的业务风险。 5.跨团队协作与方法论沉淀 作为算法团队x数据团队x产品团队的关键连接人,将业务问题转化为可执行的模型优化与数据需求;沉淀模型运营方法论、SOP和评估规范。

更新于 2026-02-27上海|重庆