logo of mihoyo

米哈游AI评测工程师(LLM方向)

社招全职程序&技术类地点:上海 | 北京状态:招聘

任职要求


1. 本科及以上学历;
2. 熟练掌握 Python,具备较强工程能力与代码能力;
3. 具备较强的问题分析能力、实验设计能力与自主探索能力;
4. 有大模型评测相关经验,包括但不限于评测框架开发、Benchmark …
登录查看完整任职要求
微信扫码,1秒登录

工作职责


我们希望你参与
 
1. 建设可持续演进的大模型评测体系;
2. 提升评测自动化程度与评测效率;
3. 推动评测数据、评测框架与评测方法持续迭代;
4. 用系统化评测驱动模型能力提升。

1. 负责大语言模型(LLM)评测体系建设,包括评测方案设计、评测指标定义、评测流程标准化等,建立可持续演进的评测能力体系;
2. 负责评测框架开发与维护,建设自动化、可扩展、高可靠的评测系统,提高评测效率与覆盖度;
3. 负责 Public Benchmark 与 In-house Benchmark 的建设与维护,包括评测集构建、数据清洗、版本管理、持续迭代与优化;
4. 根据模型迭代重点与业务需求,持续补充评测维度,动态优化评测集结构,提升评测集有效性与区分度;
5. 深入分析模型能力边界与问题分布,识别模型优势、短板与退化风险,建立问题发现与质量拦截机制;
6. 跟踪行业模型发展趋势,对主流模型进行横向评测与能力分析,量化模型能力变化与行业水平;
7. 参与模型训练与迭代过程中的评测建设,支撑模型研发闭环。
包括英文材料
学历+
还有更多 •••
相关职位

logo of mihoyo
社招程序&技术类

我们希望你参与 * 建设可持续演进的大模型评测体系; * 提升评测自动化程度与评测效率; * 推动评测数据、评测框架与评测方法持续迭代; * 用系统化评测驱动模型能力提升。 1. 负责大语言模型(LLM)评测体系建设,包括评测方案设计、评测指标定义、评测流程标准化等,建立可持续演进的评测能力体系; 2. 负责评测框架开发与维护,建设自动化、可扩展、高可靠的评测系统,提高评测效率与覆盖度; 3. 根据模型迭代重点与业务需求,持续补充评测维度,动态优化评测集结构,提升评测集有效性与区分度; 4. 深入分析模型能力边界与问题分布,识别模型优势、短板与退化风险,建立问题发现与质量拦截机制; 5. 跟踪行业模型发展趋势,对主流模型进行横向评测与能力分析,量化模型能力变化与行业水平; 6. 参与模型训练与迭代过程中的评测建设,支撑模型研发闭环。

上海|北京
logo of mihoyo
校招程序&技术类

我们希望你参与 1. 建设可持续演进的大模型评测体系; 2. 提升评测自动化程度与评测效率; 3. 推动评测数据、评测框架与评测方法持续迭代; 4. 用系统化评测驱动模型能力提升。 1. 负责大语言模型(LLM)评测体系建设,包括评测方案设计、评测指标定义、评测流程标准化等,建立可持续演进的评测能力体系; 2. 负责评测框架开发与维护,建设自动化、可扩展、高可靠的评测系统,提高评测效率与覆盖度; 3. 负责 Public Benchmark 与 In-house Benchmark 的建设与维护,包括评测集构建、数据清洗、版本管理、持续迭代与优化; 4. 根据模型迭代重点与业务需求,持续补充评测维度,动态优化评测集结构,提升评测集有效性与区分度; 5. 深入分析模型能力边界与问题分布,识别模型优势、短板与退化风险,建立问题发现与质量拦截机制; 6. 跟踪行业模型发展趋势,对主流模型进行横向评测与能力分析,量化模型能力变化与行业水平; 7. 参与模型训练与迭代过程中的评测建设,支撑模型研发闭环。

上海|北京
logo of mihoyo
实习程序&技术类

我们希望你参与 1. 建设可持续演进的大模型评测体系; 2. 提升评测自动化程度与评测效率; 3. 推动评测数据、评测框架与评测方法持续迭代; 4. 用系统化评测驱动模型能力提升。 1. 负责大语言模型(LLM)评测体系建设,包括评测方案设计、评测指标定义、评测流程标准化等,建立可持续演进的评测能力体系; 2. 负责评测框架开发与维护,建设自动化、可扩展、高可靠的评测系统,提高评测效率与覆盖度; 3. 负责 Public Benchmark 与 In-house Benchmark 的建设与维护,包括评测集构建、数据清洗、版本管理、持续迭代与优化; 4. 根据模型迭代重点与业务需求,持续补充评测维度,动态优化评测集结构,提升评测集有效性与区分度; 5. 深入分析模型能力边界与问题分布,识别模型优势、短板与退化风险,建立问题发现与质量拦截机制; 6. 跟踪行业模型发展趋势,对主流模型进行横向评测与能力分析,量化模型能力变化与行业水平; 7. 参与模型训练与迭代过程中的评测建设,支撑模型研发闭环。

上海|北京
logo of alibaba
实习阿里巴巴日常实习

作为大模型评测研发工程师,将负责“大模型通用Benchmark评测体系”与“业务领域Benchmark构建”的全链路研发:从评测数据集设计、智能化自动化评估方法探索研究、指标实现,到平台化落地,精准衡量模型能力边界,持续驱动模型语料优化与模型迭代。 1、通用 Benchmark 研发: • 持续迭代覆盖语言理解、推理、知识、幻觉、对齐、代码、多模态、Agent 等各个维度的自动化评测框架; • 研究并实现更贴合业务发展的评测方法与指标,构建高效、可扩展、可复现、可解释的评测引擎; 2、业务领域 Benchmark 构建与评测: • 深入跨境多个垂直业务领域,构建领域Benchmark,真实反馈模型业务表现; • 设计场景化评估方案,如RAG、Agent、COT、 In-Context Learning等,并形成端到端评测能力; 3、评测方法研究: • 探索基于 LLM-as-a-Judge、人类偏好对齐、模型解释性等前沿评测技术; • 跟踪 ACL / EMNLP / NeurIPS / ICML / ICLR 等会议,高效复现SOTA方法,形成可比对可参考的评估系统。

更新于 2026-04-13杭州