logo of liauto

理想汽车模型评测工程师-北京

实习兼职软件测试地点:北京状态:招聘

任职要求


1、统招硕士学历,计算机、软件工程、人工智能等相关专业;
2、Python基础扎实,熟练掌握常用语法与数据结构,具备基本工程开发能力;
3、参与过大模型评测、对话标注、prompt 工程、数据集构…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


1、参与多模态大模型的评测工作,设计评测指标、评测集以及评测方案;
2、搭建与执行自动化评测流程,包含数据标注、模型效果打分、评测报告,支撑模型版本迭代与上线决策等工作;
3、跟踪行业模型发展与评测技术,优化评测体系与工具链;
4、协同研发及产品团队,定位模型短板,输出优化建议与迭代方向。
包括英文材料
学历+
Python+
还有更多 •••
相关职位

logo of alibaba
社招2年以上技术类-算法

1.评测集自动构建技术:研究跨模态通用的评测集自动生成方法,构建不同模态(文本/图像/视频/音频/3D 等)评测集生产框架;研究动态评测集与抗污染技术,解决各模态静态评测集被"刷榜"后失效的通用问题;探索面向模型弱点的定向探测数据生成,通过错误模式分析自动生成针对性测试样本。 2.自动裁判技术:构建多模态通用的自动评判算法框架,统一支撑文本质量评判、生成内容质量评估、交互过程评估等不同评判范式,设计可插拔的评判策略组件;研究LLM as a judge及Agent as a judge,支撑 Agent 轨迹的中间步骤质量评估、推理链路正确性验证、世界模型的时序物理一致性检验等既需要结果评分也需要过程评分的评判场景。 3.Agent评测技术:设计Coding Agentic应用的端到端评估算法,包括多轮对话质量建模、用户意图满足度预测、任务完成率估计等;研究评测信号与用户真实体验的对齐技术,通过线上行为数据反标定离线评测指标的有效性,构建离线评测可预测线上表现的校准模型。

更新于 2026-06-09北京|杭州
logo of alibaba
社招3年以上

负责大模型评测体系的工程建设与日常运维,搭建高效、稳定、可复现的评测运行环境。具体包括: 1. 接入并适配主流开源评测集,完成数据解析、沙箱搭建及评分逻辑对齐。 2. 针对代码及Agentic类评测集,构建安全可控的代码执行环境,包括定制容器化沙箱、资源隔离、超时控制等,保障多语言代码编译与运行的正确性和安全性。定制端到端的 Agent 运行环境,包括模拟交互界面、文件系统、终端、浏览器等依赖组件,确保 Agent 能在真实或仿真场景中完成多步骤任务。 3. 接入和适配 Agent 评测框架,实现评测流程的标准化和自动化调度。 4. 接入 MCP 工具层,为评测中的模型调用提供标准化的工具接口,支持工具注册、调用链路追踪和结果校验。 5. 维护评测基础设施的可观测性,建设评测结果的存储、对比与可视化看板,支撑研究团队的快速迭代需求。

更新于 2026-06-01北京|杭州
logo of alibaba
实习阿里巴巴2027

1.开展大模型模型指令遵循、推理、智能体等方向能力评测建设,基于评测的错误类型、分布,能针对性构建高质量数据,提高模型特定表现,并能够通过对数据有效性的评测,验证数据有效性; 2.建设基模及应用在指令遵循、推理、智能体等方向评测维度、指标体系、业务评测集并开展深入的评测分析工作。产出评测报告,学术benchmark等有影响力的创新工作。

更新于 2026-05-19杭州
logo of bytedance
社招3年以上A83740

1、负责AI产品相关的评测工作,包含AI算法的评测体系建设、评测集构建、以及相关评测工程化建设等; 2、负责建立AI助手等相关领域产品的端到端完整自动化评测机制,并构建自动化评测平台,提升评测效率,推动评测工程化和无人化; 3、负责AI算法的评测标准和评测流程制定,构建评测集,并推进评测执行,分析评测结果,对模型质量给予充分评估; 4、构建端到端的Agent评测体系,深入探索系统的评测方案,具备从多个维度、多个指标对Agent进行全面评估,为后续优化提供数据支持和决策依据; 5、不断探索和应用前沿的技术和方法,为团队带来创新思路和解决方案。

更新于 2025-09-22北京