logo of honor

荣耀AI评测工程师-UI自动化方向

社招全职3年以上研发类地点:深圳状态:招聘

任职要求


1、本科及以上学历,计算机相关专业,3年以上移动端测试开发或自动化测试框架开发经验。
2、精通至少一款移动端自动化测试框架(如 Appium、UIAutomator2、XCTest、adb/idevicedebug 等),深入理解(Android/iOS/HarmonyOS,任一个)系统机制与自动…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


1、负责端侧AI功能的自动化评测框架设计与研发,覆盖文本交互、语音交互以及多模态交互执行等多场景的端到端自动化测试,实现UI交互模拟、设备控制、系统级操作注入及性能数据采集等核心能力。
2、参与构建真机评测集群,实现多机型、多系统版本的并行自动化评测调度,保障评测环境的稳定性和评测结果的可信度。
3、将端侧自动化评测能力集成至CI/CD流水线,支持提测自动触发、结果自动回传及异常告警,提升端侧质量反馈效率。
包括英文材料
学历+
Android+
iOS+
还有更多 •••
相关职位

logo of alibaba
实习阿里巴巴日常实习

作为大模型评测研发工程师,将负责“大模型通用Benchmark评测体系”与“业务领域Benchmark构建”的全链路研发:从评测数据集设计、智能化自动化评估方法探索研究、指标实现,到平台化落地,精准衡量模型能力边界,持续驱动模型语料优化与模型迭代。 1、通用 Benchmark 研发: • 持续迭代覆盖语言理解、推理、知识、幻觉、对齐、代码、多模态、Agent 等各个维度的自动化评测框架; • 研究并实现更贴合业务发展的评测方法与指标,构建高效、可扩展、可复现、可解释的评测引擎; 2、业务领域 Benchmark 构建与评测: • 深入跨境多个垂直业务领域,构建领域Benchmark,真实反馈模型业务表现; • 设计场景化评估方案,如RAG、Agent、COT、 In-Context Learning等,并形成端到端评测能力; 3、评测方法研究: • 探索基于 LLM-as-a-Judge、人类偏好对齐、模型解释性等前沿评测技术; • 跟踪 ACL / EMNLP / NeurIPS / ICML / ICLR 等会议,高效复现SOTA方法,形成可比对可参考的评估系统。

更新于 2026-04-13杭州
logo of honor
社招3年以上研发类

1、负责AI评测体系的设计与落地,覆盖文本对话、语音助手、长任务规划等场景,建立可度量、可复用的评测框架与指标体系。 2、主导评测方案设计,负责构建评测数据集与评分标准,确保评测结论能够可置信。 3、基于AICoding工具开发评测脚本与工具链,包括评测数据构造脚本、自动化评测执行脚本、指标计算与统计分析脚本,推动评测流程自动化与批量化。 4、深度使用与体验手机助手AI产品,基于真实用户场景和Bad Case分析,敏锐识别质量短板与算法缺陷,输出有指导意义的评测分析报告,推动相关团队持续优化。

更新于 2026-06-15深圳
logo of anker
社招测试

1. 与算法、产品密切配合,共同制定视觉AI算法评测标准,设计测试方案与用例,包含感知、运动控制、决策等算法; 2. 熟悉智能硬件产品,专注视觉算法模块测试,构建贴近真实的测试环境,验证AI模型性能与边界能力,协同算法/嵌入式工程师迭代优化; 3. 数据驱动优化,面对不同类型产品,构建对应基于场景的标准化评测数据集,输出算法模型关键性能指标,进行badcase深度分析; 4. 评测体系搭建,建立标准化、可复用的AI模型评测流程与自动化工具链,提升测试覆盖率和效率; 5. 竞品分析:横向竞品AI能力评测,输出差异化分析报告,指导产品技术决策与卖点打造。

更新于 2026-03-24深圳
logo of dingtalk
实习钉钉日常项目实习

悟空事业部是阿里巴巴 ATH 战略下的 AI 原生工作平台,致力于将智能体能力深度融入企业工作流,重新定义 B 端的工作方式。我们正在构建一套评测驱动的智能体自进化闭环——以评测发现问题、反哺优化、验证效果,让 Agent 在持续迭代中越来越可靠。为此,我们需要招募细致严谨、对 AI 技术充满热情的人才加入我们! 【职位描述】 1、结合业界最佳实践与 B 端业务场景,通过专家设计和数据合成等手段,动态构建高质量评测集 2、负责评测任务的调度与执行监控,对评测结果进行审核与标注,输出质量报告,推动问题闭环 3、深入理解高频业务场景(电商、门店管理、资讯情报、数据分析等),针对性地构建专项评测集,设计可量化的评测标准 4、与产品、算法团队紧密协作,将评测中发现的问题和模式转化为优化方向,推动评测流程的持续改进

更新于 2026-03-31杭州