logo of alibaba

阿里巴巴1688-评测算法工程师-Agentic AI

社招全职2年以上地点:杭州状态:招聘

任职要求


- 计算机科学/AI等相关专业硕士及以上学历,对agentic ai/ LLM技术高度热情;
- 精通Python编程,熟练掌握PyTorch/TensorFlow等深度学习框架;
- 熟悉主流语言大模型技术…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


- 构建并完善大模型评测体系,包括评测标准制定,评测工具链开发和评测数据集建设;
- 基于agentic业务需求设计评测方案,开展多维度模型评估,输出专业评测报告;
- 参与Agent /工具调用 在垂直领域的算法工程化实现及性能评估研究;
- 沉淀业务专家知识到 reward/critic 层面实现LLM-as-judge,沉淀长链数据资产;
包括英文材料
学历+
大模型+
Python+
还有更多 •••
相关职位

logo of mi
社招A11945

1、参与自动驾驶行车、泊车和数据自动标注等项目的模型评测相关工作; 2、设计与实现模型评测相关指标; 3、在测试环节中拉通上下游共识,保障项目质量; 4、设计并主导全流程自动化落地实施;

更新于 2025-09-24武汉
logo of kuaishou
社招3-5年J0011

1、负责LLM、VLM、搜索推荐等大模型日常评测工作和评测体系建设,包括但不限于设计制定和完善评测方案、评测指标、评测数据收集和更新、评测执行,并输出专业评测报告,深度参与算法效果分析、挖掘问题归因; 2、以算法手段,对基座大模型、应用大模型以及AI产品进行分阶段、端到端效果评测,持续跟踪行业前沿发展,并进行竞品对比; 3、从可解释性角度探索提出更多更深入的基于模型内在机理的评测基准以及评测框架,包括通用能力、智能应用,如Agent、OpenClaw、CoWork等; 4、探索智能、高效的模型自动化评估方案,参与自动化评测工具设计、开发及维护; 5、提出更好的Benchmark,定义模型能力,定义AGI,并在相关会议或期刊发表; 6、站在用户角度,对产品、算法提出建设性的意见,在评测参与的各个流程中以用户视角保证产品体验。

更新于 2026-04-27北京
logo of tencent
社招2年以上企业微信SaaS

1.针对企业微信AI模型的特点,持续构建完善的评测基准,包括但不限于NLP、ASR、MLLM等领域,有效指导算法优化方向; 2.负责评测数据的自动化生产能力构建:基于数据泛化等能力,构建领域增强型评测数据集生产链路,支持多模态场景的自动化数据扩增与效果验证; 3.负责自动化评测与归因分析:探索并实现自动化评测与模型缺陷归因机制。

更新于 2026-06-09广州
logo of baidu
社招5年以上MEG

-负责医疗健康场景下 LLM / VLM / Agent 等模型评测体系建设,设计数据驱动、可复现、可扩展的评测框架,覆盖医学问答、健康科普、辅助问诊、报告解读、用药咨询、多模态理解等核心场景 -探索并落地智能化、平台化评测能力,包括 LLM-as-Judge、自动化弱项挖掘、医疗风险识别、模型对比分析、评测任务调度、指标看板、评测报告生成和多模型多版本回归分析 -基于评测结果开展模型误差归因与能力诊断,构建可复用的 case mining、error analysis 和能力边界分析方法,沉淀自动化诊断与质量监控能力,反向指导模型训练、post-training、prompt 和产品策略优化 -持续跟踪医疗大模型、医学知识评测、多模态医疗理解、Agent 评测、RAG 评测、用户模拟评测等前沿方法,结合真实医疗健康业务场景建设评测范式,为模型迭代和产品上线提供质量决策依据

更新于 2026-07-09北京