蚂蚁金服【Plan A】AI工程师-大模型评测(实习)
任职要求
1. 核心参与过业界知名的开源评测项目或 Benchmark 建设; 2. 在 NeurIPS、ICML、ACL、EMNLP 等相关顶会发表过高质量…
工作职责
1. 评测体系设计与平台化落地:主导设计数据驱动的LLM/多模态/Agent评测体系,建设自动化评测分析能力,支持在平台上完成评测任务的适配、调度与规模化分析; 2. 评测洞察与缺陷定位:基于对抗性分析、错误归因、能力边界挖掘等方法,系统定位模型在金融、医疗、小程序/APP等场景的核心短板,推动形成“评测-反馈-优化”的技术闭环; 3. Benchmark与数据资产建设:负责评测数据采集、清洗、标注、版本管理与标准制定,构建高质量、多样化的Benchmark资产; 4. 前沿评测范式探索:追踪全球前沿Benchmark与评估技术,研究RLHF/DPO等对齐数据驱动的新评估范式,探索仿真环境、Agent链路评测等新方法,保持技术领先。
1. 评测体系设计与平台化落地:主导设计数据驱动的LLM/多模态/Agent评测体系,建设自动化评测分析能力,支持在平台上完成评测任务的适配、调度与规模化分析; 2. 评测洞察与缺陷定位:基于对抗性分析、错误归因、能力边界挖掘等方法,系统定位模型在金融、医疗、小程序/APP等场景的核心短板,推动形成“评测-反馈-优化”的技术闭环; 3. Benchmark与数据资产建设:负责评测数据采集、清洗、标注、版本管理与标准制定,构建高质量、多样化的Benchmark资产; 4. 前沿评测范式探索:追踪全球前沿Benchmark与评估技术,研究RLHF/DPO等对齐数据驱动的新评估范式,探索仿真环境、Agent链路评测等新方法,保持技术领先。
部门介绍: 蚂蚁AReaL会探索和构建高性能的 AI 自学习基础系统,让语言交互、智能体、具身智能等各类 AI场景都能基于这个基础系统走向高效的自我演进,迈向更高的智能水平。 职位描述: 1. 探索和研究新一代Agent Infra计算系统,寻求从训推并行到Agent Self-Evolution的系统创新,实现大规模多智能体交互场景下的极致Token Effiencicy; 2. 以“Agent+RL”范式构建新一代面向Agent Infra的强化学习框架,实现多轮交互、过程奖励、大规模模拟环境等,支持各类智能体和搜索场景学习能力提升; 3. 探索结合AI硬件下的Agent Runtime技术创新。
1. 构建文本、图文、音视频等非结构化数据的结构化、标准化的数据处理能力,构建涵盖解析、召回、去重、去毒等多环节的高质量数据处理算子,参与大模型数据处理工程平台建设,推动业务和技术的融合落地; 2. 熟练应用 prompt 工程、sft 等技术等,对业界的数据合成、数据优化等新前沿数据处理方法保持持续的追踪,建立针对大模型的数据质量和效果评估方法,持续提高数据质量和多样性,安全性,有用性; 3. 实时跟进大模型发布进展,引入有价值的 benchmark,为 scaling&alignment 提供鲁棒的实验观测指标,深度参与 llm 模型效果优化,加速数据系统迭代流程; 4. 作为大模型的调教师推进数据构建、评估以及优化。如根据需求制定详实的数据标注、合成、采集等标准,并对数据集进行质量检查和标准迭代,测评模型能力边界,并从数据视角提出优化方案。 📝 你将负责什么? ● 构建“数据工厂”: 研发自动化处理算子,将海量文本、图文、音视频转化为模型可吸收的高能“养料”。 ● 探索数据前沿: 追踪业界最新的数据合成与优化方案,提升数据的质量、多样性与安全性。 ● 扮演“调教师”: 制定标注与采集标准,测评模型边界,从数据视角给出模型进化的方案;引入多样的 Benchmark,驱动数据引入反馈加速模型迭代。
1. 构建文本、图文、音视频等非结构化数据的结构化、标准化的数据处理能力,构建涵盖解析、召回、去重、去毒等多环节的高质量数据处理算子,参与大模型数据处理工程平台建设,推动业务和技术的融合落地; 2. 熟练应用 prompt 工程、sft 等技术等,对业界的数据合成、数据优化等新前沿数据处理方法保持持续的追踪,建立针对大模型的数据质量和效果评估方法,持续提高数据质量和多样性,安全性,有用性; 3. 实时跟进大模型发布进展,引入有价值的 benchmark,为 scaling&alignment 提供鲁棒的实验观测指标,深度参与 llm 模型效果优化,加速数据系统迭代流程; 4. 作为大模型的调教师推进数据构建、评估以及优化。如根据需求制定详实的数据标注、合成、采集等标准,并对数据集进行质量检查和标准迭代,测评模型能力边界,并从数据视角提出优化方案。 📝 你将负责什么? ● 构建“数据工厂”: 研发自动化处理算子,将海量文本、图文、音视频转化为模型可吸收的高能“养料”。 ● 探索数据前沿: 追踪业界最新的数据合成与优化方案,提升数据的质量、多样性与安全性。 ● 扮演“调教师”: 制定标注与采集标准,测评模型边界,从数据视角给出模型进化的方案;引入多样的 Benchmark,驱动数据引入反馈加速模型迭代。