蚂蚁金服蚂蚁集团-AI数据工程师-杭州
任职要求
基础要求: 1. 计算机、软件工程、系统科学与工程等相关专业本科及以上学历,毕业于海内外知名高校优先。有头部互联网公司大模型数据集经验优先。 2. 会用AI、善用AI,使用AI工具解决过某一专业场景的问题或参与AI相关项目研究/竞赛。 3. 理解大模型的应用与优化,能结合业务场景设计高效Prompt或微调方案,熟悉Agent工作流,具备多Agent协同开发经验更佳。 4. 精通Python/Java/Go编程及常用数据处理库(如Pandas, NumPy),熟练掌握至少一种大数据处理工具(如Spark, HiveSQL)。 5. 3年以上以上扎实的数据工程、数据仓库或后端开发经验,或者至少1年专注于大模型数据集建设、大规模文本数据清洗或相关…
工作职责
团队有数据语料建设/智能化数据研发与消费体系(风险、用户、资金、财务)/数据理解与发展/AI数据治理4大工作方向,主要岗位包括其中一项或多项: 1. 全力保障AGI业务达成:构建高效主动、科学可持续的AI数据资产与治理体系(全网URL库、DataMap、数据价值主动发现、GPU算力资源优化、语料价值评估与分析、AI通用语料沉淀),推动数据团队从被动服务向主动增长模式演进,助力AGI业务(如阿福、金融大模型、百灵等)高效、低成本达成目标。 2. 为业务增长提供核心驱动力:通过构建高质量、深度融合的“智能/价值资产基座”(用户智能化基座模型、商品标品化数据),系统性积累与扩充数据资产,并利用智能化应用范式充分释放数据价值,为业务增长提供核心驱动力。 3. 助力集团数据业务全面智能化转型:构建AI原生可理解、高品质、智能化的集团数据服务体系(风险、资金、财务),打造标品化产品数据解决方案,大幅提升数据研发的交付效率和业务决策效率,帮助集团业务更高效的从运营向智能化经营转型。 4. 前沿探索与工具开发:跟踪大模型数据领域的前沿技术(如数据合成、智能标注等),开发或引入先进工具,持续提升数据生产的效率与质量。
1. AI数据资产体系建设:负责核心AI数据资产体系,结合业务需求与数据算法能力,主导大数据的处理、解析、分析、挖掘、研发及优化工作。 2. 合成数据与数据多样性:主导结合场景的合成数据多样性生产: 探索基于 AI 模型的合成数据技术,主动解决特定领域(如逻辑推理、长尾语种)的数据稀缺问题。 3. 基于大模型做特征筛选、小模型蒸馏、小模型效果评估,主导欺诈评分等能力建设上。 4. 数据驱动的生产闭环:基于评测/资产结论,将其转化为工程层面的“数据增强策略”。通过反馈快速构建数据生产流程形成数据供给的闭环。 5. 持续跟踪及探索Data + AI方向的行业进展(如Data Agent、AIOps、湖仓一体智能优化等),主动开展技术预研与原型验证,推动先进技术在公司中的适配与规模化应用。
1、负责千问办公数据体系的建设,通过数据+工程化,赋能业务,提供全链路、可分析的业务服务能力;配置化、可复用的数据技术能力;更直观、更具指导性的产品化能力 2、大模型多模态AIData数据工程体系建设,探索实践面向各领域的高质量数据自动化清洗、标注、合成增强技术,设计并构建高效可扩展的数据飞轮(Data-Flywheel)闭环系统,为智能体和模型后训练提供高质量训练集和评测集 3、构建湖仓一体数据底座、智能问数Data Agent等核心能力,提升Data + AI 方面的技术竞争力

1. AI数据资产体系建设:负责核心AI数据资产体系,结合业务需求与数据算法能力,主导大数据的处理、解析、分析、挖掘、研发及优化工作。 2. 合成数据与数据多样性:主导结合场景的合成数据多样性生产: 探索基于 AI 模型的合成数据技术,主动解决特定领域(如逻辑推理、长尾语种)的数据稀缺问题。 3. 基于大模型做特征筛选、小模型蒸馏、小模型效果评估,主导欺诈评分等能力建设上。 4. 数据驱动的生产闭环:基于评测/资产结论,将其转化为工程层面的“数据增强策略”。通过反馈快速构建数据生产流程形成数据供给的闭环。 5. 持续跟踪及探索Data + AI方向的行业进展(如Data Agent、AIOps、湖仓一体智能优化等),主动开展技术预研与原型验证,推动先进技术在公司中的适配与规模化应用。
我们在做面向真实跨境贸易场景的 AI Agent,覆盖买家采购、商家经营、Research、商品发布、跨平台运营、物流跟踪等复杂任务。 岗位核心不是传统数仓/ETL,而是构建 Agent 训练数据、轨迹数据、评测数据与数据闭环系统。 你会做什么 1. 搭建 Agent / LLM 数据生产 Pipeline:采集、清洗、切分、去重、结构化、版本管理。 2. 构建 SFT、Preference、Tool Use、Function Call、多步规划、任务轨迹等训练数据。 3. 从 Query、对话、商品、行为日志、操作轨迹中挖掘高价值样本。 4. 建设 Agent Benchmark / Eval 数据集,覆盖任务完成率、工具调用准确率、多语言质量等。 5. 建立数据质检、抽检、异常发现、标注协同与自动化评测机制。 6. 和算法/产品/工程一起做“数据-训练-评测-线上反馈”闭环。