logo of alibaba

阿里巴巴数据技术及产品部-AI数据工程师-LLM/VL方向

社招全职2年以上地点:北京 | 杭州状态:招聘

任职要求


1、AI + 数据双栈能力:精通 Python,熟悉 SQL/Shell;理解 LLM、音频/视频模型、多模态模型等基础原理;具有大模型数据构造、清洗、合成或质量评估相关实践经验;
2、多模态数据能力:熟悉文本,或图像/视频/音频中任一模态的特征工程、理解/分类/识别算法或质量建模方法;具备深度学习模型训练实践(PyTorch/TensorFlow);
3、数据工程基础扎实:熟悉主流大数据平台(Spark/Flink/MaxCompute/Hadoop/RAY);具备 ETL、数据建模、数据 Pipeline 或数据仓库建设经验;了解大规模文本/图像/视频数据处理者更佳;
4、AI Native 工作流思维:熟悉 AgentLLM 工具链,对如何将 LLM 融入数据生产、数据分析、数据治理流程有实…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


1、参与集团级 AI 数据引擎:负责文本、图像、视频、音频等全模态数据的采集、清洗、处理、治理与资产化管理,打造可复用、可观测、可解释的 EB 级数据体系,支撑大模型预训练与后训练的高质量数据供给;
2、多模态数据智能化处理:主导文本、图文、视频、文档、语音等模态的自动理解、标签体系构建、语义特征抽取、质量建模与自动化治理; 设计并训练分类、识别、caption、质量打分、预测等模型;
3、AI Native 数据 Pipeline 建设:使用 LLM + VLM + Agent 框架构建智能数据 Pipeline,实现分渠道采集、过滤、去重、质量诊断、标注/改写生成、调度编排与异常告警等环节的自动化,显著降低人力成本;
4、稀缺与高价值数据挖掘:面向网页/PDF/百科/私域/query 等文本场景,以及 real world(巡店/巡检/巡仓)、医疗、教育、OCR、GUI/多模态轨迹等视觉场景,通过"真实采集 + 人工标注 + 模型蒸馏 + 数据合成"四源策略,产出稀缺、高价值、差异化的数据集;
5、数据 & 模型闭环迭代:基于评测反馈的短板,设计对应的专项数据集与合成方案,在训练过程中构建可观测指标,量化数据对模型能力提升的贡献,动态更新数据集,实现"数据—模型—评测—数据"的循环优化;
6、算法与工程一体化协作:与模型团队协作,参与训练数据构造、数据反哺、短板挖掘与评测闭环建设,通过数据驱动模型能力提升,成为 AI 模型训练的数据核心驱动力。
包括英文材料
Python+
SQL+
Bash+
大模型+
特征工程+
算法+
深度学习+
PyTorch+
TensorFlow+
大数据+
Spark+
Hadoop+
还有更多 •••
相关职位

logo of alibaba
社招2年以上技术类-开发

1、深度参与Qwen-Image基模的数据处理、交付、评测完整链路, 助力模型成为全球最领先的图像生成/编辑模型; 2、通过agent框架,建设不同场景的数据合成链路,实现垂域高质量图片数据的规模化合成; 3、数据&模型闭环迭代:基于评测反馈的短板,设计对应的专项数据集,并在训练过程中构建可观测指标,量化数据对模型能力提升的贡献,动态更新数据集,实现数据 → 模型 → 评测 → 数据的循环优化; 4、构建海量的图片检索引擎,满足垂域数据的高质量检索需求; 5、与模型团队协作,参与训练数据构造、数据反哺、短板挖掘和评测闭环建设,通过数据驱动模型能力提升,成为AI模型训练的数据核心驱动力;

更新于 2026-06-24杭州
logo of alibaba
社招1年以上技术类-数据

1、参与集团级AI数据引擎:负责多模态数据(文本、音频、图像、视频)的采集、清洗、处理、治理与资产化管理,打造可复用、可观测、可解释的 EB 级数据体系,支撑大模型训练与推理的高质量数据供给; 2、多模态数据智能化处理:主导音频/视频/图像等模态的自动理解、标签体系构建、语义特征抽取、质量建模与自动化治理;设计并训练分类、识别、预测等多模态模型; 3、AI Native数据Pipeline建设:使用LLM+Agent框架构建智能数据Pipeline,实现数据分渠道过滤、去重、质量诊断、调度编排和异常告警等环节的自动化,显著降低人力成本; 4、数据&模型闭环迭代:基于评测反馈的短板,设计对应的专项数据集,并在训练过程中构建可观测指标,量化数据对模型能力提升的贡献,动态更新数据集,实现数据 → 模型 → 评测 → 数据的循环优化; 5、数据资产治理:负责元数据、数据血缘、分类分级、质量评分、数据标准、价值评估等治理框架的设计与落地,推动数据资产的可视化与可运营化,让数据可管理、可复用、可增长; 6、与模型团队协作,参与训练数据构造、数据反哺、短板挖掘和评测闭环建设,通过数据驱动模型能力提升,成为AI模型训练的数据核心驱动力;

更新于 2026-06-18杭州
logo of alibaba
社招2年以上技术类-数据

1、主导面向Agent的新型数据语义层架构设计与落地,推动数据资产从数据表向智能体可理解、可调用、可推理的消费模式演进; 2、负责端到端数据建模设计与开发交付,基于流批一体架构(Flink + Spark + Paimon)实现业务模型的统一构建与服务; 3、负责数据质量治理与链路稳定性保障,建立覆盖全链路的监控告警、血缘追踪,确保关键数据任务满足SLA要求;

更新于 2026-07-01杭州
logo of alibaba
社招3年以上技术类-开发

1、负责数据采购与治理:负责大模型的引入->结算链路治理与机制建设,通过技术方式解决各个环节问题,提升全链路时效 2、参与AI 能力建设:基于大模型设计智能数据分析与自动化系统,负责 Agent 任务规划、工具调用及运行时稳定性建设 3、跟进技术演进:跟踪 AI 工程化、RAG、实时数仓等前沿技术,推动自动化工具在数据采购与治理流程中的落地

更新于 2026-06-26杭州