阿里巴巴数据技术及产品部-数据采集合规与治理工程师-爬虫方向
任职要求
1. 5 年以上后端、爬虫平台、搜索引擎、数据平台、数据治理、安全合规或 AI 数据工程经验,有复杂系统设计和跨团队项目推进经验。 2. 熟悉大规模网页采集系统,理解 URL 调度、网页解析、内容抽取、去重、分布式任务调度、访问控制、日志留存和数据入湖链路。 3. 熟悉数据血缘、元数据管理、审计日志、数据版本、权限控制、数据生命周期管理等工程体系。 4. 具备合规工程能力,能够把法律、政策、安全或监管要求拆解成系统规则、数据字段、控制点、审批流程和监控指标。 5. 理解基础模型训练数据流程,包括采集、清洗、过滤、去重、采样、版本管理、训练集构建和模型版本关联。 6. 熟悉数据安全、隐私保护、版权治理、公开网络数据治理或监管审计中的至少一个方向。 …
工作职责
1. 负责公开网络数据采集链路的合规治理体系建设,覆盖数据源准入、采集策略、采集留痕、数据处理、入库、训练集构建和后续排除机制。 2. 建设爬虫数据证据链与数据血缘系统,记录 URL、域名、获取时间、来源类型、访问决策依据、内容哈希、处理流程、风险标签、数据集版本、模型训练版本和审计日志。 3. 建立网络采集合规控制机制,包括机器可读访问限制、站点访问策略、频率控制、来源留痕、异常监控、争议处理和数据下架流程。 4. 与法务团队协作,将版权、TDM opt-out、站点条款、授权边界、权利人投诉、数据删除请求等要求转化为系统规则、审批流程和可追溯记录。 5. 与安全、隐私和合规团队协作,建立爬虫数据风险管理机制,包括敏感数据识别、PII 过滤、来源风险分级、黑白名单、人工复核、访问控制和异常告警。 6. 牵引公开网络数据的准入和分级管理,对不同类型站点、内容类别、数据用途、地域风险和权利状态建立统一评估标准。 7. 建设面向欧盟监管检查和客户尽调的技术支撑能力,包括训练数据来源摘要、版权政策执行记录、采集留痕、风险处置记录和审计报表。 8. 推动爬虫平台、数据平台、模型训练平台、法务、安全团队之间的系统打通,确保数据从采集到训练使用全链路可解释、可追溯、可处置。 9. 支持风险事件复盘和外部问询,能够快速回答“数据从哪里来、为什么可以采、是否进入训练集、如何排除或删除”等问题。
1. 数据资产体系建设:负责域外数据、位置数据、企业数据三大场景的智能化升级,设计并实现从数据采集、治理到服务化的完整链路,推动团队从传统"数据供应"模式向"智能能力输出"转型,直接支撑经营控比、采购数据验收、AI-Native 产品等核心业务场景。 2. AI-Native 架构从 0 到 1 建设:参与大模型与数据研发融合的架构设计,负责 LLM Agent 任务编排、多轮上下文管理、Human-in-the-Loop 决策机制的实现与优化,建立 Prompt 工程规范、Agent Eval 体系及 badcase 自动化排查与自愈闭环,确保技术成果在电商/AI 核心业务中快速落地。 3. 多模态数据与知识体系建设:负责文本/音频/图像/视频等多模态数据的检测、异常识别与相似度计算,设计数据质检与验收标准;同时主导知识抽取与本体建模工作,包括命名实体识别、关系抽取、实体对齐等技术落地,构建 Schema 设计与图数据库应用,打造语义资产体系。
1、基于Agent能力建设验收平台功能,推动规则引擎与自动化工具落地。 2、负责多模态数据验收流程设计与标准制定。 3、搭建数据去重与AI检测Pipeline,保障验收质量与效率。 4、协同供应商、领域专家与业务方,优化人机协同验收与交付闭环。 5、沉淀验收资产,构建质量评估与数据资产分级体系。
1. 研发具身场景自动标注与数据质量评估算法,覆盖运动、感知、具身规划等多层标注及多模态对齐,构建标注自动校验与质量评分体系。 2. 研究 Data-Centric AI 前沿方法(数据混合优化、主动数据选择、数据影响函数等),通过消融实验、归因分析等手段量化不同数据源对模型性能的边际贡献,探索具身场景下的数据 scaling law。 3. 基于价值量化结果制定并迭代训练数据配方(来源配比、质量阈值、规模规划),为数据飞轮的资源分配提供量化依据。 4. 负责具身数据预处理流程的算法设计,包括多模态对齐、轨迹平滑、异常检测与清洗等环节的规范化与自动化。