小红书数据采集/爬虫工程师
社招全职3-5年端点防护地点:北京 | 上海 | 杭州状态:招聘
任职要求
1、本科及以上学历,计算机、软件工程、信息安全等相关专业; 2、具备 App 端逆向分析经验,熟悉移动端接口分析、协议分析、参数生成逻辑等; 3、或者具备 Web 端逆向分析经验,熟悉 JavaScript 逻辑分析、接口调用…
登录查看完整任职要求
微信扫码,1秒登录
工作职责
负责互联网公开内容数据的自动化采集、清洗、结构化处理和质量治理,为业务情报分析、知识库建设及大模型训练提供稳定、高质量的数据支持。
相关职位
社招5-10年J0012
1、主导大模型数据采集方向的技术选型与架构设计,制定采集系统的中长期技术演进路线图,推动系统性建设及规模化落地; 2、带领团队攻克复杂采集场景下的技术难题,包括大规模分布式爬取、动态渲染页面处理、反爬对抗、App逆向解析等,保障大模型训练数据供给的稳定性与质量; 3、统筹数据采集全链路设计——涵盖任务调度、分布式采集、内容结构化解析、数据清洗与持久化,持续优化系统吞吐量、稳定性与成本效率; 4、建立团队编码规范、数据质量标准及安全合规体系(遵循 robots 协议、数据安全相关法规),推动工程化建设与最佳实践落地; 5、与大模型训练、数据标注、平台工程等团队紧密对齐需求,作为技术接口人协调资源、推动项目交付。
更新于 2026-06-18北京
社招3-5年J0012
1、遵循robots协议,采集互联网上允许搜索爬虫采集的公开非敏感信息,满足大模型、电商、本地等公司核心业务数据需求; 2、负责分布式采集系统的建设与迭代优化,负责数据调度、采集、数据结构化、持久化全链路核心流程迭代升级; 3、帮助团队攻克各种采集技术难关,提升系统的采集效果与效率。
更新于 2026-06-15北京
社招3-5年J0012
1、遵循robots协议,采集互联网上允许搜索爬虫采集的公开非敏感信息,满足大模型、商业化等核心业务数据需求; 2、负责分布式采集系统的建设与迭代优化,负责数据调度、采集、数据结构化、持久化全链路核心流程迭代升级; 3、帮助团队攻克各种采集技术难关,提升系统的采集效果与效率。
更新于 2026-06-18北京
