logo of zhihu

知乎爬虫工程师

社招全职1年以上地点:北京状态:招聘

任职要求


1、1年以上爬虫工作经验,本科及以上学历,能够独立承担爬虫工作;
2、熟悉整个爬虫的设计及实现流程,熟练掌握 Python 语言,熟悉常见的爬虫框架
3、有各大主流网站逆向经验,对反爬虫技术有深入理解,具备应对反…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


1、从事网页数据采集的技术工作
2、负责设计爬虫策略及反爬突破,提升数据采集效率、完整度和稳定性;
3、爬虫系统以及相关工具设计与研发
包括英文材料
学历+
还有更多 •••
相关职位

logo of ctrip
社招2年以上住宿业务开发

1.负责分布式网络爬虫系统的设计与开发工作。2.对多平台数据源(WEB/APP/H5/小程序等)进行数据采集及分析。3.通过逆向、图像识别、行为分析等技术提升爬虫核心技术突破。4.设计数据采集策略,提升数据采集效率及质量。

更新于 2025-10-21上海
logo of mihoyo
社招3年以上国际化类

1、遵循robots协议,爬取互联网上允许爬虫采集的公开信息; 2、参与爬虫平台架构设计与基础建设,维护爬取及数据处理任务,保障各类渠道数据的稳定性与正确性; 3、攻克各种爬虫技术难关,提升爬虫平台效果与性能; 4、支持业务团队的数据采集、渠道接入及系统维护等需求,实现数据驱动的业务增长。

上海
logo of zhihu
社招5年以上

1. 负责知乎客户端(包括且不限于 PC/H5、Android、IOS、小程序等)反爬升级,保护业务资产不被非法获取。 2. 负责推动防护能力迭代升级,推动反爬治理能力有效落地。

更新于 2026-05-14北京
logo of mihoyo
社招5年以上程序&技术类

主导设计统一的通用网页爬取框架,构建高并发分布式爬取系统,覆盖网页、论坛、社交媒体、文档、视频/音频转写等多模态数据源。 负责抓取后的数据落地、分片存储、内容解析(HTML/JSON/多语言文本/字幕/评论流等)与去重,与数据清洗、内容质量、采样与训练团队协作,实现端到端可追溯的数据管线。 规划爬虫集群、代理池、分布式调度、动态反爬对抗与增量抓取策略。 建立多源数据 schema 规范与元数据采集标准,支撑 Trino/Spark/大数据湖分析。

上海