腾讯混元大模型数据爬虫架构工程师(北京)
社招全职3年以上AI技术地点:深圳状态:招聘
任职要求
1.计算机相关专业,本科以上学历,2年以上架构经验; 2.精通C++/Go/Java中至少一门开发语言,熟悉常见的数据结…
登录查看完整任职要求
微信扫码,1秒登录
工作职责
1.负责大规模网页数据的抓取、清洗及结构化存储,保障数据质量和时效性; 2.设计并优化分布式爬虫架构,提升系统并发能力和容错性,提升系统性能; 3.维护数据采集链路,协同系统数据分析团队完成数据交付与应用。
包括英文材料
学历+
C+++
https://www.learncpp.com/
LearnCpp.com is a free website devoted to teaching you how to program in modern C++.
https://www.youtube.com/watch?v=ZzaPdXTrSb8
Go+
https://www.youtube.com/watch?v=8uiZC0l4Ajw
学习Golang的完整教程!从开始到结束不到一个小时,包括如何在Go中构建API的完整演示。没有多余的内容,只有你需要知道的知识。
还有更多 •••
相关职位
社招3年以上TEG技术
1.负责多种模态数据(文本/图像/视频/3D模型)采集方案设计与实施; 2.通过爬虫技术获取各类数据,开发分布式采集系统,优化效率与质量; 3.联合算法团队制定数据标准,建立数据治理体系,提升训练数据可用性。
更新于 2025-05-30深圳
社招TEG技术
1.基于大模型训练对于数据的需求进行互联网数据抓取,对提供给大模型训练/搜索等场景的语料进行清洗,提升语料纯度; 2.建设对标业内前沿的大模型训练数据集和数据清洗能力,提升数据质量和多样性,并验证数据价值和效果。
更新于 2025-06-18北京
社招TEG技术
1.设计和开发大规模预训练数据处理pipeline,为模型预训练提供稳定、可靠的高质量数据处理能力; 2.根据大模型训练数据特点,抽象并开发高效、可靠的数据加工框架,提升处理数据的工程效率; 3.建设对标业内前沿的大模型训练数据集,提升数据质量和多样性,并验证数据价值和效果。
更新于 2025-06-17深圳