logo of tencent

腾讯混元大模型数据挖掘算法工程师(深圳)

社招全职TEG技术地点:北京状态:招聘

任职要求


1.计算机相关专业优先,熟悉 python/c++编程语言;
2.有数据工程或相关领域的工作经验,具备一定的机器学习算法基础,了解NLP 类似bert等模型;
3.熟练掌握大数据技术栈,包括HadoopSpark等,有使用数据库(如SQL)和数据仓库的经验;
4.熟悉网页结构、有网页低质问题挖掘、或者大模型数据清洗有经验者优先。

工作职责


1.基于大模型训练对于数据的需求进行互联网数据抓取,对提供给大模型训练/搜索等场景的语料进行清洗,提升语料纯度;
2.建设对标业内前沿的大模型训练数据集和数据清洗能力,提升数据质量和多样性,并验证数据价值和效果。
包括英文材料
Python+
C+++
机器学习+
算法+
NLP+
BERT+
大数据+
Hadoop+
Spark+
SQL+
数据仓库+
大模型+
相关职位

logo of tencent
社招2年以上AI技术

1.数据特征算法:负责海量文本&多模态数据(图像,视频,音频,3D)的内容理解(如分类标签体系、embedding表征、Caption生成等),质量检测(低质识别检测、优质美学评价等),去重/聚类分析,数据合成等算法; 2.数据pipeline建设:负责数据采集、筛选清洗、标注与质量评估pipeline的建设。与模型业务团队紧密配合,充分分析挖掘数据资源,建立自动化数据处理流程与机制,支持模型持续迭代; 3.数据实验分析:对模型训练数据进行详细分析,建立科学数据实验机制,识别样本不足、质量问题、配比不均衡等潜在问题,驱动数据优化提升数据覆盖、质量、多样性需求,最终带来大模型生成效果的持续提升。

更新于 2025-10-15
logo of tencent
社招TEG内容

1.基于大模型训练需求,挖掘影视行业高质量视频/图片数据源,包括但不限于影视版权库、专业视频平台、头部影视制作公司及独立创作者资源; 2.通过采买、版权合作、联合标注等方式获取数据,解决稀缺数据获取难题,保障数据多样性(如4K/8K超高清、多场景片段、特效素材); 3.深度分析头部AI企业的数据获取、使用策略,包括数据来源分布、清洗标准、标注方法等,形成分析报告并指导自身数据策略优化。

更新于 2025-05-30
logo of tencent
社招2年以上AI内容

1.理解大模型训练数据需求,能够基于模型效果目标,形成高质量的数据交付目标与计划; 2.负责海外供应商开拓与建联,挖掘行业优质大模型数据资源,成数据资源拓展计划与策略,储备高质量数据资源; 3.负责海外数据采买与交付,参与优化采买交付流程,持续提升交付效率。

更新于 2025-07-09
logo of tencent
社招TEG技术

1.设计和开发大规模预训练数据处理pipeline,为模型预训练提供稳定、可靠的高质量数据处理能力; 2.根据大模型训练数据特点,抽象并开发高效、可靠的数据加工框架,提升处理数据的工程效率; 3.建设对标业内前沿的大模型训练数据集,提升数据质量和多样性,并验证数据价值和效果。

更新于 2025-06-17