腾讯混元多模态数据工程师(北京)
社招全职1年以上AI技术地点:深圳状态:招聘
任职要求
1.全日制本科及以上学历,硕士优先,计算机或相关专业,工作经验1年及以上; 2.具备扎实的 Python 工程能力,熟悉模块化设计、异常处理、工程化代码结构,熟悉 Linux 环境,具备基本的 Shell 使用与问题定位能力,具备良好的代码质量意识(可维护性、可读性、可测试性); 3.具备大规模数据处理经验,有 TB / PB 级数据处理实践,理解 ETL、数据管线、DAG …
登录查看完整任职要求
微信扫码,1秒登录
工作职责
1.多模态数据管线建设:设计并实现面向大模型训练与推理的多模态数据处理与构建管线,覆盖图像、视频、音频、文本、3D 及多模态理解等数据类型,支撑预训练、后训练(SFT / RLHF / Preference)及评测数据构建; 2.大规模数据工程与系统建设:构建高可靠、可扩展的数据处理系统,支持 TB / PB 级数据规模,负责批处理与流式处理任务的工程实现,参与或主导分布式并行计算(CPU / GPU 混合)的工程落地; 3.数据质量与稳定性保障:建立数据校验与质量评估机制,覆盖数据完整性、一致性、分布异常与质量回归等场景,设计并推动数据处理链路的监控与异常治理; 4.数据资产化与标准化建设:推动多模态数据结构的标准化设计,建设数据元信息、版本管理与可追溯机制,提升数据的可复用性与长期资产价值; 5.跨团队协作与需求落地:与算法、模型、平台等团队深度协作,将模型需求与业务目标转化为可落地的数据工程方案,参与复杂数据问题的拆解、方案设计与推进落地。
包括英文材料
学历+
Python+
https://liaoxuefeng.com/books/python/introduction/index.html
中文,免费,零起点,完整示例,基于最新的Python 3版本。
https://www.learnpython.org/
a free interactive Python tutorial for people who want to learn Python, fast.
https://www.youtube.com/watch?v=K5KVEU3aaeQ
Master Python from scratch 🚀 No fluff—just clear, practical coding skills to kickstart your journey!
https://www.youtube.com/watch?v=rfscVS0vtbw
This course will give you a full introduction into all of the core concepts in python.
Linux+
https://ryanstutorials.net/linuxtutorial/
Ok, so you want to learn how to use the Bash command line interface (terminal) on Unix/Linux.
https://ubuntu.com/tutorials/command-line-for-beginners
The Linux command line is a text interface to your computer.
https://www.youtube.com/watch?v=6WatcfENsOU
In this Linux crash course, you will learn the fundamental skills and tools you need to become a proficient Linux system administrator.
https://www.youtube.com/watch?v=v392lEyM29A
Never fear the command line again, make it fear you.
https://www.youtube.com/watch?v=ZtqBQ68cfJc
Bash+
[英文] The Bash Guide
https://guide.bash.academy/
A quality-driven guide through the shell's many features.
https://www.youtube.com/watch?v=tK9Oc6AEnR4
Understanding how to use bash scripting will enhance your productivity by automating tasks, streamlining processes, and making your workflow more efficient.
还有更多 •••
相关职位
社招2年以上AI技术
1.数据特征算法:负责海量文本&多模态数据(图像,视频,音频,3D)的内容理解(如分类标签体系、embedding表征、Caption生成等),质量检测(低质识别检测、优质美学评价等),去重/聚类分析,数据合成等算法; 2.数据pipeline建设:负责数据采集、筛选清洗、标注与质量评估pipeline的建设。与模型业务团队紧密配合,充分分析挖掘数据资源,建立自动化数据处理流程与机制,支持模型持续迭代; 3.数据实验分析:对模型训练数据进行详细分析,建立科学数据实验机制,识别样本不足、质量问题、配比不均衡等潜在问题,驱动数据优化提升数据覆盖、质量、多样性需求,最终带来大模型生成效果的持续提升。
更新于 2025-10-15深圳
社招3年以上AI技术
1.负责语音/音频大模型研发,包括语音对话(语音交互/音视频对话)、音频理解(ASR/音频caption)、音频生成(TTS/视频配音)等模型研发; 2.负责语音/音频大模型的预训练、后训练、强化学习(文本和音频强化)相关的数据和算法工作; 3.负责语音对话/音频理解/音频生成的模型开源以及产品落地(比如语音对话产品全链路端到端优化、音频理解在噪音/口音/远场/音效音乐场景的优化、语音合成在播报/闲聊/游戏/社交等场景的优化)。
更新于 2025-12-12深圳
社招3年以上AI技术
1.负责TTS、ASR、声学前处理、自然语言处理、多模态大模型等AI系统的工程开发(包括训练工具和推理引擎的开发、优化、交付等); 2.负责AI系统最新算法的集成、工程化、实际场景效果验证、优化、上线; 3.负责AI相关业务、产品的工程支持,在效果和性能上更好的落地。
更新于 2025-09-12深圳