字节跳动大模型数据(CS方向)实习生-AI数据与安全
实习兼职A37923地点:北京状态:招聘
任职要求
1、本科及以上学历在读,理工科(数学、物理、化学、生物、工程、计算机)相关专业;
2、在本专业细分领域有深厚积累,具备独立研究或复杂问题求解能力;…登录查看完整任职要求
微信扫码,1秒登录
工作职责
日常实习:面向全体在校生,为符合岗位要求的同学提供为期3个月及以上的项目实践机会。 团队介绍:AI数据与安全团队为Seed基座模型及AI原生应用提供跨模态数据服务,覆盖数据生产全流程,包含模型评估标准的制定、数据规模化生产、数据飞轮搭建,不断提升数据质量,支持模型快速迭代。 团队由产品经理、数据工程、数据运营等跨职能人才组成,并通过与Seed研究员、行业专家、全球顶尖数据供应商紧密合作,从真实场景中收集反馈并分析模型表现数据,解决AI前沿突破过程中的复杂数据问题,推动模型性能与用户体验的双重提升。我们既是帮助模型技术迭代的一线贡献者,也是模型和AI产品的一手用户。 1、负责从学科领域视角为模型训练提供关键洞察,将模型问题转化为标准化、可落地的专业数据建设方案,推动大模型在专业领域的能力提升; 2、专业领域洞察输出:输出面向模型训练的学科科研领域洞察,及训练优化建议; 3、与算法、产品团队深度协作,识别模型的问题,将问题拆解为清晰的专业数据需求; 4、评价模型效果,并通过模型与人工结合的方式,提出适用于优化大模型的数据生产办法。
包括英文材料
学历+
大模型+
https://www.youtube.com/watch?v=xZDB1naRUlk
You will build projects with LLMs that will enable you to create dynamic interfaces, interact with vast amounts of text data, and even empower LLMs with the capability to browse the internet for research papers.
https://www.youtube.com/watch?v=zjkBMFhNj_g
相关职位
实习阿里巴巴2027
1.参与大模型训练数据体系的构建,协助设计高质量、大规模数据的采集、清洗、评估与迭代机制; 2.探索多模态(文本、图像、音频、视频等)数据的内容理解、质量建模与特征提取方法,支持数据驱动的大模型优化; 3.参与Prompt工程相关技术研发,包括结构化指令设计、自动化生成策略及效果验证框架的实现; 4.协助开发可扩展的数据处理工具链,结合分布式计算与AI技术,提升全模态数据生产效率与一致性; 5.与算法、工程及产品团队协作,将前沿数据方法落地到实际训练流程中,并持续跟踪效果反馈。
更新于 2026-05-19北京|杭州
社招3-5年J0011
1、参与超大规模 AIGC 训练数据生产体系建设,覆盖图片、视频、文本、音频等多模态数据的全生命周期管理,支撑世界领先的多模态生成模型训练需求; 2、与算法团队、AI infra团队深度协作,深入理解业务场景,持续迭代数据生产系统的稳定性、易用性,不断提升交付效率; 3、针对多模态训练数据的打标和训练特征的离线推理场景,优化推理吞吐和性能; 4、参与数据生产过程的资源整体利用率优化,包括异构资源调度、算力动态规划、弹性扩缩容等,降低单位数据生产成本。
更新于 2026-06-09北京
社招3年以上核心本地商业-基
1、设计和开发分布式大模型数据平台,提供高性能、可扩展的数据处理链路,支撑LongCat基座、语言模型和多模态大模型的高效训练迭代; 2、构建海量数据的全生命周期管理体系,提供元信息、数据血缘、存储治理、可视化与可观测能力;探索数据实验和数据发版的工程上限; 3、深入理解大模型训练流程和数据策略,抽象并开发高效、可靠的数据加工框架,显著提升算法团队的数据工程效率; 4、与算法工程师紧密配合,设计数据策略解决方案,用工程能力放大数据对模型效果的杠杆作用。
更新于 2026-04-14北京