字节跳动统一存储研发工程师 - 大数据集成方向

社招全职A1697602025-02-24地点：深圳状态：招聘

扫码手机上打开

任职要求

1、扎实的计算机基础知识，具备良好的工程与算法能力；
2、有大数据体系经验，熟悉数仓/BI体系建设及分工；
3、精通Hadoop、Hive、Spark、Kafka、Flink、ClickHouse等大数据工具，具备数据同步与集成经验者优先；
4、具备大数据流计算平台开发经验，熟悉Flin…

登录查看完整任职要求

微信扫码，1秒登录

工作职责

团队介绍：集团信息系统部（Corporate Information System）负责字节跳动信息系统建设。通过构建领先的信息系统，助力公司业务和组织的长期高效经营与发展。与此同时，在安全、隐私、合规层面持续治理，为公司的稳健发展保驾护航。字节跳动的员工分布在全球超过 120 个城市，业务模式复杂，用户规模大。到现在，集团信息系统部已经覆盖人事、财务、法务、采购、审批、职场等多个领域，隐私安全工作同步开展，AIGC 创新孵化也在逐步落地实现。

1、负责实时数据同步、离线集成与复杂数据加工，提升数据流转效率与安全性，确保数据同步的实时性和一致性；
2、负责公司统一数据引擎的大数据架构设计与技术研发，推动数据同步、集成及流计算能力的建设与优化；
3、设计高效、安全的大数据架构，推动数仓与BI团队搭建稳定高效的数据流程；
4、深入了解各业务线数据需求，解决数据研发、质量与安全等核心问题，推动业务实施。

📮 投递简历 ✨AI模拟面试

难度：

包括英文材料

算法+

大数据+

Hadoop+

Hive+

Spark+

还有更多 •••

登录查看完整学习资料

相关职位

资深后端开发工程师（计算平台）

社招程序&技术类

1、负责企业数据计算平台的后端研发工作，支撑批处理、流处理、实时计算、交互式查询等多场景需求；设计并实现任务调度、资源管理、权限管控、计算作业编排等核心模块； 2、数据处理引擎集成并优化 Flink、Spark、Doris、StarRocks、Paimon 等计算与存储引擎；设计统一作业提交与执行框架，提升平台计算效率与稳定性。 3、提供对外 API/SDK，支持数据研发、指标体系、报表分析、机器学习等上层应用；打造自助式计算服务能力，降低业务方使用门槛； 4、负责大规模数据任务的性能优化与故障排查，确保 SLA；建设监控、告警、审计、任务追踪与成本管理体系； 5、平台架构演进，参与计算平台的架构规划工作，推动计算平台向云原生、湖仓一体化方向演进；调研新技术并推动落地，如 Kubernetes、存算分离、向量化计算、流批一体。

上海

推荐特征工程师-Data-抖音/直播/电商/剪映-筋斗云人才计划

校招A21204

团队介绍：推荐架构团队支撑字节跳动旗下多款APP产品，如抖音、今日头条、番茄小说、西瓜视频、剪映等推荐系统架构的设计和开发，保障系统的稳定和高可用，致力于抽象系统通用组件和服务，建设推荐中台、数据中台；关于在线服务，在这里你有机会参与大规模机器学习在线预估框架的研发与优化，也有机会参与模型训练与调度等相关问题的研究与突破，解决系统瓶颈，降低成本开销；如你对大数据感兴趣，在这里也有机会参与通用实时计算系统的开发、构建统一的推荐特征中台，为推荐业务实现先进的消重、计数、特征服务等；我们期待热爱技术的你加入，一起创造更多可能。课题介绍： 1、课题背景在人工智能技术高速发展的背景下，推荐系统作为信息过滤与个性化服务的核心，面临多重挑战：（1）数据爆炸与模型复杂化用户行为序列数据量呈指数级增长（百亿至千亿级/日），存储需求从单用户长序列扩展至多模态数据（文本、视频、Embedding等），传统存储架构面临读写性能瓶颈与成本压力；推荐大模型对数据质量敏感度提升，数据分布异常可能导致模型效果显著下降，亟需系统性数据质量评估与改进方法。（2）异构计算与多模态处理需求随着生成式AI（GenAI）的普及，多模态特征处理成为刚需，传统基于CPU的大数据框架（如Spark/Hadoop）难以高效处理非结构化数据，GPU/DPU等异构计算资源利用率不足；数据处理流程与模型训练脱节，ETL环节耗时长，CPU-GPU协同效率低下，导致算法迭代周期延长。在此背景下，以数据为中心的人工智能（DCAI）与异构计算技术成为破局关键： -DCAI 强调通过数据质量优化与自动化处理链路提升模型性能，而非单纯依赖模型改进； -异构计算通过统一调度CPU、GPU、DPU等资源，加速多模态数据处理与模型训练，实现降本增效。 2、课题目标（1）构建支持多模态数据的低成本高性能存储引擎：支持百亿级用户行为序列与多模态数据混合存储，实现读写延时与存储量解耦，满足PB级数据天级回溯需求；（2）设计自适应数据演化的Schema管理机制：动态兼容特征增删改，确保训推一致性，降低模型迭代中的数据迁移成本；（3）研发多模态数据异构计算框架：实现CPU-GPU-DPU协同计算，加速ETL、特征处理与模型训练，提升资源利用率30%以上；（4）建立数据质量与模型性能的量化评估体系：开发自动化工具链，通过强化学习优化数据清洗、增强与异常检测流程；（5）打造以Python为核心的开发者生态：提供灵活API与可视化工具，支持快速接入多模态数据处理与DCAI优化链路。 3、研究内容（1）多模态存储引擎与编码优化 - 混合存储架构 - 分层设计：行为序列采用时间分区+LSM-Tree存储，多模态数据（如图像/文本）采用对象存储+元数据索引，结合CXL内存池化技术降低访问延迟； - 编码优化：针对用户行为序列设计变长Delta编码，多模态数据采用深度学习压缩模型（如VAE），压缩比提升50%以上。 -Schema动态演化 - 开发基于Protobuf的版本化Schema语言，支持特征字段热更新，兼容历史数据回溯训练。（2）异构计算框架与资源调度 - 计算引擎整合 - 基于Ray构建统一数据湖，实现Spark/GPU算子混合编排，数据从ETL到训练Tensor化零拷贝传输； - 设计DPU加速层，将哈希计算、特征编码等操作卸载至智能网卡，释放CPU/GPU算力。 - 多模态处理优化 - 文本/视频数据采用GPU流水线预处理，利用NVIDIA RAPIDS加速特征提取； - Embedding数据通过量化感知训练（QAT）减少显存占用，支持FP16/INT8混合精度计算。（3）数据质量与DCAI自动化链路 - 质量评估体系 - 定义多维度指标：时空一致性（行为时序异常检测）、模态对齐度（图文匹配校验）、噪声容忍阈值（基于模型鲁棒性反推）。 - 自动化优化工具 - 开发强化学习代理，根据模型反馈自动选择数据清洗策略（如GAN-based数据增强 vs. 规则过滤）； - 构建因果推理模块，定位数据分布偏移对模型AUC下降的贡献度，生成根因分析报告。（4）开发者生态与效能提升 - Python原生接口 - 提供声明式数据处理DSL，支持通过Python装饰器定义GPU加速算子（如@gpu_map）； - 集成Jupyter可视化工具，实时展示数据质量热力图与模型性能关联分析。 - 效能监控体系 - 建立资源-质量-效果三维监控看板，跟踪存储成本、数据处理吞吐量、模型AUC等核心指标。

更新于 2025-05-19上海

推荐特征工程师-Data-抖音/直播/电商/剪映-筋斗云人才计划

校招A192513

更新于 2025-05-19北京

大模型 Infra 研发实习生（Agentic RL 方向）

实习

我们正在构建面向 "Agentic RL 与具身智能" 的评测与训练基础设施。支撑长程、有状态、依赖外部环境（工具、代码执行器、仿真器、机器人）的智能体任务。你将作为 infra 工程师参与平台核心模块建设： 1、设计并实现统一的任务/环境抽象层，支持异构环境的接入； 2、构建大规模并发的rollout 与评测调度系统，提升吞吐、资源利用率与稳定性； 3、搭建智能体轨迹数据管道：采集、存储、检索、回放、版本管理，以及失败案例的可视化诊断系统； 4、集成实验管理、监控告警、链路追踪等能力，保障平台在大规模任务下的可观测性与可恢复性。

更新于 2026-05-18深圳