字节跳动面向AIDC的下一代高密度数据中心基础设施创新与AI智能运维研究 - AI算力基础设施
任职要求
1、2027届毕业,获得博士学位,计算机、自动化、电气、能源等相关专业优先;
2、熟悉LLM原理与技术生态,有大模型应用或多模态内容理解的工程经验者优先;
…工作职责
团队介绍:字节跳动基础设施部门,负责字节跳动的全栈算力基础设施,从芯片服务器产研、到超大规模数据中心,到传统云平台和如今的AI Native Cloud,全方位为抖音、豆包、今日头条、飞书、火山引擎等各类产品提供领先、稳定的百万量级大规模算力基础设施服务。我们的领域涵盖数据中心建设、内核操作系统开发、服务器集群管理、高速网络通信、EB级数据存储体系、搜索型数据库探索、基于LLM的AI基础设施的研发调度与治理等,致力于打造业界领先的、面向LLM的AI云原生基础设施架构与产品矩阵。 课题介绍: 随着智能计算与AIDC产业快速发展,数据中心单机柜功率密度持续攀升,传统基础设施在换热效率、节水效果、能源利用方面存在短板,同时海量运维数据未充分利用,运维效率依赖人工经验,难以适配产业高质量发展与政策要求。 本课题从技术创新与智能化赋能两方面开展研究:一方面围绕液冷技术、节水无水冷源、供配电储能方向协同创新,突破现有技术瓶颈,适配高密度功率需求与双碳、节水政策要求;另一方面构建数据中心运维AI Agent体系,利用大模型技术从海量多模态异构运维数据中学习,实现多Agent协作完成从监控、诊断到修复的全流程自动化,打造PUE智能优化闭环,支撑从"被动响应"到"主动预测与自愈"的范式转变。通过硬件技术创新与AI智能化运维深度结合,全面提升数据中心能效、可靠性与运维效率。 课题挑战: 1、多技术协同创新:液冷技术需突破高效换热与系统可靠性,节水冷源需实现低WET与干湿协同,供配电储能需解决源网荷储适配与全链路效率提升,多方向协同创新难度大; 2、多Agent协作体系设计:需构建面向复杂运维流程的多Agent协作框架,实现从监控、诊断到自动修复的端到端自主执行,技术整合难度高; 3、PUE智能优化闭环构建:需要基于时序预测与强化学习实现暖通与电力系统智能控制,达到超越人类专家的优化效果,对算法与工程落地要求高; 4、异构数据根因归纳:需要利用大模型从海量异构监控数据中自动完成故障根因分析与知识沉淀,对模型理解与泛化能力要求高; 5、技术落地适配:硬件创新需要兼顾政策合规与行业适配,AI运维需要对接现有平台工具,二者融合落地挑战大。 课题价值: 1、突破数据中心核心技术瓶颈,增强技术竞争力; 2、实现节水低碳运行,通过AI智能运维保障数据中心合规、高效、稳定长效运营。
1、围绕搜索推荐系统中大规模特征生产链路复杂、数据血缘不清晰、特征复用率低、计算链路冗余严重等问题,开展面向特征工程智能治理的 Agent 系统研究与原型建设。参与构建 Feature Engineering Agent 系统,利用 Agent 的任务规划、工具调用、记忆机制、多步骤推理、结果校验与人机协同能力,实现对特征生产代码、任务 DAG、数据血缘和特征依赖关系的自动理解与治理。 2、参与设计和实现面向 SQL、Spark、Flink 等特征生产代码的解析工具链,并将代码解析、元数据查询、任务 DAG 查询、血缘分析、特征 profile 分析、资源成本估算等能力封装为 Agent 可调用工具。 3、研究特征血缘自动构建、冗余特征识别、特征复用推荐、特征依赖关系推理、DAG 优化建议生成等 Agent 工作流,使 Agent 能够在真实特征生产链路中完成复杂治理任务的拆解、执行、验证与解释。 4、探索单 Agent 与多 Agent 协作机制,构建 Code Understanding Agent、Lineage Agent、Feature Reuse Agent、DAG Optimization Agent、Risk Review Agent 等专业能力模块,支持复杂特征治理任务的自动化和半自动化处理。 5、参与构建 Agent 安全与可信机制,包括工具调用权限控制、结果证据追踪、置信度评估、幻觉检测、生产变更审批、风险提示与回滚建议,确保 Agent 输出可解释、可验证、可审计。 6、在真实搜索推荐业务场景中进行实验验证,评估 Agent 系统在血缘识别准确率、冗余特征发现率、特征复用推荐采纳率、计算资源节省、研发效率提升等方面的效果,并形成技术方案、系统原型、技术报告、专利或论文成果。
1. 生成式推荐模型研发: 基于 Transformer 与 LLM 架构,设计并优化面向电商场景的生成式推荐模型,提升用户转化; 2. 电商推荐 Reasoning 探索: 研究推荐过程中的推理能力(Reasoning),利用思维链(CoT)或模型内置推理提升推荐结果的逻辑性与准确度; 3. 模型后训练与对齐(Post-training & Alignment): 负责大模型全生命周期的微调与对齐,包括高质量 SFT 数据构建、指令微调,以及利用 RL 技术驱动模型性能演进; 4. 前沿技术转化与原创突破: 不满足于 SOTA 成果的复现,能够基于业务痛点进行底层算法创新。 积极参与国际顶会(KDD, SIGIR, NeurIPS 等)投稿,输出高质量专利与学术论文,引领行业技术演进。
1. 支持超大规模数据场景下多方共赢、激励兼容的平台机制设计与实践; 2.支持复杂外部性因素下的广告与自然结果价值预估和混排的算法设计与实践; 3. 支持广告全链路机制策略统一建设和联动的设计与实践; 4. 支持研究和推动Autobidding模式下的新机制设计的应用与创新。