腾讯AI for System研究员/工程师
任职要求
1.扎实的机器学习与深度学习基础,熟悉时序预测、异常检测等算法; 2.具备以下至少一个方向经验:; 3.a. AIOps相关项目开发(故障诊断/根因分析); 4.b.资源调度优化(强化学习/运筹学模型); 5.c.大模型在系统场景的应用实践; 6.了解分…
工作职责
1.研发AI驱动的智能运维系统(AIOps),基于机器学习/深度学习实现故障预测、异常检测与根因分析; 2.构建系统资源优化模型,通过AI技术进行性能与资源优化、复杂问题建模与决策与系统自治; 3.探索大模型在数据以及AI系统基础设置以及运维体系的智能化升级,如自动优化、自动化决策; 4.推动AI for System技术落地,持续跟踪领域内前沿算法与工程实践。

岗位概述 参与美图影像研究院(MT Lab)核心 AI 底层基础设施与前沿交互应用的研发。作为支撑算法落地的全栈工程核心,你将参与构建从底层算子优化、算法中台到上层 AR 渲染的全链路系统,将前沿的计算机视觉与 AIGC 理论转化为影响亿级用户的真实影像体验。 本岗位为 2026 年暑期实习,全职实习时长 5 个月以上。实习期间表现优秀者,将有机会获得留用。 职责方向 ● 算法平台研发: 参与 AI 算法中台及基础设施的架构设计与 C++ 开发,构建支撑海量数据与大模型的高效训练、自动化评测与部署工具链。 ● 前沿 AR 研发: 参与跨平台 AR 特效引擎及图形渲染的底层研发,配合设计师打造创新 AR 特效,并对渲染相关技术进行前瞻性研究。 ● 极限算法调优: 深入 AI 落地“最后一公里”,负责深度学习模型在异构硬件(移动端/PC/服务端)上的极限性能调优,涵盖算子优化、内存管理及并发加速。 ● 全栈工程协作: 与顶尖算法研究员深度协作,以全栈视角理解复杂 AI 逻辑,设计高可用、高扩展的工程架构,加速 AI 能力的业务化落地。 任职资格 ● 教育背景: 本科及以上学历在读,计算机、人工智能、数学、电子等相关专业。 ● 计算机基础: 具备极度扎实的计算机科学基础,深入理解数据结构与算法、操作系统体系结构及计算机原理。 ● C++ 编程能力: 熟练掌握 C/C++,具备优秀的系统级开发、性能 Profiling 与复杂问题 Debug 能力,代码风格优雅。 ● AI Native 心态: 习惯并热衷于利用大模型等 AI 工具辅助开发。 ● 算法好奇心: 能够从底层架构视角洞察 AI 模型的工作原理,有志于成长为“懂算法”的全栈工程师。 ● 沟通与内驱力: 具备良好的沟通能力,能清晰阐述技术权衡;有独立解决前沿工程难题的内驱力。 加分项 ● 底层优化经验: 熟悉 ARM NEON 汇编、CUDA/OpenCL 编程,或有 TensorRT、NCNN 等推理框架实战经验。 ● 图形学背景: 熟悉计算机图形学,有 OpenGL、Vulkan 或 Metal 等底层图形 API 开发经验。 ● 开源与竞赛: 在 GitHub 相关生态中有实际 PR 贡献,或在 ACM/ICPC、NOI 等高水平算法竞赛中获得过优异成绩。 Overview: Join the MT Lab to build core AI infrastructure and pioneering interactive applications. As a full-stack engineering core supporting algorithm deployment, you will work on an end-to-end system spanning low-level operator optimization, algorithm middleware, and high-level AR rendering. Your mission is to transform cutting-edge Computer Vision and AIGC theories into ultimate imaging experiences for hundreds of millions of users. This is a full-time summer 2026 internship (5+ months). Strong performers will be considered for a return offer. Responsibilities ● Algorithm Platform R&D: Contribute to the architectural design and C++ development of AI middleware and infrastructures. You will build toolchains that support high-efficiency training, automated evaluation, and deployment for massive data and large-scale models. ● Frontier AR Development: Engage in the low-level C++ development of cross-platform AR engines and graphics rendering. Work closely with designers to create innovative AR effects and conduct forward-looking research on rendering technologies. ● Extreme Algorithm Tuning: Solve the "last mile" of AI deployment by conducting extreme performance optimization on heterogeneous hardware (Mobile/PC/Server), covering operator optimization, memory management, and multi-threading. ● Full-Stack Engineering Collaboration: Work closely with top-tier research scientists. You will interpret complex AI logic from a full-stack perspective to design high-availability and scalable architectures, accelerating the commercialization of AI capabilities.

岗位概述 参与美图影像研究院(MT Lab)核心 AI 底层基础设施与前沿交互应用的研发。作为支撑算法落地的全栈工程核心,你将参与构建从底层算子优化、算法中台到上层 AR 渲染的全链路系统,将前沿的计算机视觉与 AIGC 理论转化为影响亿级用户的真实影像体验。 本岗位为 2026 年暑期实习,全职实习时长 5 个月以上。实习期间表现优秀者,将有机会获得留用。 职责方向 ● 算法平台研发: 参与 AI 算法中台及基础设施的架构设计与 C++ 开发,构建支撑海量数据与大模型的高效训练、自动化评测与部署工具链。 ● 前沿 AR 研发: 参与跨平台 AR 特效引擎及图形渲染的底层研发,配合设计师打造创新 AR 特效,并对渲染相关技术进行前瞻性研究。 ● 极限算法调优: 深入 AI 落地“最后一公里”,负责深度学习模型在异构硬件(移动端/PC/服务端)上的极限性能调优,涵盖算子优化、内存管理及并发加速。 ● 全栈工程协作: 与顶尖算法研究员深度协作,以全栈视角理解复杂 AI 逻辑,设计高可用、高扩展的工程架构,加速 AI 能力的业务化落地。 任职资格 ● 教育背景: 本科及以上学历在读,计算机、人工智能、数学、电子等相关专业。 ● 计算机基础: 具备极度扎实的计算机科学基础,深入理解数据结构与算法、操作系统体系结构及计算机原理。 ● C++ 编程能力: 熟练掌握 C/C++,具备优秀的系统级开发、性能 Profiling 与复杂问题 Debug 能力,代码风格优雅。 ● AI Native 心态: 习惯并热衷于利用大模型等 AI 工具辅助开发。 ● 算法好奇心: 能够从底层架构视角洞察 AI 模型的工作原理,有志于成长为“懂算法”的全栈工程师。 ● 沟通与内驱力: 具备良好的沟通能力,能清晰阐述技术权衡;有独立解决前沿工程难题的内驱力。 加分项 ● 底层优化经验: 熟悉 ARM NEON 汇编、CUDA/OpenCL 编程,或有 TensorRT、NCNN 等推理框架实战经验。 ● 图形学背景: 熟悉计算机图形学,有 OpenGL、Vulkan 或 Metal 等底层图形 API 开发经验。 ● 开源与竞赛: 在 GitHub 相关生态中有实际 PR 贡献,或在 ACM/ICPC、NOI 等高水平算法竞赛中获得过优异成绩。 Overview: Join the MT Lab to build core AI infrastructure and pioneering interactive applications. As a full-stack engineering core supporting algorithm deployment, you will work on an end-to-end system spanning low-level operator optimization, algorithm middleware, and high-level AR rendering. Your mission is to transform cutting-edge Computer Vision and AIGC theories into ultimate imaging experiences for hundreds of millions of users. This is a full-time summer 2026 internship (5+ months). Strong performers will be considered for a return offer. Responsibilities ● Algorithm Platform R&D: Contribute to the architectural design and C++ development of AI middleware and infrastructures. You will build toolchains that support high-efficiency training, automated evaluation, and deployment for massive data and large-scale models. ● Frontier AR Development: Engage in the low-level C++ development of cross-platform AR engines and graphics rendering. Work closely with designers to create innovative AR effects and conduct forward-looking research on rendering technologies. ● Extreme Algorithm Tuning: Solve the "last mile" of AI deployment by conducting extreme performance optimization on heterogeneous hardware (Mobile/PC/Server), covering operator optimization, memory management, and multi-threading. ● Full-Stack Engineering Collaboration: Work closely with top-tier research scientists. You will interpret complex AI logic from a full-stack perspective to design high-availability and scalable architectures, accelerating the commercialization of AI capabilities.
Team Introduction: The ByteDance System Department is responsible for the R&D, design, procurement, delivery, and operational management of the company's infrastructure ranging from chips to servers, operating systems, networks, CDNs, and data centers. It provides efficient, stable, and scalable infrastructure to support global services such as Douyin, Toutiao, and Volcano Engine. The current areas of operation include, but are not limited to: the design and construction of data centers, chip R&D, server development, network engineering, Volcano Engine's edge-cloud services, high-performance intelligent hardware development, intelligent delivery and operation of IDC resources, intelligent monitoring and early warning of hardware infrastructure, operating systems and kernels, virtualization technologies, compilation toolchains, supply chain management, and many other infrastructure-related areas. 团队介绍: 字节跳动系统部,负责字节跳动从芯片到服务器、操作系统、网络、CDN 、数据中心等基础设施的研发、设计、采购、交付与运营管理,为包含抖音、头条、火山引擎等全球业务提供高效、稳定、具备可扩展性的基础设施。部门当前业务开展包括不限于:数据中心设计建设、芯片研发、服务器研发、网络工程研发、火山引擎边缘云业务、高性能智能硬件研发、IDC资源智能交付与运维、硬件基础设施智能监控与预警、操作系统与内核、虚拟化技术、编译工具链、供应链管理等众多基础设施相关方向。 课题介绍: 在当今数字化时代,随着云计算、人工智能和大数据技术的深度融合,现代数据中心正面临着指数级增长的算力需求与现有计算架构效能瓶颈之间的突出矛盾。传统以通用CPU为核心的体系架构在应对多样化负载时,暴露出诸多问题。例如,内存子系统带宽与时延约束导致的 “内存墙” 效应持续加剧,异构计算单元间的数据搬运开销占比超过实际运算时间,安全可信执行环境带来的性能损耗超过 30%,单机柜算力密度提升受限于功耗密度阈值。与此同时,新兴工作负载如AI训练、图计算、时序数据库等呈现出动态异构特征,对计算架构提出了差异化需求,传统固定架构难以实现最优能效比。 操作系统作为计算机体系结构下重要的软件基础设施与核心技术,在这样的背景下也面临着巨大的挑战。随着计算需求的增长和技术的进步,传统的同构计算环境已无法满足日益复杂的计算任务。现代计算场景中,硬件架构呈现高度异构化,包括 CPU、GPU、FPGA、TPU、NPU、DPU 等,同时边缘计算、云计算形成分布式网络。传统操作系统难以高效管理跨节点、跨架构的资源。加之人工智能训练等场景需要低延迟、高吞吐、安全可信,动态弹性的分布式系统支持,这就要求操作系统具备跨异构资源的统一抽象与调度能力。学术界和工业界对下一代计算机操作系统在分布式微内核架构,异构资源调度算法,跨层优化与编译器支持,安全可信技术,虚拟化和 Serverless,AI 驱动操作系统内核优化以及操作系统内置 AI 推理引擎等方面展开了积极的探索和研究。 课题挑战: 方向一:体系化结构方向 1)负载特征与架构优化:建立数据中心动态负载特征建模框架,深入研究面向数据中心Workload的体系结构设计与优化方法,使系统能够更好地适应多样化的负载需求; 2)CPU核心架构创新:研究高性能低功耗CPU核心架构,积极探索超标量流水线与数据流引擎的融合设计,提升CPU的性能和能效; 3)新型内存层次构建:构建支持存算一体化的新型内存层次结构,研究基于3D堆叠技术的近存计算架构,重点突破高带宽互连拓扑优化、混合内存控制器设计、内存访问模式预测算法,解决 “内存墙” 等问题; 4)安全可信架构构建:构建安全可信计算架构,包括侧信道攻击防御的微架构级实现、侧信道安全架构、自动侧 / 隐蔽通道泄漏检测,确保系统在复杂环境下的安全性和完整性; 5)数据中心架构创新:探索整机柜级系统总线扩展,构建内存语义互联的新型数据中心架构,研究基于新型总线协议 (CXL/UALink) 的全局内存共享机制,提升数据中心的整体性能和资源利用率; 6)可靠性增强技术研究:研究可靠性增强技术,包括开发基于机器学习的故障预测模型,设计自修复的微架构容错机制,研究硬件静默故障检测,以及系统及IP可靠性特性研究和数据分析,保障系统的稳定运行。 方向二:操作系统方向 1)操作系统关键技术突破:突破传统单机操作系统存在的硬件资源利用局限、功能扩展与升级运维复杂、数据管理与共享不足、安全性与可靠性欠佳等问题。在计算高度异构以及计算环境分布化的情况下,从硬件到软件建立完整的信任链,保证整个系统的安全性和完整性。同时,有效地管理和协调多个节点间的通信、数据同步及故障恢复,设计高效的调度算法来匹配任务需求与最适合的计算资源,以最大化性能和效率。操作系统需要能够理解不同类型的计算任务,并能根据实时的工作负载动态调整资源分配,实现跨异构资源的统一抽象与调度; 2)跨领域知识融合:本课题需要融合OS、内核、算法、存储、虚拟化、网络、系统工程等多方面的跨领域知识和经验,以实现数据中心智能计算体系结构与操作系统的协同创新。
我们是一支致力于突破人工智能系统与算法边界的前沿研发团队。团队聚焦于大规模语言模型(LLM)及新型架构范式(包括Diffusion LLM) 的高性能训练与推理优化,目标是在系统层(Systems Level)与算法层(Algorithmic Level) 同步创新,打造下一代智能计算基础设施。我们的研究覆盖分布式系统设计、推理框架优化、编译器加速等多个方向。 岗位职责: 1. 实现和优化用于大规模LLM(如Diffusion LLM)训练与推理的高性能计算系统; 2. 开发高效的分布式并行框架; 3. 开发和优化AI编译器; 4. AI for system的AI协同系统优化 5. 与算法团队协作,联动模型结构设计与系统性能共优化。