百度GPU资源效能分析师（J95909）

社招全职ACG2025-12-16地点：北京状态：招聘

扫码手机上打开

任职要求

-具备云计算、GPU 相关硬件、AI Infra、或大模型训练任一方向的知识背景
-熟悉 GPU 基础指标（如利用率、显存占用、通信瓶颈、MFU 等）并具备相关分析经验
-具备良好的数据分析能力，熟练使用 SQ…

登录查看完整任职要求

微信扫码，1秒登录

工作职责

-负责构建集团内部GPU 利用率指标体系，包含利用率、显存、吞吐、MFU 等核心指标的采集、统计与分析
-搭建 GPU 资源使用的报表与可视化体系（日报/周报/业务线视角/集群视角/作业视角等）
-识别低效作业、异常资源占用、Idle/Ghost GPU 等问题，下钻分析并给出优化建议
-GPU全生命周期精细化运营管理，覆盖到货、交付、购买、使用端到端环节，实现动态监控和运营优化管理
-与业务、产品、运维等管理团队协作，共同推进 GPU 利用效率优化和交付效率优化

📮 投递简历 ✨AI模拟面试

难度：

包括英文材料

大模型+

数据分析+

还有更多 •••

登录查看完整学习资料

相关职位

GPU调度研发工程师

社招5-10年引擎

大模型具备很强的泛化及理解世界能力，在小红书内的众多生产场景遍地开花，大模型的训练和部署已成为许多算法工程师的日常。在多团队、多业务频繁使用的大规模GPU集群上，如何能够通过高效的GPU调度策略，使大家不仅能丝滑地完成训练及部署任务，同时也能充分激发大规模GPU集群的效能，是行业公认的关键挑战。在这里，你可以聚焦LLM场景，接触到超大规模GPU集群，并使用真实负载数据进行深入分析及技术探索。欢迎加入我们，一起探索领先技术改变世界！工作职责： 1、负责万卡规模GPU集群效能分析及优化，通过调度策略优化、在离线混部、集群调度、GPU虚拟化、故障快速恢复、存储&网络加速等手段，提升大规模GPU集群的整体使用效率。 2、负责构建面向大模型训练、微调、推理、部署全流程LLMOps，与下游云原生平台深度融合，支撑大模型在公司内各业务生产链路稳定高效地落地。 3、持续关注业界最新的GPU资源调度相关技术动态，探索建设业界领先的资源调度策略及方法，构建下一代大规模AI资源调度系统。

更新于 2025-10-25北京

大规模GPU集群调度优化工程师/专家

社招引擎

北京|上海

【REDstar】大模型/智能体/搜广推平台工程师

校招机器学习平台

小红书中台AI平台团队致力于打造业界领先的一站式AI平台，通过技术创新和工程优化，为公司AI业务发展提供强有力的基础设施支撑，实现算法研发效率的显著提升和成本的有效控制。我们负责调度公司所有AI模型训练及推理的数万卡GPU资源，基于自研的训练、推理、智能体框架，为公司所有算法及工程同学提供端到端、一站式的AI研发能力，包含大模型数据处理/训练/压缩/推理/部署及开箱即用的API体验、AI知识库/智能体应用构建、搜广推数据生产/模型训练/模型上线/特征管理/模型测试等。 1、负责大模型/搜广推模型开发平台、AI应用开发平台的架构设计和核心功能研发，构建云原生架构，设计高可用、高性能的微服务体系； 2、负责构建面向大模型、搜广推、智能体全流程DevOps，与下游云原生平台深度融合，支撑大模型在公司内各业务生产链路稳定高效地落地； 3、负责万卡规模GPU集群效能分析及优化，通过调度策略优化、在离线混部、GPU虚拟化、存储&网络加速等手段，提升GPU集群使用效率； 4、将平台和框架结合，通过任务调度、弹性容灾、性能优化等措施端到端提升AI生产效率，涉及k8s/kubeflow、网络通信、分布式训练等； 5、优化各AI平台性能，提升系统稳定性和可扩展性，保障大规模并发场景下的服务质量与用户体验； 6、持续研究分析业内创新AI平台产品，优化技术方案，改进产品功能，提升创新能力与产品体验。

更新于 2025-09-24上海|北京|深圳

【2026校招】大模型/智能体/搜广推平台工程师

校招机器学习平台

更新于 2025-09-24北京|上海|深圳