哔哩哔哩大模型训推平台技术专家
任职要求
任职要求 1.本科及以上,5 年以上 Infra / 平台工程经验,能独立负责一个技术方向的架构与落地 2.精通 Go 或 Python,深入理解 K8s 生态与 Operator 模式 3.理解分布式训练(DDP/Pipeline/MoE)或大模型推理 Serving 架构 4.GPU 集群调度、训练框架、推理…
工作职责
围绕自研大模型训推一体化平台,独立负责以下一个或多个方向的架构设计与落地: 1.大规模预训练资源调度设计 GPU 万卡级集群调度系统,支持拓扑感知、跨机房调度与多租户配额;基于 K8s/Volcano 等构建调度内核,训练任务排队、抢占、弹性调度,持续提升集群 GPU 利用率;拓扑感知放置(NVLink/IB)与跨机房/跨可用区调度,最小化跨交换机通信开销;通信与存储 IO 路径优化,配合训练框架提升端到端通信效率 2.自动故障检测与恢复:构建训练全链路健康监测与自愈闭环,最小化故障对训练进度的影响。训练全链路健康监测:NCCL hang、GPU Xid、网络抖动、存储异常的自动检测Checkpoint 自动管理 + 断点续训,故障迁移后快速恢复故障自愈闭环:检测 → 诊断 → 迁移 → 恢复,沉淀故障知识库与回溯能力 3.模型训推 DevOps打通"代码→镜像→训练→产物→上线"全流程,构建训推一体化交付闭环。镜像与产物治理:训练/推理基础镜像标准化,模型权重与 Checkpoint 版本化 registry,统一 artifacts 生命周期管理CI/CD 与发布:训练代码与推理服务持续集成(镜像构建/单测/自动评测),推理灰度发布、回滚、A-B 流量切换可观测与稳定性:训练任务与推理服务的指标/日志/链路监控,SLI/SLO 与告警闭环,故障注入与应急演练
1. NVL72 内部 GPU 拓扑(机柜内 NVLink fabric、Compute tray ↔ NVSwitch tray 关系、跨柜 rail)的发现、上报与节点标签化 2. K8s 调度器(Volcano 二次开发 + kube-scheduler framework)的 GB300 rail-aligned 调度策略、Gang Scheduling 适配、跨柜 binpack / spread 策略实现与上线 3. 训练任务启动器(Launcher)的 NVL72 拓扑注入、ENV 配置、`NCCL_TOPO_FILE` 自动生成 4. Megatron-LM / DeepSpeed / PyTorch FSDP 在 NVL72 单机柜内的并行策略最佳实践(TP / PP / DP 切分边界与 NVLink 域对齐) 5. NCCL 在 NVL72 内部高带宽(NVLink 5)+ 跨柜 RDMA 混合拓扑下的深度调优:算法选择(ring / tree / NVLS)、QP 数、buffer 大小、IB HCA 绑定 6. 训练框架与 NCCL 的代码级 patch、问题上游回报与社区跟进 7. NVL72 故障域(机柜级 NVLink down、NVSwitch tray 故障、Compute tray 故障)下的训练任务断点续训、整体重试与节点替换语义 8. 训练任务级慢卡 / 慢柜检测:在 all-reduce 时延、step time、GPU SM/Mem 利用率等多维度做联合识别 9. 与 Operator 组、硬件运维 GB300 专项组配合落地"机柜级故障 → 节点替换 → 训练续跑"端到端链路
1、负责大模型训推平台的架构设计与开发,支持业务在模型开发、训练、评估、优化、推理部署等全生命周期的需求,确保平台的高可用性和可扩展性; 2、与算法、训推引擎团队紧密合作,构建超大规模计算/存储资源管理,面向多模态、Agentic的训推体系能力; 3、优化大模型训练效率和稳定性,建设数据可观测性、效果&服务稳定性保障和排查机制、资源任务调度优化能力; 4、支持训推结合和模型优化,结合MTP、QAT、蒸馏技术、以及自动化评估系统,构建高性能和精度保障的模型压缩优化能力。
1、负责文生图、文生视频等自研大模型核心算子的自研开发与性能优化,基于CUDA、OpenAI Triton等工具实现高性能计算加速; 2、针对AI Infra大模型推理与训练场景,优化混合精度量化策略,设计低比特计算、稀疏化压缩等方案,提升模型部署效率; 3、深入GPU/Tensor Core硬件架构,优化显存管理、计算图调度及分布式通信,提升模型训练吞吐与资源利用率; 4、搭建端到端模型推理流水线,探索多模态生成任务下的算子融合、动态编译等创新优化手段; 5、协同算法团队完成模型轻量化落地,提供量化感知训练(QAT)、模型剪枝等技术支持。
