logo of tme

腾讯音乐训推平台开发工程师

实习兼职技术类地点:深圳状态:招聘

任职要求


1.计算机、软件工程、数学、电子信息、自动化等相关专业,本科及以上学历。
2.热爱编程,具备扎实的计算机科学基础(操作系统、计算机网络、数据结构算法);精通 GolangPython 至少一门编程语言,代码风格良好,具备优秀的工程落地能力。
3.深入理解 Linux 环境,熟悉 Kubernetes 架构及二次开发,熟悉 Docker 容器化技术。
4.对 AI 前沿技术及 AI Infra 领域拥有高度热情,具备优秀的…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


1.训推平台建设:负责大模型训推一体化平台的架构设计与核心开发,实现任务全生命周期管理,保障系统高性能、高可用及高扩展性。
2.GPU集群调度:基于 Kubernetes 构建大规模 GPU 集群调度系统,优化资源分配、任务排队与优先级策略,最大化集群资源利用率。
3.推理服务治理:建设模型服务化体系,实现负载均衡、流量调度、模型热加载及多级缓存,确保高并发场景下的服务 SLA。
包括英文材料
学历+
数据结构+
算法+
Go+
Python+
Linux+
Kubernetes+
Docker+
还有更多 •••
相关职位

logo of mihoyo
社招5年以上程序&技术类

1. NVL72 内部 GPU 拓扑(机柜内 NVLink fabric、Compute tray ↔ NVSwitch tray 关系、跨柜 rail)的发现、上报与节点标签化 2. K8s 调度器(Volcano 二次开发 + kube-scheduler framework)的 GB300 rail-aligned 调度策略、Gang Scheduling 适配、跨柜 binpack / spread 策略实现与上线 3. 训练任务启动器(Launcher)的 NVL72 拓扑注入、ENV 配置、`NCCL_TOPO_FILE` 自动生成 4. Megatron-LM / DeepSpeed / PyTorch FSDP 在 NVL72 单机柜内的并行策略最佳实践(TP / PP / DP 切分边界与 NVLink 域对齐) 5. NCCL 在 NVL72 内部高带宽(NVLink 5)+ 跨柜 RDMA 混合拓扑下的深度调优:算法选择(ring / tree / NVLS)、QP 数、buffer 大小、IB HCA 绑定 6. 训练框架与 NCCL 的代码级 patch、问题上游回报与社区跟进 7. NVL72 故障域(机柜级 NVLink down、NVSwitch tray 故障、Compute tray 故障)下的训练任务断点续训、整体重试与节点替换语义 8. 训练任务级慢卡 / 慢柜检测:在 all-reduce 时延、step time、GPU SM/Mem 利用率等多维度做联合识别 9. 与 Operator 组、硬件运维 GB300 专项组配合落地"机柜级故障 → 节点替换 → 训练续跑"端到端链路

上海|北京
logo of quark
社招1年以上技术类-开发

1、负责大模型训推平台的架构设计与开发,支持业务在模型开发、训练、评估、优化、推理部署等全生命周期的需求,确保平台的高可用性和可扩展性; 2、与算法、训推引擎团队紧密合作,构建超大规模计算/存储资源管理,面向多模态、Agentic的训推体系能力; 3、优化大模型训练效率和稳定性,建设数据可观测性、效果&服务稳定性保障和排查机制、资源任务调度优化能力; 4、支持训推结合和模型优化,结合MTP、QAT、蒸馏技术、以及自动化评估系统,构建高性能和精度保障的模型压缩优化能力。

更新于 2026-06-11杭州|广州
logo of antgroup
校招日常实习

1. 负责商业化的机器学习平台研发;负责相关平台的能力建设、平台运维、质量保障; 2. 负责开发大模型应用和落地相关算法服务和平台,包括不限于大模型训练平台、大模型部署平台、Agent平台、大模型交互平台等; 3. 负责相关的技术预研和创新落地;技术创新如专利、论文的撰写。

北京|杭州
logo of bilibili
社招5年以上技术类

围绕自研大模型训推一体化平台,独立负责以下一个或多个方向的架构设计与落地: 1.大规模预训练资源调度 设计 GPU 万卡级集群调度系统,支持拓扑感知、跨机房调度与多租户配额; 基于 K8s/Volcano 等构建调度内核,训练任务排队、抢占、弹性调度,持续提升集群 GPU 利用率; 拓扑感知放置(NVLink/IB)与跨机房/跨可用区调度,最小化跨交换机通信开销; 通信与存储 IO 路径优化,配合训练框架提升端到端通信效率 2.自动故障检测与恢复:构建训练全链路健康监测与自愈闭环,最小化故障对训练进度的影响。训练全链路健康监测:NCCL hang、GPU Xid、网络抖动、存储异常的自动检测Checkpoint 自动管理 + 断点续训,故障迁移后快速恢复 故障自愈闭环:检测 → 诊断 → 迁移 → 恢复,沉淀故障知识库与回溯能力 3.模型训推 DevOps 打通"代码→镜像→训练→产物→上线"全流程,构建训推一体化交付闭环。 镜像与产物治理:训练/推理基础镜像标准化,模型权重与 Checkpoint 版本化 registry,统一 artifacts 生命周期管理 CI/CD 与发布:训练代码与推理服务持续集成(镜像构建/单测/自动评测),推理灰度发布、回滚、A-B 流量切换 可观测与稳定性:训练任务与推理服务的指标/日志/链路监控,SLI/SLO 与告警闭环,故障注入与应急演练

更新于 2026-07-21上海