月之暗面Infra 系统工程师 - 训练平台
社招全职技术类/Technical地点:北京状态:招聘
工作描述
工作职责: - 基于 Kubernetes 构建稳定、可扩展的大模型训练平台,实现 GPU 算力资源的自动化管理与高效调度。 - 通过自动化手段,保障内部超大规模训练任务的高效运行。 - 优化训练作业调度器,优化拓扑感知、抢占与弹…
登录查看完整工作描述
微信扫码,1秒登录
包括英文材料
Kubernetes+
https://kubernetes.io/docs/tutorials/kubernetes-basics/
This tutorial provides a walkthrough of the basics of the Kubernetes cluster orchestration system.
https://kubernetes.io/zh-cn/docs/tutorials/kubernetes-basics/
本教程介绍 Kubernetes 集群编排系统的基础知识。每个模块包含关于 Kubernetes 主要特性和概念的一些背景信息,还包括一个在线教程供你学习。
https://www.youtube.com/watch?v=s_o8dwzRlu4
Hands-On Kubernetes Tutorial | Learn Kubernetes in 1 Hour - Kubernetes Course for Beginners
https://www.youtube.com/watch?v=X48VuDVv0do
Full Kubernetes Tutorial | Kubernetes Course | Hands-on course with a lot of demos
大模型+
https://www.youtube.com/watch?v=xZDB1naRUlk
You will build projects with LLMs that will enable you to create dynamic interfaces, interact with vast amounts of text data, and even empower LLMs with the capability to browse the internet for research papers.
https://www.youtube.com/watch?v=zjkBMFhNj_g
还有更多 •••
相关职位
社招技术类/Tech
工作职责: 优化超大规模线上推理集群运行效率和稳定性 跟踪最新模型进展,设计技术架构将模型应用到产品 设计和优化工作流,通过自动化手段加速模型到产品的迭代效率 任职要求: 拥有良好的代码开发习惯,熟
更新于 2025-02-24北京
校招
岗位职责: 1. 参与内部训练平台、LLM 推理集群服务的建设和维护。 2. 通过自动化手段,保障内部超大规模训练任务的高效运行。 3. 参与平台的稳定性建设,包括异常监控、故障排查与修复等,确保平台
更新于 2025-03-25北京
社招3年以上程序&技术类
1)本科及以上学历,计算机科学、软件工程、人工智能、分布式系统或相关专业 2)3 年以上基础设施、后端平台、分布式系统或 AI Infra 相关研发经验,有大规模训练平台、在线推理服务或高性能系统建设
上海|北京