大疆高级基础架构工程师(网络运维)
任职要求
1. 具备6年及以上网络通讯相关工作经验,具备大型企业数据中心网络、IT网络架构规划,及项目建设经验优先,具备思科网络工程师认证能力的优先 2. 精通数据中心网络、企业IT网络架构和技术,精通企业常用网络技术实现方式,掌握基本的网络、系…
工作职责
1. 负责公司数据中心、IT办公、业务生产等网络的规划、建设、运营等相关工作,制定网络标准和设备选型,并且推动落地 2. 负责公司相关网络运营的规范流程规划设计,以及运维系统和工具的规划建设 3. 负责日常故障及疑难问题的分析、测试验证、处理,支持和指导一线运维工程师工作。
1. 负责公司服务器资源池的日常交付、运维、资源管理、容量规划及生命周期管理 2. 执行服务器资源运营规范及弹性扩缩容策略,提升算力资源利用率与稳定性 3. 负责公司备份系统运维管理,保障业务数据安全,包括资源运营、容量扩容、系统优化及需求交付 4. 负责备份策略和作业计划的制定(包括数据库、虚拟机和文件系统等场景)、执行监控、巡检、优化及变更管理,及时处理备份失败及系统故障 5. 参与备份系统的方案设计、新产品引入和资源整合 定期组织备份恢复测试及容灾演练,验证备份有效性并提升数据恢复效率。
1. 超大规模训练架构:负责百亿至万亿参数模型的分布式训练架构设计与演进。针对数千卡 GPU 互联场景,通过自顶向下的性能分析,利用 5D 并行以及通信优化策略,消除大规模分布式训练瓶颈,提升训练效率和线性加速比。 2. 极致性能优化与算子开发:深入软硬协同层,通过手写 CUDA / Triton 算子、算子融合及 XLA / MLIR 等编译优化技术,挖掘 GPU 硬件极致算力,打造一流的执行引擎,追求业界SOTA的 MFU。 3. 训练框架演进:结合前沿的大语言模型(LLM)与多模态模型结构,协同算法团队进行框架级优化(如 Checkpointing、显存优化、Overlap 通信掩盖),优化单位算力的模型效果。 4. AI 创新应用落地支撑:作为算力基座的核心支撑,支持行业顶尖的 GPT、AIGC、多模态模型在 AI 创新应用场景的业务落地,解决实际业务中的大规模与稳定性挑战,确保模型从训练到应用的顺畅衔接。
1. 多模态/世界模型训推架构:负责万亿参数多模态理解、多模态生成模型、世界模型分布式训推框架的设计和实现。通过5D并行策略、细粒度显存优化、通信计算Overlap等手段,实现多模态场景高效的预训练/后训练Pipeline。 2. 模型联合的深度算子优化:结合多模态理解生成场景,通过算子融合,定制Attention、MoE等算子,并达到SOTA的训推MFU。 3. 模型加速工程:使用蒸馏、量化、剪支等加速技术,在AIGC、实时生成等场景达到极致的模型效果-性能平衡点。 4. AI创新应用落地支撑:作为算力基座的核心支撑,支持行业顶尖的多模态生成模型在 AI 创新应用场景的业务落地,解决工业级大模型训练中的迭代基建问题,确保模型从训练到应用的顺畅衔接。
1. 超大规模训练架构:负责百亿至万亿参数模型的分布式训练架构设计与演进。针对数千卡 GPU 互联场景,通过自顶向下的性能分析,利用 5D 并行以及通信优化策略,消除大规模分布式训练瓶颈,提升训练效率和线性加速比。 2. 极致性能优化与算子开发:深入软硬协同层,通过手写 CUDA / Triton 算子、算子融合及 XLA / MLIR 等编译优化技术,挖掘 GPU 硬件极致算力,打造一流的执行引擎,追求业界SOTA的 MFU。 3. 训练框架演进:结合前沿的大语言模型(LLM)与多模态模型结构,协同算法团队进行框架级优化(如 Checkpointing、显存优化、Overlap 通信掩盖),优化单位算力的模型效果。 4. AI 创新应用落地支撑:作为算力基座的核心支撑,支持行业顶尖的 GPT、AIGC、多模态模型在 AI 创新应用场景的业务落地,解决实际业务中的大规模与稳定性挑战,确保模型从训练到应用的顺畅衔接。