大疆高级基础架构工程师(服务器)
任职要求
1. 本科及以上学历,计算机相关专业,5年以上服务器及备份系统运维经验 2. 具备中大型服务器集群运维经验,熟悉服务器硬件架构及主流配件,包括 CPU、内存、硬盘、网卡等,具备 X86、ARM 服务器选型、准入、运维经验,有高并发、大流量业务场景支持经验者优先 3. 熟悉 Windows Server、Linux 等操作系统,理解 Linux 基础原理,熟练使用 Pyt…
工作职责
1. 负责公司服务器资源池的日常交付、运维、资源管理、容量规划及生命周期管理 2. 执行服务器资源运营规范及弹性扩缩容策略,提升算力资源利用率与稳定性 3. 负责公司备份系统运维管理,保障业务数据安全,包括资源运营、容量扩容、系统优化及需求交付 4. 负责备份策略和作业计划的制定(包括数据库、虚拟机和文件系统等场景)、执行监控、巡检、优化及变更管理,及时处理备份失败及系统故障 5. 参与备份系统的方案设计、新产品引入和资源整合 定期组织备份恢复测试及容灾演练,验证备份有效性并提升数据恢复效率。
1、负责基础平台类服务的研发及架构升级工作,包括但不限于亿级流量网关、PUSH消息推送、长链接、IM等; 2、负责数据库中间件, 网络中间件等工作开发; 3、负责平台类服务的研发及架构升级工作; 4、分析及深入发掘现有系统的不足,定位系统瓶颈,提高系统性能和稳定性; 5、探索、研究业界的新技术方向,对去中心化/Serverless/Mesh/数据库/容器编排/调度等技术充满热情。
1. 负责公司数据中心、IT办公、业务生产等网络的规划、建设、运营等相关工作,制定网络标准和设备选型,并且推动落地 2. 负责公司相关网络运营的规范流程规划设计,以及运维系统和工具的规划建设 3. 负责日常故障及疑难问题的分析、测试验证、处理,支持和指导一线运维工程师工作。
1. 超大规模训练架构:负责百亿至万亿参数模型的分布式训练架构设计与演进。针对数千卡 GPU 互联场景,通过自顶向下的性能分析,利用 5D 并行以及通信优化策略,消除大规模分布式训练瓶颈,提升训练效率和线性加速比。 2. 极致性能优化与算子开发:深入软硬协同层,通过手写 CUDA / Triton 算子、算子融合及 XLA / MLIR 等编译优化技术,挖掘 GPU 硬件极致算力,打造一流的执行引擎,追求业界SOTA的 MFU。 3. 训练框架演进:结合前沿的大语言模型(LLM)与多模态模型结构,协同算法团队进行框架级优化(如 Checkpointing、显存优化、Overlap 通信掩盖),优化单位算力的模型效果。 4. AI 创新应用落地支撑:作为算力基座的核心支撑,支持行业顶尖的 GPT、AIGC、多模态模型在 AI 创新应用场景的业务落地,解决实际业务中的大规模与稳定性挑战,确保模型从训练到应用的顺畅衔接。
1. 多模态/世界模型训推架构:负责万亿参数多模态理解、多模态生成模型、世界模型分布式训推框架的设计和实现。通过5D并行策略、细粒度显存优化、通信计算Overlap等手段,实现多模态场景高效的预训练/后训练Pipeline。 2. 模型联合的深度算子优化:结合多模态理解生成场景,通过算子融合,定制Attention、MoE等算子,并达到SOTA的训推MFU。 3. 模型加速工程:使用蒸馏、量化、剪支等加速技术,在AIGC、实时生成等场景达到极致的模型效果-性能平衡点。 4. AI创新应用落地支撑:作为算力基座的核心支撑,支持行业顶尖的多模态生成模型在 AI 创新应用场景的业务落地,解决工业级大模型训练中的迭代基建问题,确保模型从训练到应用的顺畅衔接。