荣耀AI高性能计算高级工程师
任职要求
1、高性能计算、并行计算、异构计算、性能优化; 2、扎实的计算机系统,组成原理和体系结构基础; 3、丰富的CPU、GPU、TPU、NPU、x86、ARM、DSP或者AI处理器调优经验; 4、CUDA, cuDNN, TensorRT, OpenBLAS, OpenMP, MKL, OpenCL或其他并行计算…
工作职责
1、负责深度学习框架的基础功能开发,实现各种计算操作,支持常见芯片平台; 2、使用各种高性能计算库提升深度学习框架计算速度; 3、紧跟业内最新技术,甄别技术成熟度。
1. 负责模型训练场景中高性能计算Pipeline的实现,通过访存算子优化、算子融合、MoE/Attention算子定制,实现精细化显存管理、最大化计算/访存效率。 2. 负责结合大语言模型、多模态理解生成模型、Agentic RL等场景的模型训练需求进行算子设计,实现模型-Infra的Co-Design。 3. 负责世界模型、实时生成交互等场景的高性能低延迟算子设计和实现,满足模型加速上线的需求。 4. 使用专业的Profiling工具和手段,对大模型训练的端到端性能进行分析,精准定位Kernel执行、数据搬运、通信等环节的瓶颈,并提出体系化的优化方案。 5. 跟进业界SOTA的高性能计算工作,调研并实施异构硬件在超大规模训练场景的落地方案。
我们是阿里巴巴大模型推理团队,负责生成式AI领域(主要是图像生成和LLM)的内部产品、训练推理服务系统建设和维护,为淘宝、天猫、聚划算、优酷、闲鱼等多个集团业务部门提供强有力的技术支撑和底层服务能力。 1. 针对特定异构芯片(如华为昇腾、AMD MI系列等),深入分析其指令集、存储层级(HBM/Cache)和计算单元特性,使用原生语言(如CANN C/C++, HIP C++)手写和优化核心算子(如Attention, MoE Gate, GEMM等),实现极致性能。 2. 主导或核心参与基于编译技术的算子优化方案,利用Triton、TileLang、JAX/MLIR等技术栈,构建一套可跨硬件复用的算子生成与图优化框架,大幅缩短新卡型或新模型的适配周期。 3. 使用专业的Profiling工具,对模型在异构硬件上的端到端性能进行分析,精准定位Kernel执行、数据搬运、通信等环节的瓶颈,并提出体系化的优化方案。 4、工作地点:北京、杭州,未来会开放「上海」工作地点,现阶段支持员工根据团队安排部分时间在上海办公,详情可与hr或面试官沟通。
我们是阿里巴巴大模型推理团队,负责内部 LLM/AIGC 百炼推理服务建设,为淘宝、天猫、聚划算、优酷、闲鱼等多个集团业务部门提供强有力的技术支撑和底层服务能力。 AI 高性能计算工程师负责探索不同AI芯片(NV,AMD, 华为昇腾, TPU, 寒武纪等)的底层架构,使用硬件手写原生 Kernel、 Trition/Tilelang 编译优化等手段,解决“从0到1”(跑通)和“从1到N”(跑得快)的关键问题。 工作地点:北京、杭州,未来会开放「上海」工作地点,现阶段支持员工根据团队安排部分时间在上海办公,详情可与hr或面试官沟通。
