阿里云阿里云智能-深度学习推理系统研发专家-AI领域
任职要求
基本要求: - 计算机相关专业本科及以上学历,5年以上AI基础设施、系统软件或高性能计算相关工作经验; - 扎实的C++/Python编程能力,熟悉Linux开发环境,熟悉Pytorch等深度学习框架的使用,掌握各类CPU/GPU/网络性能分析工具的使用; - 深入理解现代GPU架构(如NVIDIA Hopper/Blackwell)及CUDA编程模型,具备高性能Kernel分析能力; - 熟悉主流大语言模型推理引擎(如vLLM/SGLang)的架构、实现原理、执行流程以及代码细节; - 对Transformer类语言模型结构、KV Cache机制、各类Attention计算机制等有深入理解; - 理解不同并行策略及相关高性能通信库(如NCCL、NVSHMEM、DeepEP)的适用场景、基本功能、实现原理和性能表现; - 能够结合工作负载特征和…
工作职责
作为推理系统与引擎的研发和优化专家,将主导或参与面向Qwen等模型的真实业务工作负载的端到端推理性能分析与优化工作,具体职责包括但不限于: - 针对重点模型实际业务场景下的推理部署方案进行不同层级的性能验证,对典型负载特征进行深入分析建模,支撑模型演进、推理架构选型与资源规划; - 根据任务负载特点,对模型不同并行策略(如TP/DP/EP/PP/CP)进行深入分析,并结合分布式部署架构(PD/AF分离等),实现和验证不同层面技术的协同优化方案,提升端到端性能; - 分析和验证不同后端高性能Kernel在不同模型和负载下的性能表现,根据具体需求对关键算子运用各类优化手段进行定制化加速,提升硬件利用率; - 关注和探索前沿快速解码技术方法以及其它推理优化和加速技术,结合实际场景进行验证,并在推理系统与各类优化方案无缝集成,提供极致的用户体验; - 与周边工程、模型、系统、产品团队紧密协作,将优化成果落地到生产环境,并持续跟踪线上性能表现。

作为推理系统与引擎的研发和优化专家,将主导或参与面向Qwen等模型的真实业务工作负载的端到端推理性能分析与优化工作,具体职责包括但不限于: - 针对重点模型实际业务场景下的推理部署方案进行不同层级的性能验证,对典型负载特征进行深入分析建模,支撑模型演进、推理架构选型与资源规划; - 根据任务负载特点,对模型不同并行策略(如TP/DP/EP/PP/CP)进行深入分析,并结合分布式部署架构(PD/AF分离等),实现和验证不同层面技术的协同优化方案,提升端到端性能; - 分析和验证不同后端高性能Kernel在不同模型和负载下的性能表现,根据具体需求对关键算子运用各类优化手段进行定制化加速,提升硬件利用率; - 关注和探索前沿快速解码技术方法以及其它推理优化和加速技术,结合实际场景进行验证,并在推理系统与各类优化方案无缝集成,提供极致的用户体验; - 与周边工程、模型、系统、产品团队紧密协作,将优化成果落地到生产环境,并持续跟踪线上性能表现。
1. 从传统模型到深度模型, 从LLM到多模态Agent, 负责面向不同业务线的不同模型的在线推理系统, 是工程与算法的深度交融的舞台 2. 基于K8S的云原生在线生态系统, 承接大规模分布式系统的运维挑战, 提供产品化一站式的服务能力 3. 参与传统框架(tensorflow/pytorch/xgb)到LLM框架(vllm/sglang/lmdeploy), 以及编译优化(MLIR/TVM/Triton) 的持续研发与调优工作 4. 负责从底层算子调优, 模型编译, 框架调度, RDMA, PD分离部署, 多卡协同 等各个领域的研发与创新
【部门介绍】引擎架构部提供小红书搜广推,CV和NLP业务的深度学习模型高性能推理服务。主导SOTA推理引擎的架构设计与核心模块开发,支撑搜广推业务在长序列建模、生成式推荐、Agent等前沿场景在GPU,XPU等异构计算部件上规模落地。 1. 参与推理引擎的架构设计与核心模块的开发。持续优化推理基础设施:特征DSL编译引擎、服务化推理框架,实现性能提升。 2. 优化搜广推、长序列、多模态、MoE等深度学习模型的推理效率,将各场景的推理性能优化到极致。 3. 针对GPU/NPU等异构计算芯片,探索片内多部件并行流水线等前沿技术,构建业界影响力。
