阿里云阿里云智能-异构计算软硬件结合开发专家-AI领域-北京/杭州
任职要求
1. 具备5年以上异构计算软硬件结合开发经验,熟悉GPU/AI ASIC部件的硬件设计、芯片架构以及对应的服务器系统设计;熟悉至少一种主流GPU架构(NVIDIA GPU、AMD GPU等)者优先; 2. 具有 GPGPU 微架构分析的实践经验,具有 AI 芯片设计及相关软硬件技术研究成果者优先; 3. 熟悉 GPU 满载运行过程中常见的 RAS(可靠性、可用性、可维护性)质量稳定性问题,以及软硬件协同性能profiling等相关技术问题,并具备实际解决问题的能力; 4. 熟悉python、C++及L…
工作职责
1. 针对整机柜超节点服务器,全面赋能计算、互联、监控、故障及性能诊断等核心能力; 2. 梳理适配超节点异构服务器产品的业务场景,开展对应的昆仑组件设计与开发,涵盖性能评测分析、容器镜像等关键模块; 3. 基于整机柜硬件架构及典型业务落地场景,构建典型故障与异常案例库,并设计相应的故障诊断方案; 4. 负责跟踪与研究主流GPU架构设计技术,参与下一代AI Infra的规划与设计; 5. 结合业务画像,构建面向异构硬件与系统的全链路量化分析模型,形成数据驱动的决策数据库,有效推动异构服务器产品的规划与规模化落地。
1.负责分析硬件加速特征与内部拓扑结构,设计硬件优化实践和调优方案,并主导优化实现,充分发挥硬件潜能,确保性能符合预期。 2.结合主流LLM推理框架 (如sglang/vLLM) 和 大模型结构及计算特征,设计面向框架性能分析和优化插件并主导实现。 3.提供场景化的定制优化能力,识别并解决大模型在不同业务场景下的性能瓶颈,快速的给出满足需求的性能优化方案,并推动业务的交付应用。 4.洞悉大模型的发展趋势和硬件技术演进,结合软硬件优化的经验和数据,分析硬件的发展趋势,提炼AI硬件规格需求,形成软硬结合技术规划。
1.负责分析硬件加速特征与拓扑结构,研发面向云端AI 硬件服务器的优化算子库,释放硬件潜能,确保性能符合硬件设计预期。 2.结合主流大模型推理框架,研发硬件相关的算子/异步等优化插件,确保优化库快速的被业务集成应用。 3.提供场景化的定制优化能力,识别并解决大模型在不同业务场景下的性能瓶颈,研发满足需求的性能优化组件,并推动业务的应用。
1. 基于对目前主流AI芯片的深刻理解,分析硬件系统结构,提供软硬件优化实践和调优指南; 2. 了解市场上主流AI,大数据,HPC应用对异构计算系统设计的挑战,应用AI加速芯片,设计打造高效异构计算产品; 3. 聚焦异构资源在线性能分析,负责系统级性能分析和业务瓶颈定位,助力异构集群的极致稳定; 4. 实现异构计算基础设施serverless化,驱动异构云原生架构演进; 5. 洞悉人工智能及深度学习的应用发展趋势,参与下一代机器学习算力产品设计。
1. 硬件架构选型与设计:根据公司AI业务场景(大模型训练、AIGC、推荐系统等),主导GPU/AI加速器的架构评估与选型决策,制定符合业务需求的解决方案。 2. 性能评估与优化:深入研究AI算法(深度学习、CV、NLP、多模态等)的计算特征,建立GPU/异构硬件的性能评测体系,输出优化建议并推动落地,提升训练与推理效率。 3. 技术趋势洞察:跟踪多元GPU/AI芯片的技术演进,结合公司业务战略,规划硬件技术路线图。 4. 软硬件协同优化:与算法团队、系统团队深度协作,开展算子优化、显存优化、通信优化等工作,打通从算法需求到硬件性能的全链路。 5. 技术方案落地:撰写技术方案文档,推动硬件选型决策的标准化与规模化复制,支持AI业务快速迭代。