米哈游高性能算子开发
任职要求
1.熟练掌握C/C++、Python编程语言,具备良好的coding和调试能力; 2.熟悉GPU系统架构和CUDA/Cublas/Cutlass等,熟练使用nsys/nsight等分析工具; 3.加分项:熟悉主流大模型训练/推理框架(Megatron-LM/vLLM/SGLang等),有实际性能调优经验 加分项 - 深入研…
工作职责
1.针对大模型训练、强化学习、推理场景,负责GPU kernel开发与调优; 2.深入分析GPU/主流AI芯片的硬件架构特性,设计并实现高性能算子、算法和相关组件; 3.保持关注行业前沿技术,且有能力和热情开展创新研究;
1.针对大模型训练、强化学习、推理场景,负责GPU kernel开发与调优 2.深入分析GPU/主流AI芯片的硬件架构特性,设计并实现高性能算子、算法和相关组件 3.保持关注行业前沿技术,且有能力和热情开展创新研究
1.针对大模型训练、强化学习、推理场景,负责GPU kernel开发与调优; 2.深入分析GPU/主流AI芯片的硬件架构特性,设计并实现高性能算子、算法和相关组件; 3.保持关注行业前沿技术,且有能力和热情开展创新研究;
1. 参与超大规模的 AI 大模型训练、推理平台建设,聚焦大模型场景高性能算子、模块研发。 2. 负责研发大模型场景下“高性能训推算子模块”,提升大模型平台MFU/MBU。具体包括:a) 基于AI硬件深度理解,针对美团大模型场景研发创新性高性能模块;b) 协同框架算法设计研发平台训推技术方案;c) 调研分析业界最前沿技术方案,等等。 3. 参与搜广推场景模型训练推理核心模块研发,手段包括且不限于:AI编译器,DSL,专家级优化。
要解决的问题: 1. 基于 LLM 的高性能算子生成系统开发 面向阿里核心模型的训推场景,设计并开发 LLM-Driven 的异构GPU 高性能Kernel 的自动生成优化系统,结合目标芯片架构特性(如计算单元、存储层次、指令集、通信机制等),生成高性能的算子,并驱动Agent持续优化代码的性能(手段包括但不限于调度优化、编译优化,内存管理、并行计算,遗传算法,组合优化等等)。 2. 模型后训练与 Agent 能力增强 构建面向高性能算子生成的数据闭环,设计并沉淀 SFT 数据集、偏好数据与 reward 机制;基于 SFT、RL 等后训练方法对模型进行微调,增强 Agent 对芯片约束、性能瓶颈和优化策略的理解,使其能够更稳定地生成高性能算子代码。 3. 多智能体协同系统构建 搭建多智能体协作框架,实现需求理解、代码生成、错误修复、版本对比等任务的自动化闭环;研究智能体分工、通信、反思与决策机制,提升系统在复杂场景下的鲁棒性、生成效率与优化质量。 4. 技术落地与前沿探索 与芯片、编译器和算子团队协作,结合具体硬件特性和业务场景推动技术落地;持续跟踪 LLM 代码生成、模型后训练、多智能体系统与 AI 编译优化等方向的前沿进展,并输出技术文档、专利或论文。