米哈游【实习】高性能算子开发
任职要求
1.在读硕士或博士,熟练掌握C/C++、Python编程语言,具备良好的coding和调试能力; 2.熟悉GPU系统架构和CUDA/Cublas/Cutlass等,熟练使用nsys/nsight等分析工具; 3.加分项:熟悉主流大模型训练/推理框架(Megatron-LM/vLLM/SGLang等),有实际性能调优经验 加分项 -…
工作职责
1.针对大模型训练、强化学习、推理场景,负责GPU kernel开发与调优; 2.深入分析GPU/主流AI芯片的硬件架构特性,设计并实现高性能算子、算法和相关组件; 3.保持关注行业前沿技术,且有能力和热情开展创新研究;
要解决的问题: 1. 基于 LLM 的高性能算子生成系统开发 面向阿里核心模型的训推场景,设计并开发 LLM-Driven 的异构GPU 高性能Kernel 的自动生成优化系统,结合目标芯片架构特性(如计算单元、存储层次、指令集、通信机制等),生成高性能的算子,并驱动Agent持续优化代码的性能(手段包括但不限于调度优化、编译优化,内存管理、并行计算,遗传算法,组合优化等等)。 2. 模型后训练与 Agent 能力增强 构建面向高性能算子生成的数据闭环,设计并沉淀 SFT 数据集、偏好数据与 reward 机制;基于 SFT、RL 等后训练方法对模型进行微调,增强 Agent 对芯片约束、性能瓶颈和优化策略的理解,使其能够更稳定地生成高性能算子代码。 3. 多智能体协同系统构建 搭建多智能体协作框架,实现需求理解、代码生成、错误修复、版本对比等任务的自动化闭环;研究智能体分工、通信、反思与决策机制,提升系统在复杂场景下的鲁棒性、生成效率与优化质量。 4. 技术落地与前沿探索 与芯片、编译器和算子团队协作,结合具体硬件特性和业务场景推动技术落地;持续跟踪 LLM 代码生成、模型后训练、多智能体系统与 AI 编译优化等方向的前沿进展,并输出技术文档、专利或论文。
简介:参与面向大模型训练/推理的高性能计算与系统优化工作,可根据个人背景和研究兴趣选择以下方向之一深入推进: 1、面向GPU/NPU 等多硬件平台的算子开发与极致性能优化(CUDA/Cutlass/TileLang)。 2、跟踪前沿模型算法并完成高性能工程落地,深入框架层开展算子融合、内存/通信优化、流水编排等系统级性能调优。 3、探索基于大模型的高性能 Kernel 自动合成技术,参考 LLM-driven Kernel Generation 范式,研究高效 GPU/NPU Kernel 的端到端自动生成与迭代优化方法。 4、基于DSL(如 Triton、TVM TIR、Halide 等)的编译优化与自动调优技术研究。 5、多硬件后端(NVIDIA/国产芯片)的统一算子库建设与迁移适配。
随着全球主要市场陆续出台用户个人信息保护政策,整个互联网生态中的数据安全和用户隐私保护问题变得越发重要且日趋严格。如何在营销场景下实现对隐私数据的安全合规使用,维护在线广告商业模型的核心运作,成为当下广告生态中各企业急需解决的问题。 该职位的主要工作包含: 1. 高性能MPC隐私算法的调研、设计及代码开发,实现在大规模数据集下的分布式计算,应用于阿里妈妈广告业务对外数据合作场景。 2. 对业界前沿隐私保护技术保持敏感,梳理和提出创新的隐私计算算法,发表到领域内顶会期刊。
An exciting internship opportunity to make an immediate contribution to AMD's next generation of technology innovations awaits you! We have a multifaceted, high-energy work environment filled with a diverse group of employees, and we provide outstanding opportunities for developing your career. During your internship, our programs provide the opportunity to collaborate with AMD leaders, receive one-on-one mentorship, attend amazing networking events, and much more. Being part of AMD means receiving hands-on experience that will give you a competitive edge. Together We Advance your career! JOB DETAILS: Location: Beijing,China Onsite/Hybrid: at least 3 days a week, either in a hybrid or onsite or remote work structure throughout the duration of the co-op/intern term. Duration: at least 6 months WHAT YOU WILL BE DOING: We are seeking highly motivated AI Compiler Software Engineering intern/co-op to join our team. In this role – We will involve you in extending Triton’s compiler infrastructure to support new AI workloads and hardware targets. We will assign you tasks to implement and optimize GPU kernels using Triton’s Python-based DSL. We will train you to analyze kernel performance using profiling tools and help you identify bottlenecks and optimization opportunities. We will understand how modern compilers translate high-level abstractions into efficient machine code.