logo of kuaishou

快手大模型AI Infra底软/硬件加速工程师-【可灵AI专项】

社招全职3-5年J0011地点:北京状态:招聘

任职要求


1、掌握Python/C++编程语言,熟练使用Pytorch训练框架或SGlang/vLLM大模型推理框架;
2、掌握大模型领域基础算法知识,熟悉常规Transformer/SD模型结构,以及对应的常用性能优化方法;
3、深刻理解GPU硬件体系结构,能熟练编写高性能cuda kernel;
加…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


1、负责视频生成大模型/多模态大模型在最新硬件平台上的训练/推理性能分析与优化,目标达成该硬件平台上的极限性能;
2、负责分析并提升大规模分布式训练系统的集群性能,完成对大规模训练任务故障的根因定位与稳定性提升。
包括英文材料
Python+
C+++
PyTorch+
SGLang+
vLLM+
大模型+
还有更多 •••
相关职位

logo of xiaohongshu
社招3-5年大模型

数据工程 详负责支撑 dots(LLM / 多模态 / Agentic)训练与对齐所需的超大规模数据工程体系,覆盖从 数据生产、清洗、存储、调度、分布式读取到质量闭环的全链路。 RL 训练框架 负责强化学习系统的规模化落地,优化分布式 RL 训练吞吐,处理长序列/推理/CLI Agent 任务 算子优化 深入 CUDA/CuteDSL/TileLang 底层,攻克性能瓶颈(如 FlashMLA、Mega Kernel、低精度算子、通信计算重叠优化) 推理引擎 打造高并发、低延迟的推理架构,优化 PD/AF 分离 schedule、解耦架构及动态资源调度

更新于 2026-07-17北京|上海
logo of kuaishou
社招3-5年J0012

1、负责大数据方向Flink&Spark on K8S的关键能力建设,包括:Spark 高吞吐调度、Flink 极致负载均衡、Spark 计算 Offload 至 GPU 的调度支持、大数据作业资源弹性调度等; 2、负责大模型训练的ETTR(端到端训练启动时间)优化与 MFU(模型计算利用率)提升的关键技术能力建设,包括:GPU容器冷/热快速启停技术、模型服务初始化阶段的数据预加载与加速技术等。

更新于 2025-11-14北京
logo of kuaishou
社招3-5年J0012

1、负责快手容器云超大规模算力平台的架构设计与开发工作,包括但不限于资源调度、服务编排及容器引擎等多领域场景; 2、基于云原生技术完善海量异构资源的多集群联邦和统一调度能力,构建低成本、高弹性的计算、存储、网络算力基座,致力于持续提升资源效率; 3、参与完善服务微架构及性能瓶颈分析观测体系,深入支撑容器平台及快手各类业务的全链路稳定性问题,持续提升业务运行质量; 4、云原生及大模型推理场景AI-Infra领域前沿技术,提升大规模的推理场景GPU利用效率。

更新于 2026-03-13北京|杭州
logo of alibaba
社招3年以上技术类-开发

团队介绍 国际站引擎团队主要负责支撑阿里国际站搜推以模型推理服务(包括大模型、搜推广模型),公司AI核心团队,处于高速发展阶段。团队技术氛围好,AI业务处于业界前沿。业务侧主要支持Alibaba.com AI化,以及Accio.com(B端AI产品)。 职位描述 负责支撑阿里国际站大模型模型后训练服务参与开发和优化大模型后训练框架,支持千卡H100 & B200分布式训练集群的相关优化参与大模型结构设计,并联合业务进行模型训练效率提升和效果验证。

更新于 2026-07-20杭州