logo of kuaishou

快手【快Star-X】大模型推理/训练引擎研发工程师

校招全职J1020地点:上海 | 北京状态:招聘

任职要求


1、本科以上学历,电子、自动化、计算机类专业优先;
2、了解分布式系统或高性能计算相关知识,具备良好的系统编程、数据结构算法基础、系统设计能力;
3、熟悉Linux开发环境、熟练使用Pytorch训练框架,掌握 C++/Python编程语言;
4、具有良好的团队合作精神和沟通能力。热爱钻研技术,善于分析、解决工程问题,能够对算法和底层的协同优化起到核心桥梁作用。

加分项:
1、熟悉tensorflowpytorchTensorRT、FasterTransformer等主流推理和训练框架,并有相关优化经验者优先;
2、具备大模型训练、分布式训练、微调经验、HPC基础知识,了解集合通信和CUDA编程,熟悉triton、cutlass、有算子库开发经验者优先;
3、在国际顶级会议/期刊上有相关论文发表优先;
4、有机器学习平台开发和深度学习框架开发等领域开发经验优先。

工作职责


1、参与快手大规模深度学习推理引擎、大模型训练解决方案的研发与优化,包括大模型推理、模型训练框架、微调平台等;
2、参与底层算子的优化、通过优化访存pattern、计算提升推理性能。与算法部门合作,为公司大模型定制训练方案,探索RLHF、MoE、多模态、longcontext等前沿方向,提升训练性能;
3、优化推理框架上层调度策略,通过机内、机间的计算任务调度和通讯优化提升引擎性能;优化现有大语言模型相关工具和平台,提高模型训练、维护效率,降低成本,提升训练服务稳定性。
包括英文材料
学历+
分布式系统+
数据结构+
算法+
系统设计+
Linux+
PyTorch+
C+++
Python+
TensorFlow+
TensorRT+
大模型+
HPC+
CUDA+
机器学习+
深度学习+
相关职位

logo of kuaishou
实习J1020

1、参与快手大规模深度学习推理引擎、大模型训练解决方案的研发与优化,包括大模型推理、模型训练框架、微调平台等; 2、参与底层算子的优化、通过优化访存pattern、计算提升推理性能。与算法部门合作,为公司大模型定制训练方案,探索RLHF、MoE、多模态、longcontext等前沿方向,提升训练性能; 3、优化推理框架上层调度策略,通过机内、机间的计算任务调度和通讯优化提升引擎性能;优化现有大语言模型相关工具和平台,提高模型训练、维护效率,降低成本,提升训练服务稳定性。

更新于 2025-06-04
logo of kuaishou
校招J1001

1、参与快手大语言模型、多模态基座模型的训练/推理引擎研发及优化工作; 2、参与快手自研生成式推荐大模型训练全链路开发和优化,以及快手广告、电商、直播、搜索等全域模型的训练全链路研发与优化; 3、设计和优化分布式训练框架,通过混合并行,通信计算overlap、低精度训练等方法解决超长序列、超大规模moe场景下的训练效率问题; 4、参与通用高性能RL框架的开发和优化,包括但不限于高效rollout、高效RL链路调度优化等; 5、通过各种技术手段持续优化性能,降低推理成本,包括但不限于:算子/编译优化、异构推理、模型量化&蒸馏、分布式并行等。

更新于 2025-07-25
logo of kuaishou
校招J1020

1、参与多模态模型、视频生成模型等大模型的分离式推理编排、异构算力匹配、全球化计算调度; 2、参与大规模异构算力集群的算力资源池化、弹性资源混部、潮汐资源调度; 3、基于HBO、强化学习等优化算法,持续优化工业级多模态视频生成、多模态内容理解系统的耗时体验与算力消耗。

更新于 2025-06-27
logo of kuaishou
校招J1020

1、参与多模态模型、视频生成模型等大模型的全链路数据生产流水线搭建; 2、参与多模态数据处理所需的LLM/VLM模型推理、跨模态检索、跨模态对齐等工程系统的建设; 3、基于各类分布式数据处理以及推理优化技术,持续优化超大规模多模态数据处理的推理、存储以及检索效率。

更新于 2025-06-27