快手大模型AI Infra底软/硬件加速工程师-【可灵AI专项】
社招全职3-5年J0011地点:北京状态:招聘
任职要求
1、掌握Python/C++编程语言,熟练使用Pytorch训练框架或SGlang/vLLM等大模型推理框架; 2、掌握大模型领域基础算法知识,熟悉常规Transformer/SD模型结构,以及对应的常用性能优化方法; 3、深刻理解GPU硬件体系结构,能熟练编写高性能cuda kernel; 加…
登录查看完整任职要求
微信扫码,1秒登录
工作职责
1、负责视频生成大模型/多模态大模型在最新硬件平台上的训练/推理性能分析与优化,目标达成该硬件平台上的极限性能; 2、负责分析并提升大规模分布式训练系统的集群性能,完成对大规模训练任务故障的根因定位与稳定性提升。
包括英文材料
Python+
https://liaoxuefeng.com/books/python/introduction/index.html
中文,免费,零起点,完整示例,基于最新的Python 3版本。
https://www.learnpython.org/
a free interactive Python tutorial for people who want to learn Python, fast.
https://www.youtube.com/watch?v=K5KVEU3aaeQ
Master Python from scratch 🚀 No fluff—just clear, practical coding skills to kickstart your journey!
https://www.youtube.com/watch?v=rfscVS0vtbw
This course will give you a full introduction into all of the core concepts in python.
C+++
https://www.learncpp.com/
LearnCpp.com is a free website devoted to teaching you how to program in modern C++.
https://www.youtube.com/watch?v=ZzaPdXTrSb8
PyTorch+
https://datawhalechina.github.io/thorough-pytorch/
PyTorch是利用深度学习进行数据科学研究的重要工具,在灵活性、可读性和性能上都具备相当的优势,近年来已成为学术界实现深度学习算法最常用的框架。
https://www.youtube.com/watch?v=V_xro1bcAuA
Learn PyTorch for deep learning in this comprehensive course for beginners. PyTorch is a machine learning framework written in Python.
SGLang+
[英文] Install SGLang
https://docs.sglang.ai/get_started/install.html
SGLang is a fast serving framework for large language models and vision language models.
https://github.com/sgl-project/sgl-learning-materials
vLLM+
https://www.newline.co/@zaoyang/ultimate-guide-to-vllm--aad8b65d
vLLM is a framework designed to make large language models faster, more efficient, and better suited for production environments.
https://www.youtube.com/watch?v=Ju2FrqIrdx0
vLLM is a cutting-edge serving engine designed for large language models (LLMs), offering unparalleled performance and efficiency for AI-driven applications.
大模型+
https://www.youtube.com/watch?v=xZDB1naRUlk
You will build projects with LLMs that will enable you to create dynamic interfaces, interact with vast amounts of text data, and even empower LLMs with the capability to browse the internet for research papers.
https://www.youtube.com/watch?v=zjkBMFhNj_g
还有更多 •••
相关职位
社招3-5年大模型
数据工程 详负责支撑 dots(LLM / 多模态 / Agentic)训练与对齐所需的超大规模数据工程体系,覆盖从 数据生产、清洗、存储、调度、分布式读取到质量闭环的全链路。 RL 训练框架 负责强化学习系统的规模化落地,优化分布式 RL 训练吞吐,处理长序列/推理/CLI Agent 任务 算子优化 深入 CUDA/CuteDSL/TileLang 底层,攻克性能瓶颈(如 FlashMLA、Mega Kernel、低精度算子、通信计算重叠优化) 推理引擎 打造高并发、低延迟的推理架构,优化 PD/AF 分离 schedule、解耦架构及动态资源调度
更新于 2026-07-17北京|上海
社招3-5年J0012
1、负责大数据方向Flink&Spark on K8S的关键能力建设,包括:Spark 高吞吐调度、Flink 极致负载均衡、Spark 计算 Offload 至 GPU 的调度支持、大数据作业资源弹性调度等; 2、负责大模型训练的ETTR(端到端训练启动时间)优化与 MFU(模型计算利用率)提升的关键技术能力建设,包括:GPU容器冷/热快速启停技术、模型服务初始化阶段的数据预加载与加速技术等。
更新于 2025-11-14北京
社招3-5年J0012
1、负责快手容器云超大规模算力平台的架构设计与开发工作,包括但不限于资源调度、服务编排及容器引擎等多领域场景; 2、基于云原生技术完善海量异构资源的多集群联邦和统一调度能力,构建低成本、高弹性的计算、存储、网络算力基座,致力于持续提升资源效率; 3、参与完善服务微架构及性能瓶颈分析观测体系,深入支撑容器平台及快手各类业务的全链路稳定性问题,持续提升业务运行质量; 4、云原生及大模型推理场景AI-Infra领域前沿技术,提升大规模的推理场景GPU利用效率。
更新于 2026-03-13北京|杭州