快手多模态大模型后训练算法专家-【Keye】
社招全职J0011地点:北京状态:招聘
工作描述
任职要求 1、硕士及以上学历,计算机科学、人工智能、自动化、数学等相关专业优先; 2、精通多模态任务设计范式(如视觉思维链、跨模态推理链),具备CoT提示工程、Reward Model设计经验,掌握合成数据生成、多模态数据清洗、数据质量评估工具开发。熟练应用PyTorch+DeepSpeed、Megatron-LM等分布式框架,精通QLoRA、DPO、RLHF以及PPO/GRPO/DAPO等后训练技术; 3、主导过千亿级模型的后训练全流程,包括SFT数据构建、RM训练、RLHF/DPO对齐优化、端侧量化部署。具备丰富的多模态数据治理经验,如…
登录查看完整工作描述
微信扫码,1秒登录
包括英文材料
学历+
PyTorch+
https://datawhalechina.github.io/thorough-pytorch/
PyTorch是利用深度学习进行数据科学研究的重要工具,在灵活性、可读性和性能上都具备相当的优势,近年来已成为学术界实现深度学习算法最常用的框架。
https://www.youtube.com/watch?v=V_xro1bcAuA
Learn PyTorch for deep learning in this comprehensive course for beginners. PyTorch is a machine learning framework written in Python.
RLHF+
[英文] What is RLHF?
https://aws.amazon.com/what-is/reinforcement-learning-from-human-feedback/
Reinforcement learning from human feedback (RLHF) is a machine learning (ML) technique that uses human feedback to optimize ML models to self-learn more efficiently.
https://www.ibm.com/think/topics/rlhf
Reinforcement learning from human feedback (RLHF) is a machine learning technique in which a “reward model” is trained with direct human feedback, then used to optimize the performance of an artificial intelligence agent through reinforcement learning.
SFT+
https://cameronrwolfe.substack.com/p/understanding-and-using-supervised
Understanding how SFT works from the idea to a working implementation...
还有更多 •••
相关职位
实习阿里巴巴2027
1、计算机科学、人工智能、机器学习或相关领域的硕士或博士学位; 2、在扩散模型、自回归模型、多模态生成理解、计算机视觉、NLP、AIGC、计算机图形学、机器学习等一个或多个领域有较深入的研究;数学公式
更新于 2026-03-22北京|杭州
实习阿里巴巴2027
1. 学术背景:计算机、人工智能、机器学习等相关方向的优秀硕士或博士毕业生,具备扎实的理论基础; 2. 代码能力:具备优秀的编码能力与数据结构基础,熟练掌握PyTorch,有大模型训练经验; 3. 问
更新于 2026-03-17北京|杭州
社招3年以上腾讯地图基础能力
1.计算机、人工智能、模式识别等相关专业硕士及以上学历,3年以上大模型后训练或相关领域工作经验; 2.熟练掌握深度学习框架(如PyTorch、TensorFlow),有丰富的模型微调、Prompt工
更新于 2025-11-20北京