快手语言大模型算法专家-【强化学习方向】
社招全职3-5年J0011地点:北京状态:招聘
工作描述
任职要求 1、硕士及以上学历,强化学习相关专业优先; 2、在大规模预训练、模型对齐、强化学习、RAG、Agent等至少一个方向有深厚的项目经验和洞察力; 3、动手能力强,编程能力强…
登录查看完整工作描述
微信扫码,1秒登录
包括英文材料
学历+
强化学习+
https://cloud.google.com/discover/what-is-reinforcement-learning?hl=en
Reinforcement learning (RL) is a type of machine learning where an "agent" learns optimal behavior through interaction with its environment.
https://huggingface.co/learn/deep-rl-course/unit0/introduction
This course will teach you about Deep Reinforcement Learning from beginner to expert. It’s completely free and open-source!
https://www.kaggle.com/learn/intro-to-game-ai-and-reinforcement-learning
Build your own video game bots, using classic and cutting-edge algorithms.
还有更多 •••
相关职位
社招3年以上技术类-算法
1. 硕士及以上学历,计算机科学或相关专业背景。 2. 具备大模型研发经验,在 Post-Training(如SFT、RL、OPD等)某一方向上有实操积累。 3. 算法与工程兼备。熟悉数据与训练策略,
更新于 2026-09-07北京|上海|杭州
社招3年以上云智能集团
1. 具备扎实的大语言模型post-training实践经验(SFT/RL/Agent等)和垂域大模型研发落地经历;所研发模型具备大规模线上应用经历(如日均调用量达千万及以上)者优先。 2. 精通Py
更新于 2026-04-03杭州

社招3年以上
1. 具备扎实的大语言模型post-training实践经验(SFT/RL/Agent等)和垂域大模型研发落地经历;所研发模型具备大规模线上应用经历(如日均调用量达千万及以上)者优先。 2. 精通Py
更新于 2026-04-03杭州