通义Token Foundry-RL算法专家-Qwen
社招全职1年以上技术类-算法地点:北京 | 杭州 | 上海状态:招聘
工作描述
任职要求 1. 计算机、人工智能、自动化等相关专业本科及以上学历,硕士/博士优先。 2. 在强化学习(RL)与 Agent 方向具备扎实基础与实际经验,深入理解 PPO、GRPO 等主流 RL 算法及训练方法;有大模型 RL、Agent、代码生成、Reward Modeling 或大规模训练等相关经验者优先;具备复杂任务场景中的算法落地与系统优化经验者优先。 3. 对真实任务场景与模型行为有较强洞察力,具备目标导向的问题分析与推进能力;对算法、数据与 reward signal 有良好直觉,能够结合实际问题持续迭代方案并提升模型表现。 工作职责 强化学习(RL)是 Qwen 系列基础模型持续演进的重要技术方向,被…
登录查看完整工作描述
微信扫码,1秒登录
包括英文材料
学历+
强化学习+
https://cloud.google.com/discover/what-is-reinforcement-learning?hl=en
Reinforcement learning (RL) is a type of machine learning where an "agent" learns optimal behavior through interaction with its environment.
https://huggingface.co/learn/deep-rl-course/unit0/introduction
This course will teach you about Deep Reinforcement Learning from beginner to expert. It’s completely free and open-source!
https://www.kaggle.com/learn/intro-to-game-ai-and-reinforcement-learning
Build your own video game bots, using classic and cutting-edge algorithms.
还有更多 •••
相关职位
社招1年以上技术类-算法
1. 计算机科学、人工智能等相关专业硕士及以上学历,1 年以上 LLM 相关工作经验。 2. 扎实的强化学习和大模型算法基础,有 LLM、VLM 对齐(Alignment)或 RLHF 实际落地经验。
更新于 2026-07-09北京|杭州

社招3年以上技术类-开发
1. 计算机科学、软件工程或相关专业硕士及以上学历,3年以上后端系统或平台型产品研发经验。 2. 熟悉大模型驱动的Agent架构,具备Task Planning、Function Calling、
更新于 2026-06-15北京|杭州
社招1年以上技术类-开发
1. 硕士及以上学历,机械工程、自动化、计算机等相关专业。 2. 1 年以上机器人相关工作经验,具备真实机器人系统开发与调试经验,能够独立完成机器人平台的部署,有定位并解决系统问题(如控制抖动、通信延
更新于 2026-06-16杭州