logo of tongyi

通义Token Foundry-RL算法专家-Qwen

社招全职1年以上技术类-算法地点:北京 | 杭州 | 上海状态:招聘

工作描述


任职要求
1. 计算机、人工智能、自动化等相关专业本科及以上学历,硕士/博士优先。
2. 在强化学习(RL)与 Agent 方向具备扎实基础与实际经验,深入理解 PPO、GRPO 等主流 RL 算法及训练方法;有大模型 RL、Agent、代码生成、Reward Modeling 或大规模训练等相关经验者优先;具备复杂任务场景中的算法落地与系统优化经验者优先。
3. 对真实任务场景与模型行为有较强洞察力,具备目标导向的问题分析与推进能力;对算法、数据与 reward signal 有良好直觉,能够结合实际问题持续迭代方案并提升模型表现。

工作职责
强化学习(RL)是 Qwen 系列基础模型持续演进的重要技术方向,被…
登录查看完整工作描述
微信扫码,1秒登录

包括英文材料
学历+
强化学习+
还有更多 •••
相关职位

logo of tongyi
社招1年以上技术类-算法

1. 计算机科学、人工智能等相关专业硕士及以上学历,1 年以上 LLM 相关工作经验。 2. 扎实的强化学习和大模型算法基础,有 LLM、VLM 对齐(Alignment)或 RLHF 实际落地经验。

更新于 2026-07-09北京|杭州
logo of aligenie
社招3年以上技术类-开发

1. 计算机科学、软件工程或相关专业硕士及以上学历,3年以上后端系统或平台型产品研发经验。 2. 熟悉大模型驱动的Agent架构,具备Task Planning、Function Calling、

更新于 2026-06-15北京|杭州
logo of tongyi
社招1年以上技术类-开发

1. 硕士及以上学历,机械工程、自动化、计算机等相关专业。 2. 1 年以上机器人相关工作经验,具备真实机器人系统开发与调试经验,能够独立完成机器人平台的部署,有定位并解决系统问题(如控制抖动、通信延

更新于 2026-06-16杭州
logo of tongyi
社招3年以上技术类-算法

1. 计算机科学、人工智能、机器学习或相关领域的硕士或博士学位。 2. 在扩散模型、自回归模型、多模态生成理解、计算机视觉、NLP、AIGC、计算机图形学、机器学习等一个或多个领域有较深入的研究。 3

更新于 2026-09-14北京|杭州