阿里巴巴研究型实习生 - 强化学习RL算法研究
任职要求
1. 计算机、人工智能、自动化等相关专业在读硕士/博士。 2. 具备强化学习(RL)与 Agent 方向的基础知识与实践经历,了解 PPO、GRPO 等主流 RL 算法及训练方法;有大模型 RL、Agent、代码生成、Reward Modeling 或大规模训练相关经验者…
工作职责
强化学习(RL)是 Qwen 系列基础模型持续演进的重要技术方向之一。我们围绕大模型在复杂任务中的推理、规划、编码、工具调用与长程决策能力,持续探索 RL 在长程代码任务、视觉交互、真实环境执行、数学与代码竞赛等场景中的应用,推动模型在开放式复杂任务中的自主性与执行表现。欢迎对大模型与强化学习方向有兴趣和实践经验的硕博同学加入。 工作内容包括: 1. 研究 PPO、GRPO 等强化学习算法,提升训推分离场景下大规模 RL 训练的稳定性与效率;探索 RL scaling law、长程训练、多任务融合与系统优化等方向,提升模型持续训练收益与泛化能力。 2. 优化端到端 Agentic RL 链路,协助提升算法与系统整体效率,增强 agent 在推理、长程规划、代码生成与工具调用等场景中的能力;结合 critic model 与过程奖励机制,对 agent 行为进行有效引导,提升 scaffold 泛化性、指令跟随能力与推理效率。 3. 参与提升 RL 在长程任务与复杂开放任务中的表现,探索训练效率优化、复杂任务学习方法;研究多 agent 协作、自我反思、记忆机制与规划等方向,提升奖励信号、奖励模型与 agentic verifier 的准确性和鲁棒性。 4. 与研究员和工程师协作,持续迭代 coding agent 与 long-horizon agent 的训练数据、奖励信号与执行环境;参与改进合成数据生成方法,针对模型能力短板构建可验证的 RL 数据,提升基础模型在前沿 benchmark 与真实任务场景中的表现。
1. LLM-RL前沿探索与基础研究:深入研究泛化性/样本效率/持续学习/元学习/测试时扩展等课题,负责理论分析、算法/基准测试/实验的设计与实现。 2. 引领学术与技术前沿,形成高水平论文/技术报告/开源项目。
结合强化学习算法以及大模型训推架构,对强化学习框架进行优化,提升大模型强化学习训练的效率。持续探索RL的前沿方向,实现丰富、便捷的真实环境交互能力。通过冗余生成、投机采样等生成加速技术,动态调度计算资源,协同异构硬件基础设施,极致压缩RL训练的时间消耗。从PPO、GRPO扩展出更丰富的RL算法范式,提升大模型在长思考、复杂推理方面的能力,推进大模型在国内最大的电商场景的业务落地。 职位职责包括但不限于: 1. 设计和实现机器学习系统所需要的大规模分布式计算系统,参与机器学习全生命周期(训练、推理、MLOps、CI/CD、AB testing)组件的开发与优化。 2. 构建业界领先的超大规模稀疏训练引擎,通过软硬件协同以及工程算法联合优化,持续榨取高性能异构硬件的性能潜力,不断推高分布式训练的性能天花板。 3. 构建业界先进的多模态、大语言训练引擎,通过持续的分布式训练优化,不断提升算法的训练规模,提升硬件的使用效率。 4. 构建超大规模全流程机器学习平台,覆盖从特征工程、样本构建到模型量化交付,并通过构建SQL计算引擎、分布式特征服务、样本湖等,提升特征样本计算存储效率。 5. 图学习、联邦学习、强化学习等多个AI方向算法工程解决方案的探索和落地。 6. 在机器学习系统的前沿领域(如分布式训练、软硬协同设计等)参与应用驱动的研究。
一、关于阿里巴巴国际站 阿里巴巴国际站是全球领先的跨境 B2B 数字贸易平台,致力于推动全球贸易数字化升级。在这里,你将有机会直接参与 B2B 场景下核心广告算法问题的研究与实践,深入探索工业级智能广告系统的前沿技术。 二. 关于项目 本项目旨在解决国际B类业务下,转化数据的延迟性与稀疏性对整体广告业务造成的挑战,包括但不限于稀疏转化行为的精准表征,转化预估模型的预估准确度,出价模型的离在线不一致等,提升广告智能出价整体性能。 二. 你的职责 1. 调研与前沿追踪:跟进工业界与学术界在稀疏数据处理、转化预估、自动出价策略等方向的最新研究进展,持续探索可落地的优化思路。 2. 模型与算法优化:研究稀疏数据场景下转化预估模型与出价模型的联动优化方法,提升智能出价整体效果与业务收益。 3. 落地实践:参与模型搭建、算法调优与实验分析,将理论方案转化为线上可用的生产能力;同时,对研究成果进行整理,撰写高质量论文并尝试投稿。
我们正在寻找对大模型系统优化充满热情的优秀在读学生,参与大模型后训练阶段(Post-Training)关键系统与架构的前沿研究。你将深度参与千亿级大模型在强化学习训练、推理效率、训推分离架构、智能体(Agent)系统等方面的系统级优化工作,探索高MFU、低延迟、高吞吐的下一代AI基础设施。 如果你热爱系统与AI的交叉领域,希望在真实超大规模场景中打磨技术,欢迎加入我们,与顶尖研究者和工程师共同推动大模型系统的技术边界! 研究方向与实习内容: 你将从以下四个核心方向中选择1-2个深入参与,开展系统性研究与工程实现: 1. 后训练 MFU(Model FLOPs Utilization)优化 研究SFT、RLHF、DPO等后训练任务中的计算效率瓶颈; 设计高MFU的训练策略与系统支持,优化计算密度(如序列填充、混合批次、梯度累积等); 探索算力利用率提升路径,结合通信、显存、计算进行端到端建模与优化。 2. 强化学习推理框架优化 针对RLHF中大量采样推理的需求,优化推理延迟与吞吐(如Speculative Decoding、KV Cache复用、动态批处理); 设计轻量、高效的推理引擎,支持多轮对话、长上下文、流式生成等复杂场景; 探索训练-采样协同优化,降低推理端对训练整体效率的制约。 3. 强化学习训推分离架构优化 构建解耦的“训练-采样”系统架构,支持高并发采样与异步训练更新; 研究采样集群与训练集群之间的资源调度、数据同步与负载均衡机制; 实现弹性扩缩容、故障恢复、版本管理等系统能力,提升整体稳定性与可扩展性。 4. Agent 框架优化与系统支撑 研究面向复杂任务的Agent执行框架,优化工具调用、状态管理、多步规划的系统性能; 构建低延迟、高并发的Agent运行时环境,支持大规模仿真与自动评估; 探索Agent工作流的可复现性、可观测性与调试支持,提升研发效率。