logo of minimax

MiniMax大模型工程师-RL框架&RL推理

社招全职地点:北京 | 上海状态:招聘

工作描述


职位描述
RL 正在成为提升大模型能力的重要方向。大规模 RL 的效率和上限,不仅取决于算法设计,也高度依赖底层系统能力,包括 RL 框架、Rollout、推理 serving、调度策略、环境交互和系统稳定性。
MiniMax 自研强化学习训练系统 Forge,支撑大规模 RL 训练和 Rollout。Rollout 往往占据 RL 循环中的大量 wall-clock time,其生成效率、稳定性和灵活性,会直接影响算法迭代速度、实验规模和策略探索空间。
我们关注 RL 训练链路中的核心系统问题:如何更高效地生成轨迹,如何支持多轮交互、工具调用和复杂环境,如何降低长尾延迟,如何提升推理吞吐和资源利用率,以及如何让推理系统、模型结构和训练算法协同优化。
你会参与:
1. 建设和优化 Forge RL 框架,支撑大规模 RLHF / RLVR / Agentic RL 等训练任…
登录查看完整工作描述
微信扫码,1秒登录

包括英文材料
大模型+
算法+
强化学习+
RLHF+
缓存+
系统设计+
还有更多 •••
相关职位

logo of minimax
实习算法

RL 正在成为提升大模型能力的重要方向。大规模 RL 的效率和上限,不仅取决于算法设计,也高度依赖底层系统能力,包括 RL 框架、Rollout、推理 serving、调度策略、环境交互和系统稳定性。

更新于 2026-09-08北京|上海
logo of minimax
实习算法

RL 正在成为提升大模型能力的重要方向。大规模 RL 的效率和上限,不仅取决于算法设计,也高度依赖底层系统能力,包括 RL 框架、Rollout、推理 serving、调度策略、环境交互和系统稳定性。

更新于 2026-09-07北京|上海
logo of minimax
校招算法

我们希望你在某个领域有真正的深度——推理加速、GPU 性能优化、分布式系统、RL 工程,都行——同时对算法前沿保持真实的好奇心。你不需要什么都懂,但你应该知道自己不懂的东西在哪,并且想去弄懂它。 1.

更新于 2026-09-07北京|上海
logo of xiaohongshu
社招3-5年引擎

【任职资格】 1.熟练掌握Megatron/DeepSpeed/FSDP等框架的研发,熟练掌握模型并行分布式技术 2.对大语言模型算法感兴趣,有机器学习算法知识背景,因为我们日常也会训练模型来确保框架

更新于 2026-04-02北京|上海