logo of xiaohongshu

小红书大模型强化学习训练引擎研发工程师(练习生)

校招全职引擎地点:北京 | 上海状态:招聘

任职要求


任职资格:
1、优秀的代码能力、数据结构和基础算法功底,熟悉Python开发,熟悉 Linux/Git开发环境;
2、有较好的学习能力、沟通协作能力和自驱力,能和团队一起探索新技术,推进技术进步(⭐️有大牛带着成长)
2、熟悉至少一种主流基础深度学习训练框架(TensorFlow/PyTorch/PaddlePaddle等)的使用和实现;
3、了解主流LLM模型结构,使用过至少一种主流LLM训练框架(Megatron-LM/DeepSpeed/veRL等);

加分项:…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


工作职责:
1、参与千亿级大模型的分布式强化学习 RL 训练框架研发,提升百卡~千卡级训练吞吐与资源利用率
2、参与 100B以上多模态强化学习算法流程适配(如DAPO等),各领域任务的 RL 正确性验证
3、实验并调优不同并行策略(Tensor/ZeRO/FSDP/Pipeline Parallelism)在超大规模模型上的最佳配置组合
4、协助定位分析分布式训练中的关键性能瓶颈(如GPU利用率低、显存瓶颈、网络通信阻塞、I/O延迟等),设计并实施优化方案进行验证。
5、参与研发/优化训练引擎的关键特性,如大规模集群下的稳定断点续训、高性能异步Rollout机制、以及高性能算子(Kernel)的集成与优化。
包括英文材料
数据结构+
算法+
Python+
Linux+
Git+
深度学习+
TensorFlow+
还有更多 •••
相关职位

logo of quark
社招1年以上

1、负责千卡以上规模文本及多模态大模型强化学习训练框架建设;为Quark、通义等过亿用户,提供大模型后训练能力,持续优化模型效果; 2、负责调研和实现业界先进的强化学习方法,并探索算法工程结合的训练方法创新设计,实现模型性能和训练效率的双提升; 3、负责训练效率极致优化,通过前沿技术的调研、引入,以及机制创新,实现业界领先的训练吞吐能力。

更新于 2025-11-30北京|杭州|广州
logo of tencent
社招3年以上AI技术

1.负责混元多模态大模型的RL后训练框架研发; 2.设计和开发高效的框架和算子,以支持各种硬件加速器; 3.参与强化学习算法的优化和实现,提高训练和推理性能; 4.跨团队协作,与算法、软件、硬件团队密切合作,提高框架性能和稳定性。

更新于 2026-04-03深圳
logo of amap
实习高德研究型实习生

- 岗位职责:构建适用于高德AI Agent的大模型技术体系,包括 SFT,RM,RL/Reasoning、Agentic RL 等能力的建设。 - 组内情况:组内成员在各类顶会上发表论文多篇,有完善的指导及充足的GPU资源,实习优秀者可在组内转正。

更新于 2026-01-26北京
logo of quark
社招1年以上

1、负责千卡以上大规模混合模态大模型强化学习训练框架建设,调研和实现业界先进的强化学习方法,并探索算法工程结合的训练方法创新设计,实现模型性能和训练效率的双提升; 2、打通复杂工具调用场景的高性能推理与Agent训练系统,攻克长程数据训练中的训练效率、训推一致性等难点,显著提升千问模型基于多种阿里生态工具(如闪购、飞猪等)的用户真实任务解决率; 3、参与奖励系统、工具系统交互的设计与研发,打造高效率的可持续扩展架构;并通过线上链路的联合设计保障模型训练效果的对齐,保障模型在事实性、复杂任务规划解决等方面的能力提点可以落地千问App。

更新于 2026-07-29北京|杭州