logo of bilibili

哔哩哔哩强化学习训练算法实习生

实习兼职技术类地点:北京状态:招聘

任职要求


1、本科及以上学历,计算机、人工智能、数学、自动化等相关专业;
2、了解自然语言处理计算机视觉或多模态算法,了解主流的 DiT(Diffusion Transformer) 与 VLM(Vision-Language Model) 模型架构;
3、熟悉至少 2 种主流强化学习算法原理,熟悉至少一种强化学习训练框架;
4、…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


1、参与强化学习核心算法的设计、实现与优化,探索 RL 在扩散模型去噪过程中的应用,包括但不限于 PPO、DPO、GRPO、DAPO、ReFL等内容;
2、参与强化学习训练框架建设,搭建并且持续优化 Agentic RL 链路;
3、参与奖励模型和偏好数据集的构建与迭代,设计针对多模态生成质量(美学、一致性、指令遵循)的细粒度评价信号;
包括英文材料
学历+
NLP+
OpenCV+
算法+
Transformer+
强化学习+
PyTorch+
还有更多 •••
相关职位

logo of bilibili
实习技术类

1、参与强化学习核心算法的设计、实现与优化,探索 RL 在扩散模型去噪过程中的应用,包括但不限于 PPO、DPO、GRPO、DAPO、ReFL等内容; 2、参与强化学习训练框架建设,搭建并且持续优化 Agentic RL 链路; 3、参与奖励模型和偏好数据集的构建与迭代,设计针对多模态生成质量(美学、一致性、指令遵循)的细粒度评价信号;

更新于 2026-07-30上海
logo of bilibili
实习技术类

1、参与强化学习训练框架的研发与性能优化,根据业务需求持续演进训练策略与系统能力,提升大规模模型训练效率; 2、深度分析与定位训练系统中的性能瓶颈(包括计算、通信、存储等),实施针对性优化,提升训练吞吐、稳定性与可扩展性;

更新于 2026-07-30北京
logo of bilibili
实习技术类

1、参与强化学习训练框架的研发与性能优化,根据业务需求持续演进训练策略与系统能力,提升大规模模型训练效率; 2、深度分析与定位训练系统中的性能瓶颈(包括计算、通信、存储等),实施针对性优化,提升训练吞吐、稳定性与可扩展性; 3、持续跟踪并集成业界前沿的训练优化技术(如 MoE、异步RL、LoRA RL、Agentic RL 等)。

更新于 2026-07-30上海
logo of xiaohongshu
校招引擎

工作职责: 1、参与千亿级大模型的分布式强化学习 RL 训练框架研发,提升百卡~千卡级训练吞吐与资源利用率 2、参与 100B以上多模态强化学习算法流程适配(如DAPO等),各领域任务的 RL 正确性验证 3、实验并调优不同并行策略(Tensor/ZeRO/FSDP/Pipeline Parallelism)在超大规模模型上的最佳配置组合 4、协助定位分析分布式训练中的关键性能瓶颈(如GPU利用率低、显存瓶颈、网络通信阻塞、I/O延迟等),设计并实施优化方案进行验证。 5、参与研发/优化训练引擎的关键特性,如大规模集群下的稳定断点续训、高性能异步Rollout机制、以及高性能算子(Kernel)的集成与优化。

更新于 2026-06-08北京|上海