哔哩哔哩强化学习训练框架实习生
任职要求
1、本科及以上学历,计算机相关专业; 2、熟悉 Python/C++ 中至少一种编程语言,具备扎实的工程基础; 3、了解自然语言处理、计算机视觉或多模态算法,了解主流的 DiT(Diffusion Transformer) 与 VLM(V…
工作职责
1、参与强化学习训练框架的研发与性能优化,根据业务需求持续演进训练策略与系统能力,提升大规模模型训练效率; 2、深度分析与定位训练系统中的性能瓶颈(包括计算、通信、存储等),实施针对性优化,提升训练吞吐、稳定性与可扩展性;
1、参与强化学习训练框架的研发与性能优化,根据业务需求持续演进训练策略与系统能力,提升大规模模型训练效率; 2、深度分析与定位训练系统中的性能瓶颈(包括计算、通信、存储等),实施针对性优化,提升训练吞吐、稳定性与可扩展性; 3、持续跟踪并集成业界前沿的训练优化技术(如 MoE、异步RL、LoRA RL、Agentic RL 等)。
1.参与开发优化大模型推理性能,提升长调用链 Agent 推理效果和推理性能; 2.搭建高性能的 Agent RL训练和推理框架,满足超长上下文(工具调用)场景下 Agent RL的训练效率以及训练稳定性; 3.参与大窗口、分布式训练的性能优化,持续跟进大模型训练框架前沿技术,进行关键技术预研以及落地验证; 4.深入分析模型后训练过程中的链路流程,包括数据加载、通信效率等,提升训练速度以及训练吞吐。
1.负责混元多模态大模型的RL后训练框架研发; 2.设计和开发高效的框架和算子,以支持各种硬件加速器; 3.参与强化学习算法的优化和实现,提高训练和推理性能; 4.跨团队协作,与算法、软件、硬件团队密切合作,提高框架性能和稳定性。
1.框架开发与优化:负责强化学习、模型精调、知识蒸馏等核心模块的设计与开发,提升框架的训练效率与易用性; 2.分布式训练支持:基于Megatron-LM、DeepSpeed等工具,优化大模型分布式训练策略(数据并行/张量并行/流水并行/专家并行等),解决显存、通信与计算瓶颈; 3.工具链构建:参与开发轻量化训练框架(如LLama-Factory、swift),支持快速模型微调、部署及多硬件平台适配; 4.前沿技术探索:跟踪学术动态(如RLHF、MoE架构、FlashMLA、EPLB、DualPipe等),将最新研究成果转化为框架功能,提升产品竞争力; 5.协作与文档:与产品团队紧密配合,提供框架级解决方案;编写技术文档与案例,赋能公有云客户。