阿里云阿里云智能-大语言模型强化学习框架研发专家-PAI
社招全职3年以上云智能集团地点:北京 | 杭州状态:招聘
任职要求
● 计算机、软件工程、人工智能相关专业硕士及以上学历。 ● 扎实的工程能力,优良的编程风格,熟悉Python/Go语言和常用设计模式,具备复杂系统的设计开发调试能力。 ● 熟悉深度学习的基础理论概念,了解主流模型算法,能够熟练应用PyTorch等框架。 …
登录查看完整任职要求
微信扫码,1秒登录
工作职责
● 强化学习训推分离架构优化,构建解耦的“训练-采样”系统架构,支持高并发采样与异步训练更新; 研究采样集群与训练集群之间的资源调度、数据同步与负载均衡机制;实现弹性扩缩容、故障恢复、版本管理等系统能力,提升整体稳定性与可扩展性。 ● 后训练 MFU(Model FLOPs Utilization)优化。研究SFT、RLHF、DPO等后训练任务中的计算效率瓶颈;设计高MFU的训练策略与系统支持,优化计算密度(如序列填充、混合批次、梯度累积等);探索算力利用率提升路径,结合通信、显存、计算进行端到端建模与优化。 ● 强化学习推理框架优化,针对RLHF中大量采样推理的需求,优化推理延迟与吞吐(如Speculative Decoding、KV Cache复用、动态批处理);设计轻量、高效的推理引擎,支持多轮对话、长上下文、流式生成等复杂场景;探索训练-采样协同优化,降低推理端对训练整体效率的制约。 ● Agent 框架优化与系统支撑,研究面向复杂任务的Agent执行框架,优化工具调用、状态管理、多步规划的系统性能;构建低延迟、高并发的Agent运行时环境,支持大规模仿真与自动评估;探索Agent工作流的可复现性、可观测性与调试支持,提升研发效率。
包括英文材料
学历+
Python+
https://liaoxuefeng.com/books/python/introduction/index.html
中文,免费,零起点,完整示例,基于最新的Python 3版本。
https://www.learnpython.org/
a free interactive Python tutorial for people who want to learn Python, fast.
https://www.youtube.com/watch?v=K5KVEU3aaeQ
Master Python from scratch 🚀 No fluff—just clear, practical coding skills to kickstart your journey!
https://www.youtube.com/watch?v=rfscVS0vtbw
This course will give you a full introduction into all of the core concepts in python.
Go+
https://www.youtube.com/watch?v=8uiZC0l4Ajw
学习Golang的完整教程!从开始到结束不到一个小时,包括如何在Go中构建API的完整演示。没有多余的内容,只有你需要知道的知识。
设计模式+
https://liaoxuefeng.com/books/java/design-patterns/index.html
设计模式,即Design Patterns,是指在软件设计中,被反复使用的一种代码设计经验。使用设计模式的目的是为了可重用代码,提高代码的可扩展性和可维护性。
[英文] Design Patterns
https://refactoring.guru/design-patterns
Design patterns are typical solutions to common problems in software design. Each pattern is like a blueprint that you can customize to solve a particular design problem in your code.
https://www.youtube.com/watch?v=NU_1StN5Tkk
Design Patterns tutorial explained in simple words using real-world examples.
深度学习+
https://d2l.ai/
Interactive deep learning book with code, math, and discussions.
还有更多 •••
相关职位

社招3年以上
● 强化学习训推分离架构优化,构建解耦的“训练-采样”系统架构,支持高并发采样与异步训练更新; 研究采样集群与训练集群之间的资源调度、数据同步与负载均衡机制;实现弹性扩缩容、故障恢复、版本管理等系统能力,提升整体稳定性与可扩展性。 ● 后训练 MFU(Model FLOPs Utilization)优化。研究SFT、RLHF、DPO等后训练任务中的计算效率瓶颈;设计高MFU的训练策略与系统支持,优化计算密度(如序列填充、混合批次、梯度累积等);探索算力利用率提升路径,结合通信、显存、计算进行端到端建模与优化。 ● 强化学习推理框架优化,针对RLHF中大量采样推理的需求,优化推理延迟与吞吐(如Speculative Decoding、KV Cache复用、动态批处理);设计轻量、高效的推理引擎,支持多轮对话、长上下文、流式生成等复杂场景;探索训练-采样协同优化,降低推理端对训练整体效率的制约。 ● Agent 框架优化与系统支撑,研究面向复杂任务的Agent执行框架,优化工具调用、状态管理、多步规划的系统性能;构建低延迟、高并发的Agent运行时环境,支持大规模仿真与自动评估;探索Agent工作流的可复现性、可观测性与调试支持,提升研发效率。
更新于 2026-03-27北京|杭州
社招3-5年J0011
1、深入研究强化学习在快手自研语言大模型中的创新应用,提升大模型能力上限; 2、负责大模型的基础技术研究,包括但不限于训练算法、框架及模型架构相关的基础技术探索和创新; 3、在顶级会议与开源社区塑造快手大模型团队的技术影响力。
更新于 2026-07-03北京