阿里巴巴日常实习生-RLHF算法工程师-Qwen基础模型
实习兼职阿里巴巴日常实习生地点:北京 | 杭州 | 上海状态:招聘
任职要求
1. 计算机、机器学习、人工智能、自然语言处理等相关专业,硕士及以上学历。 2. 具有 RLHF / Reward Modeling / 偏好对齐方向的实践经验,熟悉 PPO、DPO、GRPO 等主流算法的原理与工程实现。 3. 精通 Python 及 PyTorch 等深度学习框架,具备扎实的工程能力,能够独立完成从数据处理、模型训练到评测部署的全链路工作。 4. 对数据质量高度敏感,具备优秀的数据分析与问题诊断能力,能够从复杂反馈信号中提炼有效的优化方向。 加分项 1. 熟悉主流 RL 训…
登录查看完整任职要求
微信扫码,1秒登录
工作职责
团队介绍 千问(Qwen)是由阿里巴巴自主研发的超大规模语言模型,具备跨语言、跨任务的理解与生成能力。Qwen系列模型,涵盖参数量从几百 M 到 T 级的基座大语言模型,并相继推出Qwen-VL、Qwen-Audio、Qwen-Omni、Qwen-Coder、Qwen-Image等系列模型。从多轮对话到代码生成,从逻辑推理到内容创作,从单一多模态到全模态统一理解生成,Qwen 正在打造全球领先的全模态模型技术体系,推动AI在企业服务、开发者生态、个人用户等领域的深度应用,引领下一代人工智能的发展。 工作内容 1. 用户偏好采集与建模:设计并构建系统化的用户偏好数据采集方案,深入分析用户行为与反馈信号,建立多维度、可扩展的用户偏好表征与建模体系,为 Reward Model 训练提供高质量数据基础。 2. Reward Model 训练与优化:训练高精度、低偏差的 Reward Model,覆盖创作质量、指令遵循、安全对齐、人类偏好等多个专项维度;持续优化训练策略,有效缓解 Reward Hacking 与分布偏移问题,为下游 RL 训练(PPO / GRPO 等)和用户偏好评测提供可靠的奖励信号。 3. 用户反馈分析与 Badcase 聚类:建立从线上用户反馈到模型迭代的闭环机制,利用聚类、归因分析等方法系统性挖掘 Badcase,定位模型能力短板与偏好盲区,驱动数据策略与训练目标的持续优化。 4. LLM Judge / Verifier 体系建设:研究并构建基于 LLM 的自动化评测与验证体系,设计可 Scalable 的 Verifier 信号,使其既能作为高效的偏好评测工具,也能作为奖励信号直接融入 RL 训练流程,提升模型迭代的自动化程度与覆盖广度。 5. 偏好对齐前沿探索:持续跟踪 RLHF / RLAIF / DPO / Constitutional AI 等对齐技术的前沿进展,探索更高效的偏好学习范式,推动 Qwen 在对齐质量与训练效率上的双重突破。
包括英文材料
机器学习+
https://www.youtube.com/watch?v=0oyDqO8PjIg
Learn about machine learning and AI with this comprehensive 11-hour course from @LunarTech_ai.
https://www.youtube.com/watch?v=i_LwzRVP7bg
Learn Machine Learning in a way that is accessible to absolute beginners.
https://www.youtube.com/watch?v=NWONeJKn6kc
Learn the theory and practical application of machine learning concepts in this comprehensive course for beginners.
https://www.youtube.com/watch?v=PcbuKRNtCUc
Learn about all the most important concepts and terms related to machine learning and AI.
NLP+
https://www.youtube.com/watch?v=fNxaJsNG3-s&list=PLQY2H8rRoyvzDbLUZkbudP-MFQZwNmU4S
Welcome to Zero to Hero for Natural Language Processing using TensorFlow!
https://www.youtube.com/watch?v=R-AG4-qZs1A&list=PLeo1K3hjS3uuvuAXhYjV2lMEShq2UYSwX
Natural Language Processing tutorial for beginners series in Python.
https://www.youtube.com/watch?v=rmVRLeJRkl4&list=PLoROMvodv4rMFqRtEuo6SGjY4XbRIVRd4
The foundations of the effective modern methods for deep learning applied to NLP.
学历+
RLHF+
[英文] What is RLHF?
https://aws.amazon.com/what-is/reinforcement-learning-from-human-feedback/
Reinforcement learning from human feedback (RLHF) is a machine learning (ML) technique that uses human feedback to optimize ML models to self-learn more efficiently.
https://www.ibm.com/think/topics/rlhf
Reinforcement learning from human feedback (RLHF) is a machine learning technique in which a “reward model” is trained with direct human feedback, then used to optimize the performance of an artificial intelligence agent through reinforcement learning.
算法+
https://roadmap.sh/datastructures-and-algorithms
Step by step guide to learn Data Structures and Algorithms in 2025
https://www.hellointerview.com/learn/code
A visual guide to the most important patterns and approaches for the coding interview.
https://www.w3schools.com/dsa/
Python+
https://liaoxuefeng.com/books/python/introduction/index.html
中文,免费,零起点,完整示例,基于最新的Python 3版本。
https://www.learnpython.org/
a free interactive Python tutorial for people who want to learn Python, fast.
https://www.youtube.com/watch?v=K5KVEU3aaeQ
Master Python from scratch 🚀 No fluff—just clear, practical coding skills to kickstart your journey!
https://www.youtube.com/watch?v=rfscVS0vtbw
This course will give you a full introduction into all of the core concepts in python.
PyTorch+
https://datawhalechina.github.io/thorough-pytorch/
PyTorch是利用深度学习进行数据科学研究的重要工具,在灵活性、可读性和性能上都具备相当的优势,近年来已成为学术界实现深度学习算法最常用的框架。
https://www.youtube.com/watch?v=V_xro1bcAuA
Learn PyTorch for deep learning in this comprehensive course for beginners. PyTorch is a machine learning framework written in Python.
还有更多 •••
相关职位
实习虎鲸文娱实习生招
1、图形方向:参与实时路径追踪渲染器、UE5图形算法改进、UE引擎模块优化等方面的研发,包括但不限于渲染管线、图形算法、物理仿真(布料、软体肌肉)等,以及关联DCC软件的生产效率工具链研发 2、AI方向:参与AI与CG结合的前沿技术研发,包括但不局限于神经渲染、超分、降噪、AI物理仿真模拟等领域,探索机器学习、深度学习等数据驱动方法在动画电影、游戏、影视拍摄中的应用
更新于 2026-05-07北京|杭州
实习虎鲸文娱实习生招
1、研究和探索可控的视觉内容生成技术,负责视觉内容生成模型等相关算法的研发和落地,结合公司业务场景进行相关策略迭代 2、探索时空内容可控生成技术,包括图片/视频风格迁移、镜头控制、空间一致性控制等 3、持续跟踪图像和视频生成领域的最新技术动态,评估并实施前沿技术,推动技术在公司产品中的应用与创新
更新于 2026-03-11北京
实习阿里巴巴日常实习
你要做什么 借助 AIGC 工具,高效产出各类风格的音乐 demo 对成品做音乐性把关,输出清晰、可执行的优化反馈 配合团队,把内容趋势转化为具体的选题方向和制作方案 跟踪 B 站 / 抖音 / 小红书 / 网易云的音乐二创热点,沉淀热门曲目与改编方向的选题库
更新于 2026-06-29北京|杭州