logo of alibaba

阿里巴巴Qwen-Image 图像生成RL算法实习生

实习兼职阿里巴巴研究型实习生地点:北京 | 杭州状态:招聘

任职要求


1、计算机、数学、人工智能等相关专业硕士/博士在读,每周可实习5天,持续实习6个月及以上。
2、具备扎实的计算机视觉深度学习强化学习基础知识,深入理解强化学习基本原理,熟悉PPO、GRPO等大模型主流对齐算法。
3、有视觉生成模型(扩散模型/流匹配模型)或大语言模型后训练(SFT -> RM -> RL)完整流程实战经验者优先。
4、熟练掌握Python编程语言与PyTorch等主流深度学习框架,具备优秀的代码实现能力与大规模模型训练调优经验。
5、自我驱动力强,对AI行业有浓厚兴趣,具备出色的问题分析与解决能力,能够独立定位RL训练中的不稳定性与收敛问题。
…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


Qwen-Image(千问图像)团队是阿里巴巴ATH事业群-Token Foundry下的图像生成基座团队,自2025年初成立以来,先后发布了Qwen-Image、Qwen-Image-Edit、Qwen-Image-2.0等一系列业界领先的文生图与图像编辑基座大模型。团队正在打造全球领先的视觉生成技术体系,推动AI在企业服务、开发者生态及个人内容创作等领域的深度应用。我们专注于研发前沿视觉生成技术,充分探索数据与训练方法,旨在解决计算机视觉基本问题的同时,为AI赋予真正的创造力。

作为RL算法实习生,你将深度参与视觉生成大模型的后训练(Post-training)与人类偏好对齐工作,具体职责包括:
1、Reward Model(奖励模型)研发:负责高质量奖励模型的设计与训练,探索基于VLM的复合奖励信号(如逐点评分、思维链推理等),提升模型在图文一致性、美学质感、指令遵循及人脸身份一致性等维度的判别精度与泛化性能。
2、RL对齐算法优化:深入研究并落地主流强化学习及偏好对齐算法(如GRPO、RLHF等),优化图像生成与编辑任务的RL策略迭代,解决Reward Hacking问题,提升模型在复杂任务中的表现与稳定性。
3、多任务统一与策略蒸馏:探索面向多任务(如文生图与图像编辑)的联合训练与优化方案,参与在线策略蒸馏(OPD)等前沿技术的研发,将多任务教师模型合并为统一的生成模型,在不牺牲各任务质量的前提下实现能力统一。
4、偏好数据体系建设:与数据团队紧密合作,构建和优化人类偏好数据(Preference Data)流程,设计高效的数据采样与质量控制策略,探索利用强模型辅助生成高质量偏好数据(RLAIF),通过数据飞轮驱动模型效果提升。
5、前沿技术跟踪与落地:持续跟踪视觉生成与强化学习交叉领域的最新研究进展,结合Qwen-Image业务场景探索新的算法优化方向,撰写高质量技术报告,保持团队在该领域的技术领先性。
包括英文材料
OpenCV+
深度学习+
强化学习+
大模型+
算法+
SFT+
Python+
PyTorch+
还有更多 •••
相关职位

logo of tongyi
社招1年以上技术类-算法

Qwen-Image(千问图像)团队是阿里巴巴ATH事业群-Token Foundry下的图像生成基座团队,自2025年初成立,前后发布了Qwen-Image, Qwen-Image-Edit, Qwen-Image-2.0等一系列文生图、图像编辑基座大模型。Qwen-Image团队正在打造全球领先的图像生成技术体系,推动AI在企业服务、开发者生态、个人内容创作等领域的深度应用,引领下一代人工智能的发展。团队专注于研发视觉生成技术,其中研究内容包括但不限于:图像生成、图像编辑、理解生成一体化等,充分探索相关数据及训练方法研究,以期解决计算机视觉基本问题的同时,为 AI 赋予创造力。 工作描述: 专注于视觉通用大模型的设计、优化与高效部署,具体职责有以下方向: 1、研究高效的视觉通用大模型架构,应对复杂视觉任务,提升模型的准确性和泛化能力; 2、优化算子和通信机制,提升模型训练效率,降低硬件资源消耗,提高训练速度和资源利用率; 3、探索高效的训练策略,包括自适应学习率调整、正则化方法和优化算法选择,提升模型性能和稳定性; 4、设计和实现自动化评估方法,帮助研发团队及时发现模型不足,优化模型架构和训练策略; 5、研发数据过滤和标注相关模型,提高数据质量和可用性,为模型训练提供支持。

更新于 2026-07-01北京|杭州
logo of alibaba
实习阿里巴巴研究型实

团队介绍:Qwen-Image(千问图像)团队是阿里巴巴ATH事业群-Token Foundry下的图像生成基座团队,自2025年初成立以来,先后发布了Qwen-Image、Qwen-Image-Edit、Qwen-Image-2.0等一系列业界领先的文生图与图像编辑基座大模型。团队正在打造全球领先的视觉生成技术体系,推动AI在企业服务、开发者生态及个人内容创作等领域的深度应用。我们专注于研发前沿视觉生成技术,充分探索数据与训练方法,旨在解决计算机视觉基本问题的同时,为AI赋予真正的创造力。 作为数据算法实习生,你将深度参与视觉生成大模型的数据全链路建设,用高质量数据驱动模型能力跃升,具体职责包括: 1. 数据处理链路构建:深入理解视觉生成大模型的训练目标,设计并实现可靠、可扩展的数据处理流水线。实现海量多模态数据(图像、文本、视频等)的预处理、过滤、检索归类与规模化产出,支撑模型高效迭代。 2. 智能清洗与质量评估:利用开源模型对原始数据进行智能清洗、质量打分与标注,探索自动化数据筛选策略,持续提升训练数据的规模与质量。 3. 人工标注体系设计:与模型训练及评测团队密切合作,设计详细、可用的人工标注体系与规范。结合模型辅助,提高数据质量和可用性,为模型不同训练阶段提供高质量的数据支持。 4. 数据与模型协同优化:针对模型训练中暴露的数据问题(如噪声、偏差、模态对齐缺失等)设计工程化解决方案,探索数据与模型协同优化的新方法,你处理的数据将直接进入生成模型的训练。 5. 模型评测体系构建:协助建立专业且详尽的视觉生成大模型生成质量评估方法和基准测试,通过数据实验分析定位模型瓶颈,指引算法优化方向,建立“评测—分析—优化—复评”的迭代闭环。

更新于 2026-07-28北京|杭州
logo of tongyi
社招1年以上技术类-算法

Qwen-Image(千问图像)团队是阿里巴巴ATH事业群-Token Foundry下的图像生成基座团队,自2025年初成立,前后发布了Qwen-Image, Qwen-Image-Edit, Qwen-Image-2.0等一系列文生图、图像编辑基座大模型。Qwen-Image团队正在打造全球领先的图像生成技术体系,推动AI在企业服务、开发者生态、个人内容创作等领域的深度应用,引领下一代人工智能的发展。团队专注于研发视觉生成技术,其中研究内容包括但不限于:图像生成、图像编辑、理解生成一体化等,充分探索相关数据及训练方法研究,以期解决计算机视觉基本问题的同时,为 AI 赋予创造力。 专注于视觉通用大模型的设计、优化与高效部署,具体职责有以下方向: 1、研究高效的视觉通用大模型架构,应对复杂视觉任务,提升模型的准确性和泛化能力; 2、优化算子和通信机制,提升模型训练效率,降低硬件资源消耗,提高训练速度和资源利用率; 3、探索高效的训练策略,包括自适应学习率调整、正则化方法和优化算法选择,提升模型性能和稳定性; 4、设计和实现自动化评估方法,帮助研发团队及时发现模型不足,优化模型架构和训练策略; 5、研发数据过滤和标注相关模型,提高数据质量和可用性,为模型训练提供支持。

更新于 2026-07-08北京|杭州
logo of alibaba
实习阿里巴巴2027

千问Qwen是由通义实验室自主研发的超大规模语言模型,具备跨语言、跨任务的理解与生成能力。Qwen系列模型,涵盖参数量从几百 M 到 T 级的基座大语言模型,并相继推出Qwen-VL、Qwen-Audio、Qwen-Omni、Qwen-Coder、Qwen-Image等系列模型。从多轮对话到代码生成,从逻辑推理到内容创作,从单一多模态到全模态统一理解生成,Qwen 正在打造全球领先的全模态模型技术体系,推动AI在企业服务、开发者生态、个人用户等领域的深度应用,引领下一代人工智能的发展。 千问Qwen全模态统一理解生成前沿技术研究,团队在多个方向上进行探索(具体如下罗列),若你对以下一个或者多个课题感兴趣均欢迎投递: 1. 模型架构与学习机制探索 1)预训练与后训练技术:持续提升模型的理解力、推理力与泛化能力。 2)探索下一代学习范式,如自监督学习、动态训练策略、知识蒸馏等。 2. 多模态与多智能体感知交互系统 1)打造 Omni 基座模型,实现文本、语音、视觉等多模态一体化理解与生成,推动世界模型的发展。 2)开发超智能的 Coding Agent,打通语言与代码之间的桥梁,连接 AI 与数字世界。 3)构建下一代 AI 交互系统,在 GUI Agent、视频理解等前沿场景,探索 AI 自主执行、扩展、进化的可能性。 3. 数据建设与性能优化 1)数据工程:设计高效的数据处理管线,持续提升自然语言、代码、多模态等数据质量与规模。 2)推理优化:探索模型高并发服务下,算法及系统框架侧技术创新与优化,包括但不限于训练推理协同优化、模型推理新范式。 4. 评测与安全体系 1)构建下一代大模型评估系统,覆盖推理、生成、可控性等多个维度。 2)关注模型内生安全,追求 AI 对人类有益且可控,参与对抗攻击检测、伦理约束建模等工作。

更新于 2026-03-17北京|杭州|上海