阿里巴巴研究型实习生-Qwen-Image图像生成数据与评测算法
任职要求
1. 计算机、数学、人工智能等相关专业硕士/博士在读,每周可实习5天,持续实习6个月及以上。 2. 具备扎实的计算机视觉与深度学习基础,熟练掌握Python编程语言与PyTorch等主流深度学习框架,具备优秀的代码实现与工程能力。 3. 对多模态数据处理有浓厚兴趣,熟悉图像、文本、视频等多模态数据的清洗、筛选、对齐与质量控制流程。 4. 自我驱动力强,动手能力强,工作细致,具备出色的问题分析与解决能力,能够独立开发高效的数据处理算子与流水线。 5. 善于平衡研究目标与落地实现,具备跨学科视野与协作意识,能够与算法、工程、产品等多学科团队紧密合作,推动研究成果快速落地。 6. 关注技术影响力,具有开源开放精神,对基础模型…
工作职责
团队介绍:Qwen-Image(千问图像)团队是阿里巴巴ATH事业群-Token Foundry下的图像生成基座团队,自2025年初成立以来,先后发布了Qwen-Image、Qwen-Image-Edit、Qwen-Image-2.0等一系列业界领先的文生图与图像编辑基座大模型。团队正在打造全球领先的视觉生成技术体系,推动AI在企业服务、开发者生态及个人内容创作等领域的深度应用。我们专注于研发前沿视觉生成技术,充分探索数据与训练方法,旨在解决计算机视觉基本问题的同时,为AI赋予真正的创造力。 作为数据算法实习生,你将深度参与视觉生成大模型的数据全链路建设,用高质量数据驱动模型能力跃升,具体职责包括: 1. 数据处理链路构建:深入理解视觉生成大模型的训练目标,设计并实现可靠、可扩展的数据处理流水线。实现海量多模态数据(图像、文本、视频等)的预处理、过滤、检索归类与规模化产出,支撑模型高效迭代。 2. 智能清洗与质量评估:利用开源模型对原始数据进行智能清洗、质量打分与标注,探索自动化数据筛选策略,持续提升训练数据的规模与质量。 3. 人工标注体系设计:与模型训练及评测团队密切合作,设计详细、可用的人工标注体系与规范。结合模型辅助,提高数据质量和可用性,为模型不同训练阶段提供高质量的数据支持。 4. 数据与模型协同优化:针对模型训练中暴露的数据问题(如噪声、偏差、模态对齐缺失等)设计工程化解决方案,探索数据与模型协同优化的新方法,你处理的数据将直接进入生成模型的训练。 5. 模型评测体系构建:协助建立专业且详尽的视觉生成大模型生成质量评估方法和基准测试,通过数据实验分析定位模型瓶颈,指引算法优化方向,建立“评测—分析—优化—复评”的迭代闭环。
1. 具身多模态基础模型架构研究: 构建面向机器人的多模态基础模型,将视觉语言模型与机器人中心的物理世界理解与决策深度融合,研究可泛化的(力/触觉)-视觉-语言-状态-动作统一建模和训练方法(包括但不限于:tokenization/latent action/world modeling等技术);探索“感知-记忆-规划-控制”的端到端或模块化建模和训练范式;研究统一操作,规划,导航等多决策场景统一的建模和训练范式;探索面向长时程任务(系统辨识、历史状态记忆、失败恢复等)的决策。 2. 大规模具身数据构建与训练方法研究:构建可扩展的数据处理管线;研究多数据源的可拓展、高鲁棒使用方法和混合训练方法,包括真机摇操数据、人类视频数据、UMI数据、VQA数据等;探索基于Sim2Real/Real2Sim的数据增强和混合训练技术;建立数据质量评估与采样策略(覆盖度、难度分层、长尾任务挖掘等)。 3. 具身基础模型测评基准与自动化评测系统研究:定义覆盖关键能力和关键场景的有代表性的Benchmark,包括指令理解、物体识别与定位、抓取与操作、导航、工具使用、长任务规划、失败恢复等能力覆盖,厨房、商超、酒旅、户外、工厂等场景覆盖;研究构建高效、可靠、可复现的评测流水线和可用于迭代的指标体系。 4. 高效率、高可靠推理系统研究:将模型在真实机器人平台和主流仿真平台中部署验证,针对延迟、稳定性、安全与可恢复性做工程化增强,研究一套适配具身场景的大规模基础模型端侧/云边协同的推理框架和适配于强化学习训练得推理框架。
基于开源的 Diffusion 图像和视频生成模型,构建基础推理和训练引擎,探索前沿的 AIGC 技术,具体职责包括: 1、加入魔搭社区 DiffSynth-Studio 等开源项目的开发,接入先进的图像和视频生成模型,为业界提供领先的推理和训练引擎基建。 2、基于丰富的开源模型生态,探索 AIGC 技术的全新能力,开展多元化的科研项目,包括但不限于图像生成的思维链、跨模态模型的能力集成、理解-生成统一架构模型等,发表高水平学术论文。 3、参与魔搭社区的运营活动,为新模型的开源提供技术支持,推动 AI 技术的普及推广。
阿里巴巴通义实验室-对话智能团队 以大模型对话技术为核心,研究及应用方向包括智能客服、个性化对话、角色扮演、分身复刻、社交智能、数字人等,主要业务场景包括: (1) 通义晓蜜—阿里云智能客服,国内对话式AI市占率第一; (2) 通义星尘-类人智能体创作平台。2020年以来,围绕预训练、对话智能、大模型等方向发表80+篇国际顶会论文,欢迎对大模型感兴趣的你加入我们,一起创造人机对话的未来。 拟研究技术方向: 1. 角色扮演技术(Role-Playing Agent)的研究,在相关性、人设一致性、吸引力、情感、道德等维度取得显著提升; 2. 分身复刻(Character AI)的研究,探索角色所处虚拟世界建模与演化; 3. 数字专家的研究,包括用户心理推断、策略搜索推理等技术; 4. 多模态Character模型的研究,包括语音端到端角色对话模型。