logo of alibaba

阿里巴巴研究型实习生 - 全模态基座基础能力与Agentic应用

实习兼职阿里巴巴研究型实习生地点:北京 | 杭州状态:招聘

任职要求


1. 候选人应为计算机及相关专业的博士或硕士研究生,且对音视频领域有充分的兴趣。
2. 具备音频/语音理解与生成、多模态对齐与交互(音视频Alignment/Captioning)、或 Agentic AI 与长程推理(L…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


千问(Qwen)是由阿里巴巴自主研发的超大规模语言模型,具备跨语言、跨任务的理解与生成能力。Qwen系列模型,涵盖参数量从几百 M 到 T 级的基座大语言模型,并相继推出Qwen-VL、Qwen-Audio、Qwen-Omni、Qwen-Coder等系列模型。从多轮对话到代码生成,从逻辑推理到内容创作,从单一多模态到全模态统一理解生成,Qwen 正在打造全球领先的全模态模型技术体系,推动AI在企业服务、开发者生态、个人用户等领域的深度应用,引领下一代人工智能的发展。

团队致力于追逐实现 Omni 基座模型,实现全模态理解与对话统一。团队音频组负责围绕 Qwen 基座模型展开音视频/音频处理以及与音视频交互相关的基础研究及其应用,代表工作有 Qwen-Omni系列, Qwen-LiveTranslate系列等。

工作职责:
1. 音频/音视频 Agentic能力: 原生音视频Agentic/Long-horizen, 全模态Agentic/Coding不降智等。
2. 音视频理解基础能力:包括Caption, Grouding, 音视频Alignment, General QA,长视频,多音视频理解等。
3. 音频/语音理解基础能力: 包括ASR, MultiSpkASR, 语音/音频Grouding/Counting/QA,音乐理解,长音频,多音频理解等。
4. 音频/音视频Postrain/RL/OPD。
5. 音视频通话与交互:包括全音视频双工, 音频query不降智/体感优化等。
6. 语音生成基础能力: 包括音色克隆,可控性,长语音生成稳定性等。
7. 全模态模型自主优化与Self-evolving。
包括英文材料
ACL+
ICML+
还有更多 •••
相关职位

logo of alibaba
实习阿里巴巴研究型实

我们正在寻找对大模型在各种场景智能下的效能优化或智能体应用充满热情的优秀在读学生,参与大模型关键系统架构和场景化应用的前沿研究。你将深度参与千亿级大模型在复杂工业场景落地的“不可能三角”:高性能、低延迟、高自主性。 你将从以下四个核心应用方向中选择一个深入参与,开展系统性研究与工程实现: 1、面向自动驾驶/具身智能的端到端自动驾驶大模型训练优化:参与大规模分布式训练系统的性能分析与优化,包括数据并行、模型并行、流水线并行等策略的调优;参与自动驾驶核心模型(BEV、Transformer、Diffusion 等)中关键算子的性能 Profiling 与优化;基于 Transformer 架构的自动驾驶端到端模型(如 VLA,UniAD, VAD 等)的大规模预训练与微调,优化长序列感知与预测的对齐; 2、面向MoE大模型的训练推理优化:针对千亿级超大规模参数模型,深度参与类QWen/DeepSeek等MoE大模型的性能调优,研究 并行策略(张量、流水线、数据并行)下的通信重叠与显存优化;基于开源大模型推理引擎结合各类大模型和GPU/NPU等硬件,应用PD分离/DeepEP架构,探索高性能算子实现,结合编译优化,量化等手段提升模型推理性能; 3、图像视频与世界模型生成: 参与图像/视频生成模型(Diffusion Transformer、UNet、VAE、文本编码器等)的推理性能分析与端到端优化,提升生成速度与吞吐量;针对多步采样推理流程(DDPM / DDIM / Flow Matching 等)进行调度优化,探索步数压缩、缓存复用、投机采样等加速策略;协助构建推理性能基准测试体系,持续追踪优化效果;参与生成模型推理服务的工程化落地,包括多卡并行推理、动态 Batching、流式输出等方案的设计与实现; 4、大模型与推荐系统的融合创新,聚焦生成式算法或者推荐场景推理优化的研发:研究面向基于LLM的生成式召回技术,通过用户意图生成、Item ID/Title生成等方式,解决传统方法在语义鸿沟与长尾挖掘上的痛点,探索利用大模型直接生成召回和排序;针对生成式模型推理延迟高、资源消耗大的问题,研究算子优化能力、低精度计算、流式推理、投机采样等技术并应用模型推理技术。

更新于 2026-03-17杭州
logo of tongyi
实习通义研究型实习生

基于开源的 Diffusion 图像和视频生成模型,构建基础推理和训练引擎,探索前沿的 AIGC 技术,具体职责包括: 1、加入魔搭社区 DiffSynth-Studio 等开源项目的开发,接入先进的图像和视频生成模型,为业界提供领先的推理和训练引擎基建。 2、基于丰富的开源模型生态,探索 AIGC 技术的全新能力,开展多元化的科研项目,包括但不限于图像生成的思维链、跨模态模型的能力集成、理解-生成统一架构模型等,发表高水平学术论文。 3、参与魔搭社区的运营活动,为新模型的开源提供技术支持,推动 AI 技术的普及推广。

更新于 2026-06-17北京|杭州
logo of tongyi
实习通义研究型实习生

阿里巴巴通义实验室-对话智能团队 以大模型对话技术为核心,研究及应用方向包括智能客服、个性化对话、角色扮演、分身复刻、社交智能、数字人等,主要业务场景包括: (1) 通义晓蜜—阿里云智能客服,国内对话式AI市占率第一; (2) 通义星尘-类人智能体创作平台。2020年以来,围绕预训练、对话智能、大模型等方向发表80+篇国际顶会论文,欢迎对大模型感兴趣的你加入我们,一起创造人机对话的未来。 拟研究技术方向: 1. 角色扮演技术(Role-Playing Agent)的研究,在相关性、人设一致性、吸引力、情感、道德等维度取得显著提升; 2. 分身复刻(Character AI)的研究,探索角色所处虚拟世界建模与演化; 3. 数字专家的研究,包括用户心理推断、策略搜索推理等技术; 4. 多模态Character模型的研究,包括语音端到端角色对话模型。

更新于 2026-05-28北京|杭州
logo of tongyi
实习通义研究型实习生

当前视觉语言模型(VLM)以通用图片和视频理解为主,而人物往往是图片或视频的重要组成部分,因此对图片、视频中的人物进行精准、精细的理解非常重要。本项目重点围绕人物视频,对视频中人物的行为变化、人与人的互动行为、人与物的互动行为等使用文字的方式进行理解。

更新于 2026-05-20杭州