通义研究型实习生 - 大模型多模态记忆增强研究
任职要求
1. 在读研究生以上学历,具备LLM/RAG/Agent研发经验,第一作者发表过顶级会议论文。 2. 扎实的算法能力,优良的编程风格,熟悉Py…
工作职责
当前大模型(LLMs/MLLMs)在长对话和复杂任务链中面临上下文窗口限制和遗忘问题。尽管扩大上下文长度有所帮助,但其计算和推理成本高昂,且难以实现真正意义上的终身学习和经验累积。另一方面,现有模型在交互中往往缺乏个性化的体验,无法有效地捕捉、存储和召回与特定用户、特定场景相关的多模态经验。为了使大模型具备像人类一样从持续交互中学习、积累和灵活调度的能力,并实现从通用助手到私人智能伙伴的跃升,亟需构建一个高效、多层次、时间敏感的多模态记忆系统。这不仅能突破输入长度限制,还能通过跨模态信息的整合和知识的结构化,大幅提升模型在复杂场景下的鲁棒性、泛化能力和自我进化能力。 大模型多模态记忆增强研究项目,团队在多个方向上进行探索,若你对以下一个或多个课题感兴趣均欢迎投递: 1. 多层次记忆的构建与管理 2. 多模态记忆的嵌入与召回 3. 时间敏感的记忆调度策略 4. 记忆智能体(Memory Agent)的构建
1. 模型多模态能力的提升,包括但不限于:物理世界细粒度视觉感知、空间感知、视频时序行为预测和推理、基于视觉的决策和规划; 2. 多模态数据的制作,包括:训练数据的收集、清理和标注,测试Benchmark的构建; 3. 多模态RL相关研究,包括通过RL提升模型常规感知能力和推理能力; 4. 多模态任务评测,包括:客观的Benchmark接入、OOD评测、以及主观评测。
阿里巴巴达摩院医疗AI团队,面向多模态医疗大模型的前沿研究与应用落地,旨在构建能够理解和推理不同医疗模态信息(影像、文本、临床结构化数据等)的通用智能系统。 研究方向包括但不限于: ● 多模态医疗大模型的架构设计、训练与优化 ● 医学影像(CT/MRI/超声、病理切片等)与医学文本(病历、检验报告等)的跨模态表示学习,多模态对齐,知识图谱增强 ● 医疗领域的视觉‑语言模型(VLM)、医学版GPT及多模态融合方法 ● 面向诊断与治疗决策的推理型模型和知识增强大模型 ● 少样本/零样本医疗任务泛化、可解释性与可信AI 我们拥有: ● 海量高质量、多模态临床数据(影像+文本+结构化信息) ● 充足算力资源(GPU不限,集群规模支持超大模型训练) ● 与国内外顶级医院、知名医学专家的长期科研合作 ● 在顶级会议与期刊(Nature子刊、TMI、MICCAI、CVPR、NeurIPS等)的高影响力成果 这是一个将AI大模型与医疗健康结合、面向未来的研究机会。
当前,大规模模型正逐步向多模态方向发展。尤其是随着SORA、GPT-4o模型的问世,其热度达到了空前的水平。目前,业界已经发布了众多多模态模型,例如:CLIP、LLaVA、Qwen-VL、Qwen-VAL、DeepSeek-VL、AnyMAL、Claude3、GPT-4v、GPT-4o、Gemini1.5、Chameleon等。多模态模型的迅速发展,也带来了新的挑战,对训练框架的效率要求越来越高: 1、不同模态数据的异质性:不同模态(如图像、文本、音频、视频)有各自的编码器(encoder)和解码器(decoder),这对计算资源、显存和通信带宽的需求各不相同。训练框架需要能够适配不同模态的特点,实现高效调度和优化。 2、数据的多样性:处理的数据模态类型多样化(如纯文本、文本+图像、文本+音频、文本+视频+音频等),且模态内的数据也可能动态变化。例如,图像的数量和大小,音频的长度等都可能不同。 现有的训练框架和并行策略已经无法很好地满足当前多模态大模型的训练需求。因此,迫切需要对现有框架进行改进和优化,以支持多模态模型的高效训练。本项目将着眼于以下几个层面技术,以解决上述特性带来的挑战,提升多模态大模型训练效率: 1、多模态场景并行策略研究,以PP为例,当前的PP并行策略都是按layer粒度均分,但多模态间的异构性会给PP并行提出更高的要求,多模态场景下不同模态的计算、显存需求不同。需要打破layer级别的粒度,支持细粒度PP划分和调度,探寻更高效的PP并行策略。 2、动态长序列场景高效训练技术研究,多模态场景总序列长度会比llm场景长很多,并且不同模态的seq len长度还是动态,在动态长序列场景怎么进行高效训练。