logo of aliyun

阿里云研究型实习生-多模态领域模型前沿技术研究

实习兼职阿里云研究型实习生地点:杭州状态:招聘

任职要求


1、完成领域多模态大模型关键技术问题的算法研发任务;
2、协助以上研发算法的技术沉淀和落地应用,实现模型领域推理能力提升10%以上;
3、发表CCF-A类顶级会议和期刊论文至少1篇,提交2项相关技术专利申请。

工作职责


项目关注多模态大模型的前沿技术问题,特别是领域应用中的泛化能力不足,模型信息融合效率低,推理能力弱等关键问题,探索具备推理能力的、多模态高效融合的领域多模态大模型,沉淀可复制的技术方法,推动其在行业和领域的落地应用。

项目包含但不限于如下关键课题:
1、多模态推理技术研究:探索多模态推理数据构建与强化学习算法,关注多模态领域模型的协同推理机制,提升领域泛化能力;
2、模型原生架构探索:探索多模态数据协同处理的通用模型结构,实现跨模态数据的高效表征学习,探索理解与生成一体化的多模态大模型技术框架,进一步提升模型对领域泛化能力。
包括英文材料
大模型+
算法+
相关职位

logo of tongyi
实习通义研究型实习生

我们正在寻找对多模态大模型技术充满热情的研究工程师/科学家,加入我们的团队,共同探索前沿技术并推动其在实际场景中的应用。你将专注于文本、视觉、音频等多模态的联合建模与创新开发,致力于打造下一代人工智能解决方案。 核心职责: 1、多模态联合建模 -研究文本、视觉、音频的联合训练范式,在多模态融合中保持并提升文本推理能力。 -探索多模态框架下的跨模态对齐与交互机制,优化模型的表现与效率。 2、音频生成与理解 -开发高表现力情感对话生成技术,实现自然、流畅的语音合成效果。 -研究音频与音效的统一建模方法,支持多模态音频风格转换等创新任务。 -探索音频与视觉模态的深度理解,包括音频情感、背景环境信息的解析及音视频内容的联合理解。 3、音频表征学习 -研究音频表征的离散化编码方法,设计低帧率、高效率的语音与音频联合建模方案。 -探索更高效的音频特征提取与表示方式,为下游任务提供高质量输入。 4、多模态推理优化 -研究多模态大模型的深度推理能力,优化Chain-of-Thought(CoT)推理的耗时与性能。 -探索复杂推理任务的解决方案,提升模型在多模态场景下的逻辑推理与决策能力。 5、技术创新与落地 -持续跟踪学术前沿动态,结合实际需求提出创新性技术方案。 -推动研究成果的实际应用,参与从算法设计到产品落地的全流程。

更新于 2025-04-23
logo of aliyun
实习阿里云研究型实习

RAG(检索增强生成)是一种将信息检索技术与大语言模型相结合的技术架构。它通过从海量文档中检索出与查询相关的信息,并将这些信息输入到大语言模型中,从而生成更准确且全面的回答或文本。然而,要实现生产级的RAG性能和可靠性,还需要面临诸多挑战。阿里云人工智能平台(PAI)团队专注于RAG平台的开发与持续优化,致力于推动企业级RAG在实际业务中的落地与应用。我们目前的研究和开发方向包括但不限于: 1. 查询理解与优化:提升对大语言模型的查询理解能力,优化召回机制及查询重排序算法。 2. 多模态的文档理解和问答生成:提升多模态文档(包括文本和图像等)的理解及问答生成能力。 3. 大模型Agent技术:提升基于大语言模型的Agent的任务规划和工具调用能力。 4. Text2SQL生成:优化从自然语言自动生成SQL查询的准确性。 5. RAG效果评估:构建benchmark和效果评估。

更新于 2024-11-19
logo of bilibili
实习技术类

我们正在寻找一位对大模型技术充满热情、具备扎实理论基础和良好编程能力的研究型实习生,加入我们充满活力的团队,共同探索人工智能技术的未来。你将: 1.深入研究大模型相关前沿技术: 包括但不限于大语言模型的预训练、Post-training、MOE(Mixture of Experts)、多模态大模型等,阅读最新论文,复现经典算法,探索大模型在B站各场景的应用潜力。 2.独立或协助完成大模型相关的技术探索: 参与数据收集和预处理、模型训练和评估、结果分析和报告撰写等工作,为团队的研究成果和技术影响力贡献力量。 我们提供: 1.充足的机器资源和数据支持: 为你提供高性能计算资源和海量数据,助力你在大模型领域的研究探索。 2.丰厚的实习补贴和良好的工作环境: 为你提供舒适的工作环境和具有竞争力的实习补贴。

更新于 2025-07-29
logo of tongyi
实习通义研究型实习生

几何图形推理是多模态大模型领域的重要研究课题。随着深度学习技术的发展,尤其是多模态大模型的崛起,其在语义理解、图像分析和跨模态任务中的应用引起了广泛关注。几何推理涉及图形的识别、分类、分析和推导,是理解空间关系和逻辑关系的重要手段。在教育、机器人和自动驾驶等领域,掌握几何推理能力的智能系统具有重要的应用价值。 追踪多模态、图像处理、自然语言处理、图像视频生成、OCR&多模态文档分析理解等前沿技术,在一个或多个方向进行深入研究,发表高水平论文或期刊; 联合学习图像与文本模态,对图形进行细粒度的grounding、parsing和comprehension,以实现模型对平面或立体图形的理解; 利用强化学习进行几何关系推理,探索适合几何图形和空间图形推理的强化学习算法; 构建大规模的几何图形识别、解析和推理数据集,以训练和评估大模型对图形的理解和推理能力。

更新于 2024-10-15