logo of liauto

理想汽车【基座模型】多模态大模型算法工程师

社招全职智能与信息技术地点:北京状态:招聘

任职要求


1.硕士及以上学历,自动化、计算机等相关专业;
2.必须有视觉VIT基座优化经验或者VLM、VLA相关项目落地交付经验;
3.优秀的代码技术功底,熟练掌握CLIP编码器的From Scratch训练、VLM多模态预训练和强化学习训练等内容。
4.有VIT视觉基座模型的架构设…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


1、负责视觉大模型基座架构优化、视觉编码器CLIP性能优化和视觉编码器训练(图像编码器和视频编码器);
2、负责CLIP模型小型化优化,包含模型蒸馏效果优化、端侧轻量化模型架构设计、模型裁剪和稀疏训练(结构化稀疏和非结构化稀疏)、对比学习训练调优等;
3、参与视觉大模型实际训练和项目落地,主导高效视觉编码器的架构设计和端侧推理性能优化。
4、负责部分图文对数据集生产和构建、模型评测等任务
包括英文材料
学历+
强化学习+
系统设计+
还有更多 •••
相关职位

logo of tencent
社招1年以上WXG公共技术

负责微信视觉基座模型的核心技术研发与业务落地,构建统一的视觉理解与解析能力,支持在微信C端及视频号、公众号、微信小店等业务场景中的规模化应用。

更新于 2026-03-25深圳
logo of meituan
社招1年以上核心本地商业-基

主要负责多模态大模型在全模态(包括图像、视频、语音)的生成和理解、具身智能和GUI Agent等方向的模型能力分析和训练策略优化,并且对训练数据、训练策略和模型能力之间的关系进行研究分析,产出可行的模型评测方案和训练策略,具体工作内容包括但不限于: 1. 追踪多模态大模型的前沿进展,积极学习新的模型结构、前沿模型认知,并进行深入分析。 2. 在具身智能方向中,探索VLA的data-scaling方案,指引VLM的关键能力提升;探索视频生成基座以及统一模型的潜力,包括但不限于世界模型训练和效果度量;积极探索VLA/VLM同环境交互的学习方法,涉及仿真和真机实验,研究通过强化学习的下一代智能提升的关键途径。
 3. 在全模态统一生成理解方向中,研究达到理想态的关键演进路径并进行度量分析,指引长期有潜力的模型迭代方向。
 4. 与各相关部门保持良好沟通,深度参与多模态模型的训练过程,共同推动多模态大模型持续优化。

更新于 2026-06-22北京|上海
logo of meituan
实习核心本地商业-基

简介:多模态大模型能力在近年飞速发展,模态的统一、任务的统一、多种模态联合生成和实时交互带来了崭新的应用体验和生产力提升。在这个过程中,我们需要脚踏实地的同时仰望星空,发挥想象力预判新模型能力带来的应用场景革新,研究达到理想态的关键演进路径并进行度量分析,指引长期有潜力的模型迭代方向。方向包括但不限于: 1、多模Agent方向:包括在多模态的工具调用和GUI/CUA,探索结合多模原生能力的OpenClaw展现出的生产力提升潜力,从基座模型能力角度分析其中的关键影响因素并进行自动化度量,指引基座模型的迭代。 2、多模态统一方向:包括全模态统一模型、音视频联合生成等,思考在模态统一、任务统一和多种模态联合生成过程带来新的能力跃迁并进行度量,分析模态和任务间的相互关联,指引模型架构、训练策略等选型。 3、多模交互方向:包括通用世界模型、音视频交互等,研究动态多轮交互中的一致性、真实性和长程记忆等关键能力的自动化度量,指引基座模型的迭代。

更新于 2026-04-03北京|上海
logo of meituan
实习核心本地商业-基

简介:多模态能力是通用人工智能的关键要素之一。本研究方向聚焦于多模态大模型的模型结构、统一训练范式、数据能力体系等前沿内容,旨在通过统一的模型架构打通视觉、语言、和语音等模态之间的壁垒,实现多模态信息的深度理解与高质量生成,持续提升视觉能力帮助多模态大模型更全面地理解世界知识,为跨模态对齐、复杂视觉任务、多模知识迁移提供基座模型。 具体地,我们关注如下研究方向: 1、多模态大模型基座:探索并不断突破多模态基座模型的能力上限。具体地,负责大模型相关技术前沿探索,包括但不限于融合模型架构探索、原生训练范式探索、高效训推框架探索等,不断提升模型的理解能力、生成质量、多样性、可控性等。负责不同规模、不同结构的多模态模型的数据准备和优化,构建多模态数据处理流程等。 2、视频多模态能力提升:负责解决多模态视频大模型领域的前沿技术难题,如视频后训练、长视频时序理解、音视频等,探索短视频、长视频、视频流等不同形态的视频多模态方案,探究图像、视频统一的多模态解决方案。 3、视觉基座表征能力提升:面向不同的多模态架构和训练范式,从视觉基座的角度深入探索视觉连续表征和离散表征的联系和区别,负责探索更具通用性的多模态视觉特征,生产行业内领先的视觉基座。 4、多模态理解生成统一:负责多模态理解与生成的前沿探索与研究,包括但不限于视觉表征统一训练、多模态统一架构探索、理解与生成任务关系研究。

更新于 2026-04-03北京|上海|深圳