logo of liauto

理想汽车多模态算法实习生

实习兼职算法与软件地点:北京状态:招聘

任职要求


1.硕士及以上学历,计算机、人工智能、电子信息或相关专业
2.熟悉多模态大语言模型(VLM),对Qwen-VL系列、InternVL等前沿多模态模型有深入了解及实际应用经验
3.熟悉多模态/视觉预训练模型,如CLIP、BLIP、DINO等,有预训练或下游任务微调经验者优先
4.对多模态内容感知、图像/视频理解、多模态文档处理(如文档解析、版面分析、文档问答DocVQA等)等方向…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


1.负责多模态内容感知、理解及多模态文档处理相关的大模型研发工作,包括但不限于多模态或视觉预训练模型的下游任务微调与优化
2.负责视觉语言大模型(VLM)在内容理解与文档处理等场景的应用探索,深入开展大模型SFT(指令微调)、强化学习微调(如DPO/GRPO等)算法研究
3.负责基于大模型的 Agent 能力建设与应用落地,围绕复杂任务拆解、流程编排、工具调用、记忆管理、规划与执行等方向开展研发,推动 Agent 在多模态理解、文档处理、内容生产与业务自动化等场景中的实践
4.跟进计算机视觉及多模态领域前沿工作,探索前沿技术落地,并协助整理形成高质量学术论文
包括英文材料
学历+
PyTorch+
深度学习+
Kaggle+
还有更多 •••
相关职位

logo of meituan
实习无人机业务部

1、研发用于Ego/Exo的视频理解/动作识别模型,推动具身智能场景下多模态感知与环境交互理解能力的提升。 2、参与端到端规划算法的模型设计、训练调优、泛化能力与鲁棒性提升,包括但不限于模型预训练、后训练和真机部署工作,将训练好的模型部署到实际机器人系统中进行验证和测试 3、参与遥操数据的收集与处理,包括但不限于处理机器人开源数据及规范化工作,同时设计并执行数据自采方案,对收集到的数据进行处理以满足后续模型训练需求

更新于 2026-07-16北京
logo of liauto
实习算法与软件

1.基于LLM研发视觉-语言多模态大模型,并探索在智能系统中的应用; 2.在Mentor的指导下,设计实验快速验证idea,投稿CV/ML/AI领域顶会。

上海
logo of 10jqka
校招AI 算法类

负责研发虚拟数字人多模态交互算法,整合语音、文本、表情、肢体动作等多模态信息,实现自然流畅的人机交互; 持续优化多模态交互算法,提升数字人对复杂多模态输入的理解与处理能力,增强交互的精准性和实时性; 探索端到端的数字人多模态交互技术; 跟踪人工智能领域的前沿技术在虚拟数字人项目的应用和落地。

杭州
logo of xiaohongshu
实习内容理解

1. 参与超大规模通用多模态场景数据处理的开发和模型性能提升,研究内容包括但不限于:1)小红书笔记、评论等场景 2)互联网通用场景 3)各种垂类场景; 2. 有机会参与到构建全链路多模态数据流算法中(采集、处理、清洗、训练、推理、评估); 3. 追踪全球范围内最前沿的多模态数据相关技术,有效凝练算法并应用在数据处理环节中; 4. 在具有挑战性的研究问题上不断深耕并达到业界顶尖水平。

更新于 2026-07-17北京