理想汽车多模态算法实习生
实习兼职算法与软件地点:上海状态:招聘
任职要求
1.熟悉视觉感知、LLM、多模态大模型、自动驾驶等一个或多个领域相关技术; 2.较强的算法实现能力,熟练使用深度学习开源框架PyTorch; 3.在CV…
登录查看完整任职要求
微信扫码,1秒登录
工作职责
1.基于LLM研发视觉-语言多模态大模型,并探索在智能系统中的应用; 2.在Mentor的指导下,设计实验快速验证idea,投稿CV/ML/AI领域顶会。
包括英文材料
大模型+
https://www.youtube.com/watch?v=xZDB1naRUlk
You will build projects with LLMs that will enable you to create dynamic interfaces, interact with vast amounts of text data, and even empower LLMs with the capability to browse the internet for research papers.
https://www.youtube.com/watch?v=zjkBMFhNj_g
自动驾驶+
https://www.youtube.com/watch?v=_q4WUxgwDeg&list=PL05umP7R6ij321zzKXK6XCQXAaaYjQbzr
Lecture: Self-Driving Cars (Prof. Andreas Geiger, University of Tübingen)
https://www.youtube.com/watch?v=NkI9ia2cLhc&list=PLB0Tybl0UNfYoJE7ZwsBQoDIG4YN9ptyY
You will learn to make a self-driving car simulation by implementing every component one by one. I will teach you how to implement the car driving mechanics, how to define the environment, how to simulate some sensors, how to detect collisions and how to make the car control itself using a neural network.
算法+
https://roadmap.sh/datastructures-and-algorithms
Step by step guide to learn Data Structures and Algorithms in 2025
https://www.hellointerview.com/learn/code
A visual guide to the most important patterns and approaches for the coding interview.
https://www.w3schools.com/dsa/
深度学习+
https://d2l.ai/
Interactive deep learning book with code, math, and discussions.
PyTorch+
https://datawhalechina.github.io/thorough-pytorch/
PyTorch是利用深度学习进行数据科学研究的重要工具,在灵活性、可读性和性能上都具备相当的优势,近年来已成为学术界实现深度学习算法最常用的框架。
https://www.youtube.com/watch?v=V_xro1bcAuA
Learn PyTorch for deep learning in this comprehensive course for beginners. PyTorch is a machine learning framework written in Python.
还有更多 •••
相关职位
实习无人机业务部
1、研发用于Ego/Exo的视频理解/动作识别模型,推动具身智能场景下多模态感知与环境交互理解能力的提升。 2、参与端到端规划算法的模型设计、训练调优、泛化能力与鲁棒性提升,包括但不限于模型预训练、后训练和真机部署工作,将训练好的模型部署到实际机器人系统中进行验证和测试 3、参与遥操数据的收集与处理,包括但不限于处理机器人开源数据及规范化工作,同时设计并执行数据自采方案,对收集到的数据进行处理以满足后续模型训练需求
更新于 2026-07-16北京
实习算法与软件
1.负责多模态内容感知、理解及多模态文档处理相关的大模型研发工作,包括但不限于多模态或视觉预训练模型的下游任务微调与优化 2.负责视觉语言大模型(VLM)在内容理解与文档处理等场景的应用探索,深入开展大模型SFT(指令微调)、强化学习微调(如DPO/GRPO等)算法研究 3.负责基于大模型的 Agent 能力建设与应用落地,围绕复杂任务拆解、流程编排、工具调用、记忆管理、规划与执行等方向开展研发,推动 Agent 在多模态理解、文档处理、内容生产与业务自动化等场景中的实践 4.跟进计算机视觉及多模态领域前沿工作,探索前沿技术落地,并协助整理形成高质量学术论文
北京

校招AI 算法类
负责研发虚拟数字人多模态交互算法,整合语音、文本、表情、肢体动作等多模态信息,实现自然流畅的人机交互; 持续优化多模态交互算法,提升数字人对复杂多模态输入的理解与处理能力,增强交互的精准性和实时性; 探索端到端的数字人多模态交互技术; 跟踪人工智能领域的前沿技术在虚拟数字人项目的应用和落地。
杭州