理想汽车【基座模型"理想星"顶尖实习】强化学习算法实习(北京/上海)
任职要求
任职资格: 1、本科及以上在读,不限年级,计算机、人工智能、自动化、机器人等相关专业优先; 2、扎实的编程能力,熟练掌握 Python,熟悉 C/C++ 者优先;善于使用 AI Coding 工具(Cursor、Claude Code 等)提升开发效率; 3、良好的深度学习基础,熟悉主流视觉/语言模型架构(ViT、LLM、Diffusion 等),有实际模型训练经验者优先; 4、有以下一项或多项经验者优先: 多模态大模型(VLM…
工作职责
加入理想汽车,参与下一代跨本体自动驾驶与具身智能的基座方案从0到1的研发。我们的目标是:用一套统一的大脑架构,同时驱动汽车、人形机器人、仿生平台——让感知、语言、行动真正形成闭环,最终上真车、上实机。 工作职责: 这是"肌肉记忆"。有了世界模型,RL 才能真正 scale。我们在做的事情是: 面向自动驾驶与具身智能的 RL 算法研究(Model-based/Free、Online/Offline RL) 构建大规模分布式 RL 训练系统 探索模仿学习、逆强化学习、Scalable Oversight 等提升策略泛化的方法 与世界模型团队深度协作,完成 sim2real 迁移
加入理想汽车,参与下一代跨本体自动驾驶与具身智能的基座方案从0到1的研发。我们的目标是:用一套统一的大脑架构,同时驱动汽车、人形机器人、仿生平台——让感知、语言、行动真正形成闭环,最终上真车、上实机。 工作职责: 这是"想象力"。真正 scalable 的智能体,必须能在脑子里模拟世界。我们在做的事情是: 构建时空一致的占用/语义/动力学世界建模能力(Diffusion、DiT、3D Occupancy、NeRF/GS 等) 开发可控的学习式仿真系统,实现场景合成与干预式评测 打通 real → sim → real 闭环,让仿真真正服务于策略训练与验证
岗位职责 1. 聚焦具身智能核心方向(多模态具身大模型VLA、世界模型、具身强化学习/模仿学习、机器人操作与运动规划、具身仿真、人机交互),开展原创性、突破性学术研究,攻克领域关键技术瓶颈; 2. 独立负责细分研究课题的方案设计、算法研发、实验验证与结果迭代,完成高质量科研实验,形成可落地的技术方案与学术成果; 3. 跟踪领域顶会顶刊最新研究进展,梳理技术路线,参与团队学术研讨,提出创新性研究思路与技术改进方向; 4. 参与具身智能算法在仿真平台与实体机器人上的部署、调试与闭环验证,推动研究成果从理论走向实际应用;
在这里,智能体不只停留于文本对话,更具备全感官(听觉、视觉)的感知能力。我们的目标是构建能连接数字世界和物理世界、具备长程规划能力、并能实现自我闭环进化的下一代多模态智能体模型: 设计并实现面向 Agent 的大规模强化学习算法,重点解决Credit Assignment、Reward Desgin和Multi Agent RL等算法问题 设计面向复杂、长程任务Agent harness以及数据合成方法,在中训练、SFT和RL中验证Data Scaling Law,优化训练策略 研发具备自主记忆与自主技能发现能力的智能体模型,探索智能体在环境交互中自我更新、自我进化的新范式,打造可扩展的“终身学习”智能体优化方法。