
地平线强化学习算法实习生
实习兼职算法序列地点:北京 | 上海 | 香港状态:招聘
任职要求
【任职要求】 1、计算机、数学等相关专业在读硕士及以上学历; 2、具备扎实的数学和机器学习基础; 3、具有较强的编程能力、英文文献阅读能力、自我学习能力; 4、实习时间6个月以上,自我驱动,针对某一个方向独立深入研究,或参与主版本迭代。 【课题背景】 当前自动驾驶技术在复杂场景下的决策能力,仍未达到人类驾驶员的认知与预判水平。核心瓶颈在于系统对物理世界因果规律的理解不足,以及长程…
登录查看完整任职要求
微信扫码,1秒登录
工作职责
【岗位职责】 -突破认知边界:让自动驾驶系统从 “模仿行为” 进化为 “理解世界”,掌握物理因果与长程规划能力。 -革新训练范式:构建自博弈强化学习的全新训练与推理框架,大幅提升系统的安全性、鲁棒性与泛化能力。 -弥合虚实鸿沟:探索仿真与现实世界的无缝迁移,让训练出的策略在真实道路上同样可靠。
包括英文材料
学历+
机器学习+
https://www.youtube.com/watch?v=0oyDqO8PjIg
Learn about machine learning and AI with this comprehensive 11-hour course from @LunarTech_ai.
https://www.youtube.com/watch?v=i_LwzRVP7bg
Learn Machine Learning in a way that is accessible to absolute beginners.
https://www.youtube.com/watch?v=NWONeJKn6kc
Learn the theory and practical application of machine learning concepts in this comprehensive course for beginners.
https://www.youtube.com/watch?v=PcbuKRNtCUc
Learn about all the most important concepts and terms related to machine learning and AI.
还有更多 •••
相关职位
实习算法与软件
1. 参与多智能体协同场景的环境构建、数据合成与算法设计(SFT & RL 全流程)。 2. 探索可泛化、可拓展的 Agentic LLM 训练方法,提升 Agent 在真实业务场景中的表现。 3. 参与研究结果整理与高水平论文发表。
北京

校招算法序列
【岗位职责】 -突破认知边界:让自动驾驶系统从 “模仿行为” 进化为 “理解世界”,掌握物理因果与长程规划能力。 -革新训练范式:构建自博弈强化学习的全新训练与推理框架,大幅提升系统的安全性、鲁棒性与泛化能力。 -弥合虚实鸿沟:探索仿真与现实世界的无缝迁移,让训练出的策略在真实道路上同样可靠。
更新于 2026-03-16北京|上海|香港
实习
1、研发面向自动驾驶的强化学习算法,解决奖励设计、环境交互、安全约束与样本效率等核心挑战; 2、设计奖励模型与仿真环境,构建从虚拟训练到真实迁移(Sim-to-Real)的可靠路径; 3、探索离线强化学习、模仿学习与RL的融合方案,提升算法在复杂交通场景中的泛化能力; 4、参与真实车端/机端的算法部署与闭环验证,推动RL在物理世界的落地; 5、与数据,仿真,infra团队协同,构建高效的RL开发框架,提升模型迭代效率。
更新于 2026-03-20上海