菜鸟菜鸟-具身智能强化学习算法工程师-杭州
任职要求
1. 计算机/自动化/机器人相关专业,扎实的 Python 工程能力。 2. 系统掌握强化学习原理,熟悉各类 On/Off-Policy 等强化学习算法及其调参与稳定性问题。 3. 了解模仿学习与 VLA 训练范式,理解预训练与后训练的分工与衔接。 4. 熟悉至少一种仿真/训练平台(Isaac Lab/Isaac Gym/MuJoCo),具备真机或仿真 RL 落地经验。 加分项: 1. 有大模型…
工作职责
1. 策略后训练:负责 VLA / 基础操作模型的后训练全流程,在预训练/模仿学习得到的基座策略之上,通过强化学习微调(RLFT)、离线 RL、DAgger、HIL-SERL 、RECAP 等手段持续提升真实仓储任务的成功率与鲁棒性。 2. 奖励与数据闭环:设计任务奖励函数与自动成功判定,搭建 Reward Model / 偏好数据标注流程,构建"部署→失败挖掘→补采/在线交互→后训练→自动评测→再部署"的策略迭代闭环。 3. 大规模训练:在仿真并行环境与真机上开展大规模 Rollout 与 RL 训练,负责采样、经验回放、分布式训练框架的搭建与吞吐优化。 4. 评测与安全:建立后训练前后的量化 Benchmark(成功率、恢复能力、碰撞率、泛化性),管控灾难性遗忘与安全约束,保障策略上真机的稳定性。
安克实习生项目是面向正式校招岗位的人才培养与选拔通道。实习期间将按照校招标准进行系统的培养与综合评估,表现优秀者可直接获得校招转正机会,提前锁定正式校招席位。我们以严肃、长期的视角对待每一位实习生,也期待与你共同成长。 【你将参与】 1.参与具身操作模型(VA/VLA/WAM)的监督微调(SFT)和强化学习(RL),包括数据格式设计、训练配置、效果评估与 benchmark 分析 2.负责在真实机器人平台上设计并实施 RL 训练方案,通过真机数据迭代提升具身操作模型在复杂、非结构化环境下的泛化能力与鲁棒性 3.参与设计与训练通用奖励模型,通过奖励模型引导,实现长程任务(Long-horizon tasks)下的高效真机强化学习 4.跟踪前沿具身智能方向论文,探索基础模型与 RL 结合的最新技术,推动其在真机任务中的表现超越传统模仿学习方法
1. 深入理解美团无人机业务场景,探究以类人形具身算法数据采集与算法训练的最优配合范式,设计高效的数据闭环方案,以提升具身智能模型在真实物理世界中的泛化能力。 2. 针对非结构化环境下的感知与决策难题,研发创新性的具身智能算法,并探索其在无人机/机器人系统中的实际部署边界与应用价值。 3. 依托公司真实场景数据与高校合作资源,定义并解决具身智能领域的关键科学问题,参与前沿学术会议的高质量论文产出。 4、负责将AI工具与方法应用于算法研发全流程,提升开发效率与解决方案的智能化水平;
1、负责机器人多模态大模型(VLA模型)的工程化落地,包括预训练开发、模型微调、训练优化以及实际效果调优; 2、参与基于大模型的机器决策控制工程化工作,包括训练框架搭建、数据集处理、算力部署,以及在真机上的部署与测试; 3、优化大模型的训练效率以及资源利用率,熟练运用诸如模型并行、Flash Attention、LoRA等技术; 4、负责云端数据处理以及分布式训练落地,优化大模型的多模态任务处理能力; 5、跟进多模态大模型与具身智能的前沿应用进展,负责模型在机器人场景的部署与技术转化。