高德地图高德-具身多模态动作生成式大模型算法工程师(人机交互方向)-具身业务部
任职要求
● 硕士及以上学历,计算机科学、人工智能、自然语言处理、机器人学或相关专业; ● 具备VLA意图理解、动作预测等相关项目或研究经验; ● 熟悉扩散模型、GPT等生成式大模型,有大模型训练、3D内容生成、动作生成或数字人等领域的研发经验者优先; ● 了解动作重定向…
工作职责
负责多模态人机动作交互大模型算法的研发,推动机器人交互技术的创新与落地,具体包括但不限于: ● 研究多模态智能体、推理与规划等前沿方向,开发多模态意图理解与动作预测算法,使机器人在交互中能自主动作决策并执行; ● 构建通用动作生成模型:基于语音、视觉、语境等多模态输入,研发高自然度、高智能性的机器人物理可执行动作生成算法; ● 优化动作控制性能:设计动作生成与执行控制的联合优化算法,提升动作的流畅性、精准性与实时响应能力。
我们正在寻找一位对具身智能(Embodied AI)与机器人操作有浓厚兴趣的研发实习生。您将在资深研究员和工程师的指导下,参与机器人触觉感知与多模态学习算法研发,探索视觉、触觉、语言及机器人状态等多源信息的融合建模。 您将参与构建面向真实机器人操作场景的感知与策略模型,研究触觉信息在机器人精细操作中的作用,并参与从数据处理、模型训练到真机验证的完整研发流程,为下一代具身智能模型(VLA、Diffusion Policy等)提供核心算法支持。 岗位职责 1.触觉感知算法研发: 参与机器人触觉表示学习与Touch Encoder开发,探索触觉信息建模及多模态融合方法,提升机器人对接触状态、受力变化及操作过程的感知能力。 2.多模态模型开发: 参与视觉、触觉、语言、本体状态(Pose / Joint)等多模态信息融合,支持VLA、Diffusion Policy等模型训练与优化。 3.机器人操作算法研究: 参与接触密集(Contact-rich)场景下的机器人操作算法开发,探索触觉辅助抓取、装配、插接等精细操作任务。 4.模型训练与实验验证: 参与机器人数据处理、模型训练、实验评测及真实机器人验证,持续优化模型性能与泛化能力。
主要负责多模态大模型在具身智能方向的模型能力分析和训练策略优化,并且对训练数据、训练策略和模型能力之间的关系进行研究分析,产出可行的模型评测方案和训练策略,具体工作内容包括但不限于: 1. 追踪多模态大模型在具身智能方向的前沿进展,积极学习新的模型结构、前沿模型认知,并进行深入分析。 2. 建设验证具身智能的GPT时刻的评测方案和度量分析方法,指引行业的技术迭代; 3. 探索VLA的data-scaling方案,通过VLM的基座能力提升来推进具身任务泛化,实现zero-shot/few-shot的跨任务、跨本体的泛化; 4. 积极探索多模态大模型同环境交互的学习方法,研究通过强化学习的下一代智能提升的关键途径。 5. 与各相关部门保持良好沟通,深度参与多模态模型的训练过程,共同推动多模态大模型持续优化。
主要负责多模态大模型在全模态(包括图像、视频、语音)的生成和理解、具身智能和GUI Agent等方向的模型能力分析和训练策略优化,并且对训练数据、训练策略和模型能力之间的关系进行研究分析,产出可行的模型评测方案和训练策略,具体工作内容包括但不限于: 1. 追踪多模态大模型的前沿进展,积极学习新的模型结构、前沿模型认知,并进行深入分析。 2. 在具身智能方向中,探索VLA的data-scaling方案,指引VLM的关键能力提升;探索视频生成基座以及统一模型的潜力,包括但不限于世界模型训练和效果度量;积极探索VLA/VLM同环境交互的学习方法,涉及仿真和真机实验,研究通过强化学习的下一代智能提升的关键途径。 3. 在全模态统一生成理解方向中,研究达到理想态的关键演进路径并进行度量分析,指引长期有潜力的模型迭代方向。 4. 与各相关部门保持良好沟通,深度参与多模态模型的训练过程,共同推动多模态大模型持续优化。