京东多模态VLA大模型轻量化及闭环控制研究
任职要求
1. 计算机、自动化、机器人、电子信息等相关领域的本硕博在校生。 2. 熟练使用Python或C++,熟悉Pytorch或TensorFlow,具备大模型训练或微调经验。 3. 掌握多模态模…
工作职责
1.多模态大模型开发与优化:参与VLA大模型的训练、微调和部署,提升模型在机器人任务上的表现,探索多模态对齐方法,优化视觉、语言与机器人动作的联合表征。 2.具身智能任务适配:研究如何将VLA模型适配到真实机器人场景,涉及高效Prompt工程或轻量化微调策略,降低计算成本 3.在仿真环境中构建多模态交互任务测试集,评估模型泛化性,将语言和视觉指令转化为可执行的动作序列
团队介绍 滴滴自动驾驶AI research 团队致力于自动驾驶领域以及机器人领域前沿算法的研究和实际落地,团队成员均毕业于国内外顶尖高校,并在人工智能领域发表了多篇高水平论文 。团队的核心目标是从传统的模块化、规则驱动的系统,迈向以大模型(Foundation Models)为核心,数据驱动、端到端学习的全新架构,来打造通用的行为智能体,应用于自动驾驶,机器人等领域。团队目前的研究内容和探索方向包括但不局限于基于多模态大模型的模仿学习、强化学习、离线强化学习以及决策规划、Agent行为预测等。 主要方向与职责: 你将在以下方向中选定一个或多个方向深入负责,并承担从研发到落地、从算法到系统的端到端职责: (1)前沿研究与探索:紧密跟踪并深入研究多模态大模型、生成式模型的最新进展。并探索和验证将这些前沿技术应用于自动驾驶和机器人领域的可能性。 (2)VLA模型设计与训练:主导或参与设计面向自动驾驶场景或者机器人的VLA大模型,通过将模仿学习和强化学习范式与大模型相结合,使其能够理解周边的三维场景以及人类指令,并输出安全、拟人化的行为决策。 (3)世界模型与闭环仿真:研究和构建能够进行时空预测的“世界模型”作为仿真器,将大模型智能体与仿真器深度结合,从而构建一个可以安全、高效地进行虚拟测试和迭代的闭环仿真环境。 (4)数据驱动与数据闭环:构建高效、可扩展的数据闭环系统。从海量真实数据中自动挖掘高价值的困难场景,长尾场景等,同时保证数据分布的多样性与均衡性。

1.VLA模型研发:负责基于Transformer架构的视觉-语言-动作(VLA)大模型的选型、微调与训练(如复现或改进RT-2,XVLA等架构)。 2.多模态数据处理:搭建多模态数据(图像/点云+语言指令+机械臂动作)的预处理与对齐管线,设计高效的数据编码/解码方案。 3.端到端策略学习:探索从像素输入直达关节控制的端到端模仿学习(Imitation Learning)算法,解决不同场景下的泛化性问题。 4.模型轻量化部署:配合系统工程师,将庞大的VLA模型量化、剪枝,并部署在端侧计算平台(Jetson Orin等)上进行实时推理。
- 参与多模态大模型(VLM)在内容安全场景的研究与落地,涵盖数据自动标注、模型微调及效果评估; - 协助识别与分析图像/视频中的安全风险(如违规、低俗、欺诈、暴力等),推动检测能力迭代; - 参与高质量数据集的构建、清洗与分析,驱动模型在安全场景下的持续优化; - 跟进多模态理解、内容安全等领域的前沿进展,参与团队技术分享与方案创新。
ByteIntern:面向2027届毕业生(2026年9月-2027年8月期间毕业),为符合岗位要求的同学提供转正机会。 团队介绍:Data AML是字节跳动的机器学习中台,为抖音/今日头条/西瓜视频等业务提供推荐/广告/CV/语音/NLP的训练和推理系统。为公司内业务部门提供强大的机器学习算力,并在这些业务的问题上研究一些具有通用性和创新性的算法。同时,也通过火山引擎将一些机器学习/推荐系统的核心能力提供给外部企业客户。 1、深度参与业界效果领先的生成模型Seedance/Seedream相关工作,理解模型Seed-VLM的软硬件协同优化和算法优化逻辑,构建业界领先的模型优化能力矩阵; 2、研发面向多端异构平台的量化&稀疏、MOE压缩、Token压缩、Cache复用、投机解码、KV Cache压缩等加速算法,构建Training-Free或结合Post-Training/RL-Training的加速算法能力; 3、面向分布式训练/推理场景,深度挖掘模型表示位宽、分辨率、步数、结构等维度的冗余,通过算法和工程创新加速训练和推理过程,实现降本增效; 4、探索Efficient AIGC、Efficient LLM领域最前沿的问题,包括多模态理解生成统一建模加速、结合RL训练的模型优化等方向。