logo of didi

滴滴多模态大模型/VLA模型研究员(J231215004)

社招全职技术地点:广州状态:招聘

任职要求


1.	学历与基础:
a.	计算机科学、人工智能、机器人学或相关领域的硕士及以上学历,博士优先。
b.	具备良好的编程能力,精通 Python 及至常用深度学习框架,并对框架底层实现有一定了解。
2.	专业领域经验(至少精通以下一项):
a.	多模态大模型 / VLA模型: 拥有实际训练、微调或应用VLA模型以及多模态大模型框架的经验。理解多模态数据融合、对齐和协同的关键技术。
b.	生成式模型与世界模型: 熟悉并实践过基于Diffusion Models/自回归的时序生成模型,特别是在自动驾驶,机器人等对数据时空一致性有高要求的任务上有成功应用经验。
c.…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


团队介绍 
滴滴自动驾驶AI research 团队致力于自动驾驶领域以及机器人领域前沿算法的研究和实际落地,团队成员均毕业于国内外顶尖高校,并在人工智能领域发表了多篇高水平论文 。团队的核心目标是从传统的模块化、规则驱动的系统,迈向以大模型(Foundation Models)为核心,数据驱动、端到端学习的全新架构,来打造通用的行为智能体,应用于自动驾驶,机器人等领域。团队目前的研究内容和探索方向包括但不局限于基于多模态大模型的模仿学习、强化学习、离线强化学习以及决策规划、Agent行为预测等。

主要方向与职责:
你将在以下方向中选定一个或多个方向深入负责,并承担从研发到落地、从算法到系统的端到端职责:

(1)前沿研究与探索:紧密跟踪并深入研究多模态大模型、生成式模型的最新进展。并探索和验证将这些前沿技术应用于自动驾驶和机器人领域的可能性。
(2)VLA模型设计与训练:主导或参与设计面向自动驾驶场景或者机器人的VLA大模型,通过将模仿学习和强化学习范式与大模型相结合,使其能够理解周边的三维场景以及人类指令,并输出安全、拟人化的行为决策。
(3)世界模型与闭环仿真:研究和构建能够进行时空预测的“世界模型”作为仿真器,将大模型智能体与仿真器深度结合,从而构建一个可以安全、高效地进行虚拟测试和迭代的闭环仿真环境。
(4)数据驱动与数据闭环:构建高效、可扩展的数据闭环系统。从海量真实数据中自动挖掘高价值的困难场景,长尾场景等,同时保证数据分布的多样性与均衡性。
包括英文材料
学历+
Python+
深度学习+
大模型+
自动驾驶+
强化学习+
CVPR+
ICCV+
还有更多 •••
相关职位

logo of bytedance
实习A181864

ByteIntern:面向2027届毕业生(2026年9月-2027年8月期间毕业),为符合岗位要求的同学提供转正机会。 团队介绍:Data AML是字节跳动的机器学习中台,为抖音/今日头条/西瓜视频等业务提供推荐/广告/CV/语音/NLP的训练和推理系统。为公司内业务部门提供强大的机器学习算力,并在这些业务的问题上研究一些具有通用性和创新性的算法。同时,也通过火山引擎将一些机器学习/推荐系统的核心能力提供给外部企业客户。 1、深度参与业界效果领先的生成模型Seedance/Seedream相关工作,理解模型Seed-VLM的软硬件协同优化和算法优化逻辑,构建业界领先的模型优化能力矩阵; 2、研发面向多端异构平台的量化&稀疏、MOE压缩、Token压缩、Cache复用、投机解码、KV Cache压缩等加速算法,构建Training-Free或结合Post-Training/RL-Training的加速算法能力; 3、面向分布式训练/推理场景,深度挖掘模型表示位宽、分辨率、步数、结构等维度的冗余,通过算法和工程创新加速训练和推理过程,实现降本增效; 4、探索Efficient AIGC、Efficient LLM领域最前沿的问题,包括多模态理解生成统一建模加速、结合RL训练的模型优化等方向。

更新于 2026-04-17杭州
logo of jd
校招多模态大模型与应

1. 研发多模态商品理解模型,融合图像、文本、视频特征,优化跨模态特征对齐与检索算法; 2. 负责高质量多模态训练数据集构建,包含图像清洗、属性标注与图文匹配关系挖掘; 3. 探索多模态大模型在图像搜索领域的应用,提升模型在复杂商品数据上的泛化能力; 4. 设计多模态表征评测框架,集成自动化评估与人工审核机制,提升模型迭代效率; 5. 基于大语言模型(LLM)实现用户意图识别、生成式排序与重排及多目标优化; 6. 结合SFT、RLHF等技术实现生成式端到端推荐建模,持续优化搜推系统决策; 7. 利用奖励模型(Reward Model)与强化学习量化商业目标,构建长期生态价值体系; 8. 探索大模型推理机制,优化语义理解与认知能力,提升搜推系统的智能化水平。

更新于 2026-06-16北京
logo of jd
校招多模态大模型与应

1. 开展电商场景下的视频生成大模型算法研究,攻克商品一致性、多参考图、多镜头控制等核心技术难题; 2. 负责视频生成模型的训练与推理优化,解决训练与应用阶段的速度及稳定性等问题,保障研究成果具备规模化落地能力; 3. 围绕电商内容应用场景构建数据迭代机制,持续优化并提升应用场景下的核心模型指标; 4. 推动多模态视频生成研究成果在集团内容业务及商品素材等场景的端到端落地,提升消费者购物体验与商品转化率。

更新于 2025-05-07北京
logo of pingantech
社招3年以上计算机网络技术类

1、负责多模态大模型(MLLM)全流程算法研发,完成模型持续预训练、增量后训练、指令微调SFT、偏好对齐Alignment全链路工作;开展模型结构设计、模态融合方案设计、损失函数设计优化、训练策略迭代制定,提升模型综合能力。 2、攻坚跨模态语义对齐、多模态特征融合、异构图文/图表/文档数据解析理解等核心技术难点,优化模型在跨模态检索、视觉问答VQA、Chart/DocVQA、图文理解、长文档逻辑推理、图文生成等任务效果。 3、跟踪全球多模态大模型前沿技术演进,结合业务场景输出技术路线规划,主导模型迭代优化、技术难点攻关,沉淀可复用技术方案。 4、深耕业务场景,探索多模态模型与智能体Agent融合落地,围绕文档智能解析、grounding,图表推理、专业内容问答、复杂逻辑推理搭建垂域应用方案,实现算法技术和业务深度融合。 5、牵头多模态模型项目完整研发、迭代与落地交付,针对业务痛点定制模型优化方案,持续验证、复盘提升模型线上表现。

更新于 2026-06-18深圳