logo of deepseek

深度求索多模态理解(数据/算法)研究员

社招全职深度学习研究员地点:北京 | 杭州状态:招聘

任职要求


(满足其一即可):
1.深入理解主流视觉编码器(如 CLIP, SigLIP 等)的模型结构,熟悉其训练与评测方法。
2.熟悉主流多模态模型的架构,具备大规模多模态预训练或后训练(SFT/RL/OPD)实战经验。
3.具备极强的数据直觉,有大规模图文/视频数据清洗、质量标注及数据合成的实战经验。具备一定的工程代码能力。
4.主导和交付过多模态某个垂直领域(包括但不限于 OCR、Image Caption、空间理解、通用 QA、用户意图理…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


【团队使命】
AGI 绝不会止步于文本,迈向 AGI 的关键一环,在于让模型拥有理解物理世界的能力。我们的使命,是为 AI 注入“看懂并理解世界”的多模态灵魂,让模型在面对复杂的真实世界时,依然能展现出精准的感知与推理能力。在这里,你将会挑战多模态领域的本质难题:处理海量且充满噪声的多模态数据,设计底层的高效原生模型架构,探索大规模训练策略,建立反映真实需求的评测基准。跨越数据、架构、训练与评测的全链路,让多模态成为解决现实挑战的核心生产力。
【岗位类别】:实习/全职

【工作方向】
覆盖多模态理解基座模型全链路,包含:视觉编码器优化 / 多模态预训练 / 多模态后训练 / 评测体系建设(候选人可选其中1个或多个方向)。


1.负责多模态基座模型的迭代。探索视觉编码器和 VLM 的结构、训练策略和评测方式,针对多模态场景持续验证和迭代预训练与后训练(SFT / RL / OPD)算法。
2.负责多模态理解数据体系构建。定义图文/视频数据集的采集方式、质量标准和筛选方法,多部门协作建设大规模自动化清洗、质量筛选与数据合成管线,从数据侧提高模型表现。
3.针对通用问答、文档/图表解析、多模态推理等基础多模态场景,进行针对性的数据收集、模型训练和精细化调优。
4.推动 GUI、白领办公、多模态搜索等场景的多模态 Agent 核心能力建设与落地。
5.搭建面向“用户真实体验”的多维度多模态评测体系。从定义评测维度、收集真实数据、数据标注到模型反馈,定位模型短板,指引模型迭代。
包括英文材料
SFT+
OCR+
还有更多 •••
相关职位

logo of quark
实习日常实习生

我们是谁: -事业群简介:我们是阿里智能信息事业群,专注于千问APP、夸克APP、AI眼镜等AI to C的业务,为2亿用户群体提供AI服务,你或你身边的小伙伴中可能就是我们的用户。我们是一支致力于在AI赛道长期发展、创新务实的团队,欢迎每一位有想法、对AI有热情的小伙伴和我们一起参与这个令人激动的过程。 -团队简介:我们是“千问相机”背后的多模搜索&问答算法团队,负责构建面向千问APP、夸克APP、AI眼镜等产品的统一多模态理解、搜索、问答技术体系,我们基于百亿级图文/视频库及海量用户真实场景需求,攻克多模态对齐与检索难题,探索大模型与搜索的深度融合,支撑全网搜索、智能拍搜、多模态RAG等关键场景。团队技术氛围浓厚,工作氛围开放包容,加入我们,与顶尖工程师共同成长! ⭐️ 你会参与到: 1.与算法工程师携手深入探索大模型的底层原理,能够更好地理解数据与模型之间的关系,为模型训练提供更具针对性的标注策略,加速模型的优化与迭代。 2.深度参与数据与模型的交互过程,理解不同领域知识之间的关联和相互影响,从而拓展自己的知识边界,培养跨学科的思维能力,能够从多个角度理解数据、理解知识、理解智能。 3.通过对数据作为人工智能核心驱动因素之一的深刻理解和实战参与,进一步提升快速学习的能力、创新思维激发,对个人未来的职业发展中提供更多的可能性,进一步提升未来在职场的竞争力。

更新于 2025-12-04杭州
logo of alibaba
社招4年以上

1. 主导多模态理解大模型评测体系设计,从真实用户场景出发定义核心能力维度,将体验痛点转化为可量化的评测指标。 2. 设计覆盖信息检索、内容理解、文档分析、视频摘要、富媒体问答等高频场景的评测任务,推动评测从"学术任务"向"产品体验"演进。 3. 持续挖掘真实使用中的 Bad Case,做系统性分类与归因,形成问题清单与改进优先级。 4. 建立评测数据质量管控与版本管理机制,定期更新评测集以覆盖新场景与新模态组合。 5. 与产品、算法团队紧密协作,在新模型上线前完成评测,提供数据驱动的优先级建议。

更新于 2026-06-01北京|杭州
logo of alibaba
实习阿里巴巴2027

- 参与用户理解、行为建模、意图识别等核心算法研发。 - 探索大模型、多模态、序列建模、因果推断、强化学习等技术在搜索推荐场景中的应用。 - 参与模型训练、评估、上线和实验分析,推动算法能力在真实产品中落地。 - 与产品、工程、算法团队合作,将研究问题转化为可验证、可迭代的系统能力。 - 在有条件的情况下,参与论文、专利、技术分享和开源等技术影响力建设。

更新于 2026-05-28北京|杭州
logo of alibaba
实习阿里巴巴2027

1、多模态理解:负责图文/视频/音频理解相关的算法研发,提升模型对复杂多模态场景的语义分析和推理能力; 2、多模态生成:开发基于 Diffusion Model 或 Autoregressive 架构的生成算法(如 Text-to-Image, Text-to-Video),优化生成的质量、多样性与可控性; 3、研究多模态理解和生成统一的数据组织、训练范式等难点问题,大规模多模态理解和生成的训练和应用。

更新于 2026-03-17北京|杭州