logo of sensetime

商汤多模态Agent算法研究员

社招全职算法地点:北京 | 上海 | 深圳状态:招聘

任职要求


1、 计算机科学、人工智能、机器学习或相关领域,硕士及以上学历,有 AI相关产品或者研发经验者优先
2、 逻辑清晰,有团队协作精神,有责任心,乐于接受挑战;
3、有计算机相关背景,熟悉深度学习计算机视觉、多模态模型等基本知识;
4、熟悉 C++ 或者 Python,或精通其他语言…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


深度参与多模态Agent的核心研发工作
1、前沿探索: 跟踪并复现多模态大模型、AI Agent、具身智能(Embodied AI)等领域的最新研究成果(如论文、开源项目);
2、算法研发: 参与设计和实现多模态Agent的核心算法模块,包括但不限于;
3、多模态感知与理解: 融合文本、图像、视频、音频等信息,让Agent“看懂”和“听懂”复杂世界;
4、规划与推理: 为Agent构建长期记忆、任务规划(Planning)、工具使用(Tool-use)和自我反思(Self-reflection)的能力;
5、行动生成: 将Agent的决策转化为在数字或物理环境中的具体行动指令;
6、实验与优化: 参与构建和优化多模态Agent的训练、评测流程,设计实验验证算法效果,并进行性能分析与迭代;
7、原型构建: 将前沿算法快速落地为原型系统(Prototype),直观展示Agent的能力,并推动技术向产品转化;
8、知识沉淀: 与团队共同撰写技术报告、专利和学术论文,分享你的创新见解。
包括英文材料
机器学习+
学历+
深度学习+
OpenCV+
还有更多 •••
相关职位

logo of bytedance
校招A167310

Seed 大模型人才校招,是字节跳动 Seed 面向高校人才推出的招聘项目。我们始终相信,真正重要的技术进步来自对高难度问题的持续挑战。面对 AI 时代的巨大机遇,Seed 团队并不止步于模型迭代,而是选择进入技术深水区,推进下一代 AI 范式突破,不断探索智能的边界与上限。 团队介绍:字节跳动 Seed 团队成立于 2023 年,致力于寻找通用智能的新方法,追求智能上限,为科技和社会发展作出贡献。 Seed 团队在 AI 领域拥有长期愿景与决心,团队研究方向涵盖 MLLM、GenMedia、AI for Science、机器人等,在中国、新加坡、美国等地设有实验室和岗位。目前,团队已推出业界领先的通用大模型以及前沿的多模态能力,支持豆包、即梦、TRAE 等超过 50 个应用场景,并通过火山引擎开放给企业客户。第三方数据显示,豆包 App 用户量在中国市场排名第一,豆包大模型日均 Token 调用量行业领先。 1、探索构建GUI、Code、游戏等虚拟世界的通用多模态Agent; 2、探索研究多模态理解、生成式、机器学习、强化学习、AIGC、计算机视觉、人工智能等前沿技术; 3、探索大规模/超大规模多模态理解与生成交织的基础模型,并进行极致系统优化;数据建设、指令微调、偏好对齐、模型优化;提升数据合成、Scalable oversight、模型推理、规划能力,构建全面客观准确的评测体系,探索提升大模型能力; 4、利用预训练、仿真等技术对虚拟/现实世界的各类环境进行建模,提供多模态交互探索的基本能力,推动应用落地,研发以人工智能技术为核心的新技术、新产品。

更新于 2026-03-28上海
logo of meituan
校招核心本地商业-基

我们正在构建具备物理世界感知、理解、仿真能力与支撑数字世界高质量呈现的本地生活视觉技术引擎,让每一次连接更智能,让物理世界的烟火气更美好。 团队介绍: 作为美团官方的视觉AI基础模型团队,负责数字世界和物理世界等本地生活全场景多模态技术的前沿探索和应用,在AIGC生成、虚拟人交互、多模态理解等领域持续沉淀行业领先的技术成果。 研究方向包括但不限于: 1、基于多模态预训练和后训练相关技术创新,提升多模态大模型在OCR、文档图表解析、Visual Grounding、细粒度感知、视觉问答等核心视觉理解任务上的能力上限; 2、索多模态强化学习方案创新设计,实现视觉感知、多模态理解等场景下的高性能可信输出和幻觉抑制; 3、增强模型的视觉推理能力(Visual CoT、PRM等)、工具调用与Agent能力、长上下文视觉理解能力和GUI能力,提升模型在视觉感知、理解、规划决策的长程复杂任务上的综合表现。

更新于 2026-06-03北京|上海|深圳
logo of meituan
校招核心本地商业-基

我们正在构建下一代企业级 AI 知识中枢——不是一个实验室里的 Demo,而是一套正在真实运转、服务数万人的智能系统。从支撑百万级文档的智能问答引擎,到覆盖全公司的 AI 办公助手,我们的技术每天都在改变真实用户的工作方式。而现在,我们正在迈向更具野心的目标:构建企业的组织认知系统(Organizational Intelligence)——让 AI 不仅回答问题,更能理解组织如何运转、知识如何流动、决策如何形成。 通过连接文档、会议、IM、代码、项目与业务流程,我们正在定义企业 AI 的三层核心架构:Memory — 组织记忆:可持续沉淀、持续演化的知识底座;Cognition — 组织认知:理解上下文、识别模式、辅助决策;Agent — 智能行动:自主规划、多步执行、自我进化。 核心职责: 1、 多模态 RAG 架构设计面向文本、图像、表格、视频的统一检索增强生成框架,攻克跨模态知识索引与融合的核心挑战,让企业知识库中的每一种信息形态都能被精准理解和召回。 2、Agent 强化学习与自主规划探索基于 RL 的工具调用与任务规划能力,实现多轮多步骤复杂办公任务的自主执行,构建具备长期记忆与自我进化能力的下一代办公 Agent。 3、大模型可信度与幻觉抑制研究幻觉检测与抑制技术,构建事实一致性评估体系与证据链追溯机制,确保企业级知识问答输出的每一个字都经得起验证。

更新于 2026-06-03北京|上海
logo of meituan
实习核心本地商业-业

【课题说明】 致力于探索多模态大模型与强化学习的前沿技术。研究方向包括多模态表征与理解、强化学习增强的生成与对齐、智能体(Agent)决策与规划等,业务影响覆盖美团外卖每天数千万的订单,核心工作是为用户及商家实现地理空间的智能规划,包括商家配送范围(决策用户是否能在该商家下单)、Area of Interest边框挖掘(AOI,即用户所处地理社区边界,保证用户下单体验的一致性)、用户拼单范围、骑手取件区域的建模与优化。目标是构建能够理解复杂业务需求、驱动范围智能调整的Agent系统,实现“技术驱动业务范式”的升级转变,最终促进平台供给繁荣与用户的供需匹配优化。 【建议研究方向】 1.多模态感知与表征建模:集成地理信息(GIS)、用户热力、图像、自然语言等多模态数据,进行联合表征学习与建模,攻克跨模态语义对齐难题,为空间智能理解与决策提供统一的感知基础。 2.强化学习增强的多模态生成与优化:探索强化学习在多模态大模型中的应用,研究基于RL的多模态内容(如图像、GIS、文本描述)生成、跨模态偏好对齐及模型自适应优化,以持续提升系统对复杂业务场景的理解与推理能力。 3.基于后训练的多模态内容理解与审核:探索多模态大模型后训练技术,实现图像质量审核、OCR识别、图文一致性校验、图像合成等能力,提升一线运营采集数据等场景的自动化水平与准确性。 4.面向履约空间规划的智能体(Agent)构建:设计并开发能意图识别、归因分析、并自主决策执行商家范围/AOI边界调整的智能体。重点研究Agent的任务规划、工具调用与动态策略优化能力。 5.业务仿真与决策推演:基于空间智能Agent,对不同的策略进行模拟推演,评估其对供给、平台规模、履约体验的影响,为科学决策提供支持。 我们将提供海量的真实业务场景与数据、充足的GPU计算资源以及极高的技术探索自由度,目标是产出兼具技术前沿性与业务影响力的成果,共同定义下一代智能履约空间位置规划的技术范式,同时能在顶级学术会议(如ICML, NeurIPS, KDD)发表paper。

更新于 2026-02-06北京