logo of tongyi

通义视觉多模态(理解)大模型算法工程师

校招全职通义2026届秋季校园招聘地点:北京 | 杭州状态:招聘

任职要求


1. 来自全球Top高校计算机科学、人工智能、计算机视觉、具身智能、机器学习深度学习或相关领域应届毕业生,博士/硕士毕业生优先。
2. 在多模态模型(尤其是视觉语言模型)方面有扎实的理论基础和实践经验,熟悉图像、视频、3D、文本等至少两种模态的建模方法。
3. 在国际顶级计算机会议/期刊(如CVPRECCV、ICCV、NeurIPS、ICML、ICLR、ACL、TPAMI等)以一作身份发表论文,或在开源社区、计算机领域竞赛中有突出研究成果和项目经历。
4. 具备扎实的代码功底,熟悉PyTorch/Tens…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


通义千问(Qwen)是由通义实验室自主研发的超大规模语言模型,具备多模态、多语言、跨任务的理解与生成能力。Qwen系列模型,涵盖参数量从亿级到万亿级的基座大语言模型,并相继推出Qwen-VL、Qwen-Audio、Qwen-Omni、Qwen-Coder、Qwen-Image等系列模型。从多轮对话到代码生成,从逻辑推理到内容创作,从单一多模态到全模态统一理解生成,Qwen 正在打造全球领先的全模态模型技术体系,推动AI在企业服务、开发者生态、个人用户等领域的深度应用,引领下一代人工智能的发展。

若你对以下一个或者多个方向感兴趣均欢迎投递:
1)多模态基础模型的研发,包括融合视觉语言的跨模态理解模型设计,提升视觉基础模型在图像/视频中的视觉知识、空间感知、Omni Parsing 等核心能力,并同时优化多模态大模型的AI infra。
2)通过强化学习(RL)持续提升多模态模型推理能力和执行任务能力,构建支持网络世界(PC/Mobile/Web/游戏)交互的通用智能体,将相关能力拓展到GUI agent,VLA,以及具身智能场景中。
3)研究理解与生成统一的模型架构,实现跨模态生成与推理的协同优化。

工作职责:
1. 多模态 pre-training:开展研究及进行实验,研究内容包括:数据清洗筛选、数据配比优化、课程学习、视觉语言模型结构设计与优化、训练策略优化、预训练数据合成、scaling law 预测、词表优化、模型蒸馏与压缩、长上下文能力优化等。
2. 多模态 post-training:迭代 post-training 训练策略(SFT/RLHF),专项能力数据迭代,参与模型能力评测及评测数据和评估标准的迭代。
3. 多模态推理和通用 agent:通过强化学习(RL)持续提升多模态模型推理能力和执行任务能力,打造多模态的 test scaling laws,并推动模型对网络和虚拟世界的交互和任务完成能力。
4. 统一理解生成:构建视觉统一理解生成大模型,推进多模态统一生成与理解的推理和交互新范式。
包括英文材料
OpenCV+
机器学习+
Python+
PyTorch+
深度学习+
Transformer+
CVPR+
ECCV+
还有更多 •••
相关职位

logo of xiaohongshu
实习内容理解

我们是小红书应用算法部/内容理解算法组,目前专注于内容理解场景的技术落地和产品预研。我们希望寻求优秀在读硕士生/博士生共同突破多模态/视觉大模型理解和生成算法在多模态内容理解行业落地的技术挑战,作为实习生,你将有机会与产品、工程紧密合作,将研究算法应用到实际问题中,并解决有难度有价值的问题,促进领域前沿技术的发展。欢迎投递简历。该岗位的核心研究方向包括但不限于: 1. 计算机视觉:解决视觉理解中指代关系特征归一化和识别研究; 2. 多模态表征:多源数据中多模态表征技术,包括局部/全局匹配、视频表征、多模态表征、对抗性和泛化性等问题。 3. 通用多模态大模型:通用多模态大模型在安全领域理解相关研究,包括强化微调、逻辑推理、多模态理解、幻觉消除及评价机制等。 我们希望在一个和多个方向做出有意义的、创新性的工作。

更新于 2026-01-04北京
logo of antgroup
社招5年以上产品类-平台型

1、医疗报告智能解读: 负责“阿福”的拍照/上传报告功能,核心解决体检单、化验单、处方单等复杂排版图片的结构化提取与医学结论分析; 2、视觉模型调优: 构建医疗文档的图文评测集(Benchmark),解决模糊拍摄、手写体识别、复杂表格对齐等长尾问题,降低模型幻觉; 3、多模态交互体验: 设计“拍一拍”后的交互流,让用户不仅看到数据,还能通过图片与阿福进行多轮问诊对话。

更新于 2026-07-24杭州
logo of oppo
校招AI/算法类

1. 构建多模态请求理解与路由决策系统,实现请求类型自动判别: - 文本/图文/视频混合输入的意图解析 - 动态选择最优处理引擎(多模态QA/纯文本模型/工具调用) 2. 开发跨模态特征对齐模型,建立统一决策空间: - 文本-视觉-时序特征的联合表示学习 - 多模态上下文理解与场景适配 3. 构建交互质量评估体系: - 路由决策的可解释性分析 - 错误归因与策略迭代优化

更新于 2026-04-23北京|深圳
logo of bytedance
实习A159830

ByteIntern:面向2027届毕业生(2026年9月-2027年8月期间毕业),为符合岗位要求的同学提供转正机会。 团队介绍:字节跳动Seed团队成立于2023年,致力于寻找通用智能的新方法,追求智能上限,为科技和社会发展作出贡献。 Seed团队在AI领域拥有长期愿景与决心,团队研究方向涵盖MLLM、GenMedia、AI for Science、机器人等,在中国、新加坡、美国等地设有实验室和岗位。目前,团队已推出业界领先的通用大模型以及前沿的多模态能力,支持豆包、即梦、TRAE等超过50个应用场景,并通过火山引擎开放给企业客户。第三方数据显示,豆包App用户量在中国市场排名第一,豆包大模型日均Token调用量行业领先。 1、参与视频通话模型Post-training的优化和研发,包括通话长多轮对话体验的优化、视觉感知能力、联网搜索能力、记忆、Agent调用能力等; 2、研发视频通话的新特性,包括主动响应、音视频双工等特性; 3、参与智能硬件相关能力的优化,提升端到端用户体验; 4、探索各种前沿创新性技术,并转化为应用侧效果。

更新于 2026-04-23北京