智谱27届实习-多模态算法实习生
实习兼职地点:北京状态:招聘
工作描述
【团队介绍】 智谱多模态大模型团队是全球领先的多模态研究团队之一,专注于推动视觉语言大模型的认知与推理能力的突破。团队拥有从多模态理解到生成的全栈自研技术体系,依托强大的计算资源和全链路研发能力,持续引领行业创新。 团队负责多模态基座模型研发(视觉语言模型+多模态生成模型),先后推出GLM-V系列多模态基座模型,以及GLM-Image、CogView、CogVideo等前沿生成模型。2025年连续发布GLM-4.1V-Thinking、GLM4.5V和GLM-4.6V系列模型,其中GLM-4.1V-Thinking创新性地引入思维链推理机制,采用课程采样强化学习策略,系统性提升模型跨模态因果推理能力与稳定性,在28项业界权威评测中有23项达成10B级模型的最佳成绩(SOTA);而GLM-4.5V采用MoE架构(总参数106B、激活参数12B),在100B级视觉推理模型中树立起新的标准,在41个业界主流benchmark上达到同级别SOTA,且OCR、视频理解、AI解题、长文档解读、前端复刻、空间定位与推理等核心能力…
登录查看完整工作描述
微信扫码,1秒登录
包括英文材料
大模型+
https://www.youtube.com/watch?v=xZDB1naRUlk
You will build projects with LLMs that will enable you to create dynamic interfaces, interact with vast amounts of text data, and even empower LLMs with the capability to browse the internet for research papers.
https://www.youtube.com/watch?v=zjkBMFhNj_g
OCR+
https://www.ibm.com/think/topics/optical-character-recognition
Optical character recognition (OCR) is a technology that uses automated data extraction to quickly convert images of text into a machine-readable format.
https://www.youtube.com/watch?v=or8AcS6y1xg
Optical character recognition (OCR) is sometimes referred to as text recognition.
nano+
https://www.howtogeek.com/42980/the-beginners-guide-to-nano-the-linux-command-line-text-editor/
How-To Geek's got your back with this tutorial to Nano, a simple text-editor that's very newbie-friendly.
https://www.youtube.com/watch?v=DLeATFgGM-A
nano is a text editor that's among the easiest to learn.
还有更多 •••
相关职位
实习
1. 计算机、人工智能、自动化等相关专业在读硕士或博士研究生; 2. 扎实的深度学习基础,熟悉Transformer等主流架构,理解VLM/LLM基本原理; 3. 熟练掌握Python及PyTorch
更新于 2026-07-17北京
实习
1.在读硕士/博士,计算机、人工智能、机器学习、电子信息、自动化、数学等相关专业,多模态大模型、计算机视觉等相关方向; 2.具备一定的多模态算法或计算机视觉实践经验,对多模态大模型算法有深入理解; 3
更新于 2026-09-18北京
实习
1.在读硕士/博士,计算机、人工智能、机器学习、电子信息、自动化、数学等相关专业,多模态大模型、计算机视觉等相关方向; 2.具备一定的多模态算法或计算机视觉实践经验,对多模态大模型算法有深入理解; 3
更新于 2026-08-06北京