logo of bytedance

字节跳动视觉多模态应用算法(视频通话方向)实习生-Seed

实习兼职A159830地点:北京状态:招聘

任职要求


1、2027届硕士及以上学位在读,人工智能、计算机、自动化、数学等相关专业优先;
2、有视频大模型训练、智能硬件相关研究经验者优先,在学术会…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


ByteIntern:面向2027届毕业生(2026年9月-2027年8月期间毕业),为符合岗位要求的同学提供转正机会。
团队介绍:字节跳动Seed团队成立于2023年,致力于寻找通用智能的新方法,追求智能上限,为科技和社会发展作出贡献。
Seed团队在AI领域拥有长期愿景与决心,团队研究方向涵盖MLLM、GenMedia、AI for Science、机器人等,在中国、新加坡、美国等地设有实验室和岗位。目前,团队已推出业界领先的通用大模型以及前沿的多模态能力,支持豆包、即梦、TRAE等超过50个应用场景,并通过火山引擎开放给企业客户。第三方数据显示,豆包App用户量在中国市场排名第一,豆包大模型日均Token调用量行业领先。

1、参与视频通话模型Post-training的优化和研发,包括通话长多轮对话体验的优化、视觉感知能力、联网搜索能力、记忆、Agent调用能力等;
2、研发视频通话的新特性,包括主动响应、音视频双工等特性;
3、参与智能硬件相关能力的优化,提升端到端用户体验;
4、探索各种前沿创新性技术,并转化为应用侧效果。
包括英文材料
学历+
大模型+
相关职位

logo of tongyi
校招通义2026届秋

通义千问(Qwen)是由通义实验室自主研发的超大规模语言模型,具备多模态、多语言、跨任务的理解与生成能力。Qwen系列模型,涵盖参数量从亿级到万亿级的基座大语言模型,并相继推出Qwen-VL、Qwen-Audio、Qwen-Omni、Qwen-Coder、Qwen-Image等系列模型。从多轮对话到代码生成,从逻辑推理到内容创作,从单一多模态到全模态统一理解生成,Qwen 正在打造全球领先的全模态模型技术体系,推动AI在企业服务、开发者生态、个人用户等领域的深度应用,引领下一代人工智能的发展。 若你对以下一个或者多个方向感兴趣均欢迎投递: 1)多模态基础模型的研发,包括融合视觉语言的跨模态理解模型设计,提升视觉基础模型在图像/视频中的视觉知识、空间感知、Omni Parsing 等核心能力,并同时优化多模态大模型的AI infra。 2)通过强化学习(RL)持续提升多模态模型推理能力和执行任务能力,构建支持网络世界(PC/Mobile/Web/游戏)交互的通用智能体,将相关能力拓展到GUI agent,VLA,以及具身智能场景中。 3)研究理解与生成统一的模型架构,实现跨模态生成与推理的协同优化。 工作职责: 1. 多模态 pre-training:开展研究及进行实验,研究内容包括:数据清洗筛选、数据配比优化、课程学习、视觉语言模型结构设计与优化、训练策略优化、预训练数据合成、scaling law 预测、词表优化、模型蒸馏与压缩、长上下文能力优化等。 2. 多模态 post-training:迭代 post-training 训练策略(SFT/RLHF),专项能力数据迭代,参与模型能力评测及评测数据和评估标准的迭代。 3. 多模态推理和通用 agent:通过强化学习(RL)持续提升多模态模型推理能力和执行任务能力,打造多模态的 test scaling laws,并推动模型对网络和虚拟世界的交互和任务完成能力。 4. 统一理解生成:构建视觉统一理解生成大模型,推进多模态统一生成与理解的推理和交互新范式。

更新于 2025-08-22北京|杭州
logo of tencent
社招1年以上WXG公共技术

1.参与微信电商多模态大模型、音视频全模态大模型的建设; 2.持续跟进业界最新的多模态大模型算法,参与多模态大模型的设计、训练、调优及评测等; 3.推进多模态大模型在微信电商内容理解、短视频和音乐内容理解场景中的落地应用。

更新于 2026-07-27北京
logo of mi
实习

1.岗位的主要工作内容为跟踪领域前沿研究,将研究成果投稿到机器学习/计算机视觉顶会顶刊。 2.参与多模态大模型(VLM/VLA)的研发与优化,探索图像、文本、语音等跨模态信息的融合方法,以及在自动驾驶领域的应用。 3.研究并实现前沿的技术(如WorldModel,DiffusionModel等),推动项目落地。

更新于 2025-11-11北京
logo of mi
实习

参与小爱视觉多模态相关产品建设和迭代,包括用户需求洞察、用户反馈分析、产品调研、产品设计等工作

更新于 2025-11-21北京