logo of tencent

腾讯技术研究-多模态方向

校招全职日常实习地点:深圳 | 北京 | 上海状态:招聘

任职要求


1、包含但不限于计算机、信息工程、模式识别、人工智能、自动化、软件工程、电子工程、统计学、应用数学、物理学/量子计算、信息安全、信号与信息处理等专业的博士和优秀硕士;
2、熟练掌握计算机视觉图像处理相关的基本算法及应用,熟悉caffetensorflowpytorch
登录查看完整任职要求
微信扫码,1秒登录

工作职责


作为计算机多模态方向的研究工程师,你可以:
1、研究和开发多模态处理算法和模型的研究与开发,包括但不限于:图像、视频、3D生成、声学信号的理解与生成、多模态信息和文本信息的对齐和整合;
2、设计和优化现有算法,提高性能和准确性,确保高质量的用户体验;
3、深入调研和关注多模态/NLP/CV等方向的前沿技术,及时将新技术应用到产品中。
包括英文材料
模式识别+
OpenCV+
图像处理+
算法+
Caffe+
TensorFlow+
PyTorch+
深度学习+
C+
还有更多 •••
相关职位

logo of tencent
校招青云计划-实习生

深圳
logo of tencent
校招青云计划-实习生

深圳
logo of tongyi
社招2年以上

【部门介绍】 随着大模型技术的飞速发展,理解和生成多模态数据(图像、视频、音频、3D素材等)的能力日益增强。目前,构建能够同时进行输入和输出的多模态世界模型已成为业界的研究热点,也是实现通用人工智能(AGI)的重要技术路径之一。 万相Wan将持续在世界模型、原生多模态预训练、理解-生成融合范式、统一Tokenizer研究、人类反馈与强化学习等前沿技术方向上进行探索,始终追求在多模态世界模型领域的领先研究地位,致力于建立世界级的技术影响力。 【工作内容】 1. 探索大规模多模态理解生成统一基础模型,包括但不限于:统一建模设计、高效模型结构设计、高效Scaling、视觉Tokenizer、多模态联合训练等。 2. 探索和突破多模态强化学习,包括但不限于:视觉CoT、面向复杂视觉设计任务的强化学习设计、基于用户反馈的在线自学习等。 3. 构建基于生成模型的真实世界渲染引擎,探索新的多模态交互范式,探索虚拟和真实世界的强化反馈链路设计。

更新于 2026-07-10北京|杭州
logo of tencent
校招青云计划-实习生

北京