
美图世界模型算法工程师
任职要求
● 有世界模型、自回归视频生成模型、实时视频生成模型等相关项目经验
● 对计算机视觉技术有浓厚兴趣,有能力进行算法研究和开发
● 能够独立处理…工作职责
美图影像研究院(MT Lab)专注于计算机视觉、深度学习与计算机图形学等前沿算法的研究与应用。我们为美图产品提供核心技术支持。团队汇聚顶尖人才,致力于推动影像技术的突破,让科技与艺术美好交汇。 MT Lab focuses on R&D of cutting-edge algorithms in CV, deepearning, and computer graphics. We provide core technicalsupport for Meitu products.Our team of top talent is dedicated to advancing imagingtechnology, beautifully merging science and art. 岗位名称:世界模型算法工程师 工作地点:北京 岗位职责: ● 研发具备时空一致性的实时世界模型,包括数据管线设计、模型架构设计、训练优化等各个环节 ● 与团队合作,进行算法的实验设计、实施及优化 ● 跟踪国际前沿的技术,结合业务制定迭代路线,将前沿算法转化为可落地的产品能力
1、负责实时生成式世界模型构建,包括数据建设、模型架构优化、模型预训练及后训练、模型Scale Up、模型评估等工作; 2、探索实时生成式世界模型记忆机制,解决世界模型长时序稳定性、时空一致性、可实时交互生成等痛点问题; 3、推动实时生成式世界模型在抖音场景落地,为抖音用户提供全新交互体验; 4、跟踪AI前沿技术进展,持续拓展世界模型能力边界。
1. 负责无人机、手持等产品多模态传感器时空对齐算法开发(包括但不限于鱼眼相机、IMU、ToF、Lidar、Radar等) 2. 负责研发统一模型,实现多传感器的4D时空场景重建算法,优化重建效率,解决动态目标轨迹平滑、时序一致性、多趟数据融合等问题,提升场景复用率 3. 负责3DGS、Mesh处理算法研发,并推动算法在云端的工程化落地,支撑真实场景复刻与评测。
1. 负责无人机、手持等产品多模态传感器时空对齐算法开发(包括但不限于鱼眼相机、IMU、ToF、Lidar、Radar等) 2. 负责研发统一模型,实现多传感器的4D时空场景重建算法,优化重建效率,解决动态目标轨迹平滑、时序一致性、多趟数据融合等问题,提升场景复用率 3. 负责3DGS、Mesh处理算法研发,并推动算法在云端的工程化落地,支撑真实场景复刻与评测。
随着大模型技术的飞速发展,理解和生成多模态数据(图像、视频、音频、3D素材等)的能力日益增强。目前,构建能够同时进行输入和输出的多模态世界模型已成为业界的研究热点,也是实现通用人工智能(AGI)的重要技术路径之一。 通义万相(Wan)将持续在世界模型、原生多模态预训练、理解-生成融合范式、统一Tokenizer研究、人类反馈与强化学习等前沿技术方向上进行探索,始终追求在多模态世界模型领域的领先研究地位,致力于建立世界级的技术影响力。 多模态世界模型前沿技术研究项目,团队在多个方向上进行探索(具体如下罗列),若你对以下一个或者多个课题感兴趣均欢迎投递: 1. 世界模型,包括但不限于:长视频生成、多模态交互式世界模型、实时音视频生成、生成驱动的世界渲染引擎、3D/4D生成。 2. 原生多模态预训练,包括但不限于:融合语言与图像理解生成统一的多模态模型、音视频融合的生成模型、高效多模态预训练算法。 3. 人类反馈与强化学习,包括但不限于:基于规则的强化学习策略、高效 DPO 与 PPO 算法设计、基于用户反馈的RLHF视频生成质量提升。 4. 统一Tokenizer研究,包括但不限于:适用于图像、视频、音频等多种模态生成和理解的统一Tokenizer、提高多模态模型的泛化能力和效率。 5. 大模型训练/推理优化,包括但不限于:模型蒸馏、模型剪枝、attention计算近似等高效训练加速策略。