
智能互联高德-3D/视频生成与世界模型算法专家/工程师-视觉团队
任职要求
"【任职要求】 1. 计算机科学、人工智能、电子信息等相关专业研究生学历,博士优先; 2. 扎实的深度学习 / 机器学习 / 数学功底,熟悉 Transformer、Diffusion/Flow Matching Models、Reinforcement Learning 原理 3. 重点技能: a. 至少深入掌握一项: i. SfM, MVS, NeRF, 3DGS 等三维重建及渲染算法; ii. Diffusion Models, Vi…
工作职责
我们是高德视觉技术中心,专注于以计算机视觉技术为核心的前沿研究与创新应用,致力于打造时空互联网领域的核心技术能力。 我们致力于构建 “真实世界 × 虚拟世界” 的生成式世界模型,引领多模态 AI 赋能智慧出行和日常生活。团队成员参与端到端 3D+视频+语言 大模型的研发,与阿里云算力、十亿级全域图像 / 点云 / 出行数据深度结合,让算法在真实应用中产生即时经济价值与社会影响力。 团队主页:https://github.com/amap-cvlab 岗位职责: 1. 核心算法研发:主导 1B-100B 参数级世界模型 / VLA / VLM 网络的整体方案与关键模块创新; 2. 高效预训练与微调:构建跨模态自监督目标(时序一致性、物理一致性、语言对齐等),并推动 SFT → DPO → RL-HF 全链路落地上线; 3. 跨模态推理与生成:针对 3D 场景、连续视频、语言描述开展对齐、生成与评估实验,推动端到端模型落地。创新3D场景/连续视频/交互策略/语言描述等跨多种模态的端到端理解与生成; 4. 产线落地与性能优化:与地图引擎、自动驾驶、智能导航等业务协同,迭代模型压缩、Edge-Cloud 混合部署、隐私数据训练; 5. 技术沉淀与传播:完成技术调研、实验复现、消融与报告撰写,将成果转化为论文、专利等技术沉淀。
我们是高德视觉技术中心,专注于以计算机视觉技术为核心的前沿研究与创新应用,致力于打造时空互联网领域的核心技术能力。 我们致力于构建 “真实世界 × 虚拟世界” 的生成式世界模型,引领多模态 AI 赋能智慧出行和日常生活。团队成员参与端到端 3D+视频+语言 大模型的研发,与阿里云算力、十亿级全域图像 / 点云 / 出行数据深度结合,让算法在真实应用中产生即时经济价值与社会影响力。 团队主页:https://github.com/amap-cvlab 岗位职责: 1. 核心算法研发:主导 1B-100B 参数级世界模型 / VLA / VLM 网络的整体方案与关键模块创新; 2. 高效预训练与微调:构建跨模态自监督目标(时序一致性、物理一致性、语言对齐等),并推动 SFT → DPO → RL-HF 全链路落地上线; 3. 跨模态推理与生成:针对 3D 场景、连续视频、语言描述开展对齐、生成与评估实验,推动端到端模型落地。创新3D场景/连续视频/交互策略/语言描述等跨多种模态的端到端理解与生成; 4. 产线落地与性能优化:与地图引擎、自动驾驶、智能导航等业务协同,迭代模型压缩、Edge-Cloud 混合部署、隐私数据训练; 5. 技术沉淀与传播:完成技术调研、实验复现、消融与报告撰写,将成果转化为论文、专利等技术沉淀。
1、基于 3DGS、NeRF 等前沿算法,支持实景地图构建与实时渲染,满足多样化业务的应用需求; 2、负责 3DGS 技术的算法研发与性能优化,包括但不限于:场景重建、渲染加速、资源压缩、内存优化; 3、研发具备 可编辑能力 的 3DGS 技术方案,支持渲染风格的迁移能力; 4、跟踪国内外最新的 3D 重建与渲染技术(SIGGRAPH、CVPR 等),进行技术调研并转化为可落地的工程方案; 5、对大规模场景数据处理的全链路进行分析与优化(数据采集、预处理、训练、推理、渲染); 6、跨团队合作,完成算法到业务的无缝集成与部署。
1. 参与高德虚拟形象/数字人整体视觉定义,包括造型比例、面部特征、服装风格、色彩与材质语言等,能基于项目定位制定角色的视觉风格基准(风格参考板 / LookDev指南 / 角色设定手册/规范白皮书)。 2. 负责虚拟形象AIGC设定,跟踪AIGC最新AI趋势(如Sora、Veo、Runway、Rokoko Vision、Animator等),高效运用AI工具驱动情感肢体动作、表情动画、实时数字人生成、跨模态虚拟形象交互等。 3. 数字人3D建模、动画与绑定,与技术美术(TA)等团队紧密协作,持续优化角色动画管线与资产制作流程,并跟进动作在引擎中的最终表现效果。 4. 从技术层面优化3D美术/视觉物料表现或性能,及时做出有效的技术研究工作 5. 与产品、程序紧密配合,能够独立完成多种渲染风格的设计与制作,适应能力强