通义研究型实习生- 多视角一致性3D高斯数字人生成技术
任职要求
1. 计算机相关专业博士/硕士研究生,有激情、责任心强,具备良好的团队合作、沟通能力。 2. 有扎实的多模态或3D算法基础, 对3DGS、4DGS, 3D数字人生成及驱动相关技术研究感兴…
工作职责
本项目将探索基于单张图像或稀疏视角图像构建高保真,可交互的3D高斯(3D Gaussian Splatting)数字人,支持大角度相机视角切换与大幅度身体姿态变化,保持几何一致性与渲染稳定性。所生成的3D高斯数字人支持多模态实时驱动,实现自然流畅的面部表情和肢体驱动,打造低延迟、高真实感的沉浸式交互体验,为虚拟主播、远程会议、教育陪练、情感陪伴等高价值应用场景提供技术支撑。
1. 协助团队开展多模态大模型算法研发工作,参与语音/音频生成、理解等核心技术的研发与测试; 2. 辅助研发多模态内容理解模型,协助搭建高精度、细粒度的内容描述体系,完成基础数据标注与整理工作; 3. 参与训练数据集的搭建、清洗、整理与标注,助力模型迭代优化,配合完成数据集相关基础调研; 4. 协助推进多模态大模型在核心业务中的落地测试,参与技术实用化过程中的效果验证与问题反馈; 5. 跟踪多模态大模型、音频AI领域行业前沿技术,协助整理前沿技术资料,参与团队技术研讨与学习。
阿里巴巴达摩院医疗AI团队,面向多模态医疗大模型的前沿研究与应用落地,旨在构建能够理解和推理不同医疗模态信息(影像、文本、临床结构化数据等)的通用智能系统。 研究方向包括但不限于: ● 多模态医疗大模型的架构设计、训练与优化 ● 医学影像(CT/MRI/超声、病理切片等)与医学文本(病历、检验报告等)的跨模态表示学习,多模态对齐,知识图谱增强 ● 医疗领域的视觉‑语言模型(VLM)、医学版GPT及多模态融合方法 ● 面向诊断与治疗决策的推理型模型和知识增强大模型 ● 少样本/零样本医疗任务泛化、可解释性与可信AI 我们拥有: ● 海量高质量、多模态临床数据(影像+文本+结构化信息) ● 充足算力资源(GPU不限,集群规模支持超大模型训练) ● 与国内外顶级医院、知名医学专家的长期科研合作 ● 在顶级会议与期刊(Nature子刊、TMI、MICCAI、CVPR、NeurIPS等)的高影响力成果 这是一个将AI大模型与医疗健康结合、面向未来的研究机会。
1.参与包括多模态基模型Pretrain、SFT等多个阶段的训练任务优化; 2.致力于提升不同阶段模型训练负载的极限吞吐,能够针对不同模型负载系统化的分析不同阶段耗时并提供相应的优化手段,优化手段包括但不局限于算子优化、通信优化、分布式策略优化等; 3.参与训练框架对于不同硬件的支持和优化。
阿里巴巴达摩院医疗AI团队,面向多模态医疗大模型的前沿研究与应用落地,旨在构建筛查-诊断-治疗全流程大模型和Agent系统。 研究方向包括但不限于: ● 多模态医疗大模型的架构设计、训练与优化 Agent系统设计、训练和优化 ● 医学影像(CT/MRI/超声)与医学文本(病历、检验报告等)的跨模态表示学习,多模态对齐,知识图谱增强 ● 医疗领域的视觉‑语言模型(VLM)、医学版GPT及多模态融合方法 ● 少样本/零样本医疗任务泛化、可解释性与可信AI 我们拥有: ● 海量高质量、多模态临床数据(多模态影像+文本+结构化信息) ● 与国内外顶级医院、知名医学专家的长期科研合作 ● 在顶级会议与期刊(Nature子刊、TMI、MICCAI、CVPR、NeurIPS等)的高影响力成果 这是一个将AI大模型与医疗健康结合、面向未来的研究机会。