腾讯混元多模态算法研究员(Omni模态)(北京/上海/北美)
任职要求
1.计算机、人工智能、数学等相关专业的全日制本科(优先)以上;
2.熟悉大规模多模态数据处理,高质量数据生成等实践经验者特别优先;
3.具有扎实的深度学习算法基础,具备扎实的大模型研发经验,有Diffusion Models和Autoregressive Models相关经验优先,有相关方向…工作职责
1.从事Omni多模态大模型的研发,包括训练数据的设计和构造,基础模型算法的设计,针对预训练/SFT/RL相关的优化,模型能力的评测,各种下游应用场景的探索; 2.科学分析研发中的各种问题,找到模型性能的瓶颈,从第一性原理出发找到解决方案,加速模型的开发和迭代,确保模型的竞争力和领先性; 3.探索实现Omni模态理解、生成能力的不同范式,研究下一代的模型架构,探索多模态模型的边界。
1.主动跟踪学术界与工业界在图像视频生成式模型、多模态理解模型、语音模型、多模态理解生成统一建模等方向的创新算法研究,攻克Diffusion模型加速、多模态理解模型、语音模型(ASR、TTS、Omini等)、多模态理解生成统一建模加速等技术方向,包括但不限于:(Attention量化/稀疏加速、蒸馏加速、量化、投机解码、剪枝、KV Cache 压缩等等); 2.通过分析模型和任务性能瓶颈,设计创新的算法优化方案,提升多模态大模型的推理效率,显著降低端到端延迟; 3.作为算法与框架团队之间的技术桥梁,聚焦于图像理解、视频生成、音频理解生成、视觉多轮交互、实时对话等任务,提升模型在推理端的性能; 4.高效协同框架开发及业务算法团队,确保技术方案落地。撰写高质量的技术文档与实验报告,并组织内部分享,推动团队整体技术认知提升。
1.负责产品的用户研究、交互设计、视觉设计等全流程工作,产出用户旅程图、线框图、高保真原型及交互说明; 2.参与或主导建立和维护产品设计系统,确保设计语言的一致性,并提升团队的设计与开发效率; 3.与产品经理、工程师紧密合作,确保设计方案的高质量实现与落地,并积极参与产品讨论,为产品策略提供设计角度的专业输入; 4.基于用户反馈和产品数据,主动发起并推进用户体验的持续优化。
1.评测体系构建:通过紧跟先进模型及应用的前沿发展,设计全面、准确的多维度指标,建立覆盖多模态(语音/图/视频生成/编辑等)生成、多模态理解等全面、多维度的评测体系; 2.评测流程:熟悉大模型评测流程的实际执行与落地,协同多方相关团队高效完成评测工作,定期监控模型效果,分析问题并提供优化方案; 3.行业动态洞察:持续完善快速评测体系构建、快速反馈行业动态及模型能力,发现行业模型以及应用的前进方向、亮点; 4.结果归因:通过各种数据分析方法,深度分析模型评测结果,为大模型的更新调优提供精准的问题分析结论。