高德地图高德-大模型应用算法工程师-多模态/Agent方向
任职要求
1、计算机、通信、自动化、电子、数学、统计等理工科专业,硕士及以上学历; 2、具备扎实的Python、C++或者Java等编程基础,熟练使用PyTorch/Tensorflow至少一种主流深度学习框架; 3、具备扎实的NLU/NLG相关NLP技术基础;熟悉ChatBot、文本摘要、机器翻译、问答系统等至少一种NLP任务;熟悉主流LLM架构,对于基于LLM的Pretrain、Fine-tuning、Alignment、RAG、Test-time Scaling等至少一个方向有比较深入的研究和实践; 4、具备扎实的AI MAS(Multi-Agent System)相关的感知、规划、记忆、工具调用、协同等技术基础,有实际应用和落地经验优…
工作职责
团队简介: 我们是高德行中智能团队,我们的使命是基于高德海量高质的数据,最前沿的AI算法,最可靠的通用工程架构,打造有温度、有惊喜、科技感十足的下一代出行体验; 在这里,我们一起建设应对超大业务规模和场景,超高业务复杂度的高效、可靠、鲁棒的技术架构;一起用最前沿的机器学习、深度学习、AI算法探索智慧出行最具挑战性的行业难题;一起用最尖端的AIGC、LLM/LVM、多模态理解与生成技术;基于语音、视觉、位置等多模态信息搭建高吞吐、低时延、强智能、真人感的Agent体系,打造全新人和环境交互形态; 职位描述 探索下一代多模态出行体验 基于全双工多模态agent,构建人和环境的全新交互形态
【课题说明】 聚焦多模态数字人核心技术,以直播为应用场景,旨在突破其在真实感、智能交互、情感表达及多模态信息处理上的瓶颈。研发能自主执行复杂运营任务、展现丰富情感与高表现力,并与用户进行深度多模态内容互动的下一代数字人,革新直播行业运营模式与用户体验。 【建议研究方向】 1.智能运营Agent:研究数字人作为智能Agent,在直播前(策划、脚本、货盘)、中(场控、问答、促单)、后(复盘、再创)全流程承担运营职能。重点攻克基于多模态数据的智能决策、任务自动化及人机协同,提升直播运营效能。 2.高表现力数字人生成驱动:探索高真实感、个性化数字人形象(外观、声音、风格)的快速生成与定制。重点研究大模型驱动的、与语音同步且富含细腻情感的表情、口型、动作的实时驱动,增强直播感染力。 3.多模态内容生成和交互:研究理解用户多模态输入(文、语、图、视频)并进行深度互动。探索数字人自主生成动态多模态内容,丰富直播呈现,提升用户参与感。
1. 跟进多模态大模型(vLLM)预训练、SFT、RLHF等技术,调研与跟进最新进展;负责多模态相关性大模型、多模态大模型稀疏检索和稠密模型,多模态大模型个性化预训练方向,以及多模态大语言模型的训练和推理加速; 2. 多模态大模型个性化预训练:研发个性化预训练模型,探索在训练样本、模型参数量等维度上scale-up能带来的收益,研究在电商搜索场景下, CTR和CVR 模型中用户动线特征的挖掘和应用,包括用户行为模型的获取、特征设计、结构优化等个性化建模; 3. 多模态大模型的训练和推理加速:协助研究和开发多模态大语言模型的加速技术,包括但不限于量化、剪枝和蒸馏,以及数据特征和调度优化;实现和优化多模态大模型推理框架,以提高推理速度和效率;与工程团队合作,解决机器学习模型在部署过程中的性能问题; 4. 多模态大模型相关性模型:研发基于多模态大模型的相关性标注和评测大模型,应用到体验实验评测、体验监控、离线数据标注、线上相关性判断等方向; 5.多模态大模型稀疏检索和稠密模型:研究方向包括不限于:电商词表生成、多模态稀疏词表和稠密表征技术、LLMs幻觉缓解等问题。
1. 模型能力建设与数据飞轮搭建 负责 ASR、TTS、Omni、视频生成等多模态模型的能力提升,构建覆盖数据生产、模型微调、对齐优化和评测分析的完整数据飞轮,通过持续迭代提升模型效果、稳定性和泛化能力。 2. 评测驱动的系统级迭代 建设科学、全面且贴近业务的评测体系,以评测结果为核心,打通数据生产、系统迭代、问题定位、效果验证和问题修复流程,形成高效、可持续的自迭代系统。 3. 业务场景落地与能力沉淀 深入真实业务和客户场景,理解客户需求及实际使用中的关键问题,识别模型与系统优化方向;综合运用模型训练、数据优化、推理策略和工程方案,完成高质量交付,并将场景经验沉淀为可复用、可规模化的系统能力。 4. 多模态融合与对齐 推进语音、文本、图像和视频等多模态信息的理解、生成、融合与对齐,解决跨模态表征、时序同步、语义一致性和可控生成等关键问题,提升多模态模型在复杂交互与内容生成场景中的综合表现。 5. 前沿技术探索与工程转化 持续跟进多模态大模型、生成式模型、强化学习及模型对齐等方向的前沿进展,结合实际业务需求开展技术验证,并推动研究成果转化为稳定、可用的产品能力。
【愿景】 随着美团业务向多个海外市场拓展,推荐与搜索系统面临多国家、多语言场景下的核心技术挑战:一方面,不同语言的语义理解差异、跨语言迁移能力不足、低资源语言数据稀缺等问题制约了搜索相关性体验;另一方面,各国市场用户行为模式、文化偏好、消费习惯差异显著,传统推荐系统难以在多国场景下实现统一建模与高效迁移。本岗位致力在打造面向多国多语言场景的推荐搜索一体化解决方案,融合多语言语义理解与大语言模型(LLM)能力,构建具备跨国泛化能力的推荐搜索系统,全面提升境外业务的用户体验与转化效率。 【你将参与】 方向一:多国多语言搜索相关性 1.多语言语义表征建模:基于多语言预训练模型(如mBERT、XLM-R等),结合本地化业务数据,构建适配多国语言的搜索相关性表征模型,提升跨语言语义对齐能力。 2.低资源语言相关性增强:针对数据稀缺的小语种市场,探索数据增强、跨语言迁移学习、零/少样本学习等技术,提升低资源语言下的相关性判断能力。 3.多国统一相关性评估体系:设计面向多国多语言场景的相关性评估框架,结合人工标注与模型自动评估,构建可扩展的多语言相关性基准。 方向二:LLM-based 多国家统一推荐 1.LLM驱动的跨国用户意图理解:基于多语言LLM,对不同国家用户的行为序列与搜索意图进行统一建模,提升跨国场景下的用户偏好理解能力。 2.多国统一推荐基座模型:探索以LLM为基座,通过多国数据联合训练与国家/文化特征注入,构建可快速适配各国市场的统一推荐模型,降低多国分治的维护成本。 3.跨国冷启动与迁移学习:针对新兴市场数据稀缺问题,研究基于LLM的跨国知识迁移与冷启动方案,提升新市场推荐效果的快速收敛能力。