
平安科技多模态大模型工程师
任职要求
1、硕士及以上学历,计算机、人工智能、模式识别、计算机视觉、NLP相关专业,博士优先; 2、3年及以上多模态大模型研发实战经验,完整深度参与过至少一款多模态理解模型从预训练、微调至业务落地全流程项目;有顶会论文、模型开源产出优先; 3、精通多模态大模型底层原理,熟练掌握LLM预训练、增量训练、模态编码器设计、跨模态对齐、SFT微调、RLHF/DPO对齐全套技术;熟悉ViT、CLIP、Qwen-VL、LLaVA等主流多模…
工作职责
1、负责多模态大模型(MLLM)全流程算法研发,完成模型持续预训练、增量后训练、指令微调SFT、偏好对齐Alignment全链路工作;开展模型结构设计、模态融合方案设计、损失函数设计优化、训练策略迭代制定,提升模型综合能力。 2、攻坚跨模态语义对齐、多模态特征融合、异构图文/图表/文档数据解析理解等核心技术难点,优化模型在跨模态检索、视觉问答VQA、Chart/DocVQA、图文理解、长文档逻辑推理、图文生成等任务效果。 3、跟踪全球多模态大模型前沿技术演进,结合业务场景输出技术路线规划,主导模型迭代优化、技术难点攻关,沉淀可复用技术方案。 4、深耕业务场景,探索多模态模型与智能体Agent融合落地,围绕文档智能解析、grounding,图表推理、专业内容问答、复杂逻辑推理搭建垂域应用方案,实现算法技术和业务深度融合。 5、牵头多模态模型项目完整研发、迭代与落地交付,针对业务痛点定制模型优化方案,持续验证、复盘提升模型线上表现。
参与阿里云MaaS平台多模态AI搜索系统的核心算法研发,致力于打造行业领先的下一代智能搜索体验,构建新一代跨模态检索引擎与智能问答体系,赋能云上企业客户与生态开发者。 你需要参与以下一个或多个方向的工作: 1、多模态表征与排序模型优化:参与研究和开发业界领先的多模态表征模型与重排序模型,提升海量图文、视频等多模态数据检索在复杂业务场景下的准确性与相关性; 2、多模态检索增强生成(mRAG)链路优化:参与实际场景的多模态RAG链路的核心算法攻坚,包括多模态Query理解、跨模态意图识别、复杂文档解析(如PDF/图表混合检索)及最终的多模态内容生成; 3、长视频理解模型优化:参与研发高效的长视频搜索范式,攻克超长序列下的长程依赖难题,提升模型对视频深层语义的捕捉能力及复杂场景下的视频问答质量。落地的核心目标与指标。
围绕多模态文档智能方向,开展文档理解、文档推理和文档智能体相关研究,推动多模态大模型在真实文档场景中的能力提升,并服务实际业务落地。 你将参与以下一个或多个方向的工作: 1. 文档理解:面向复杂长文档场景,研究文档解析与结构化重建技术,提升模型对文本、公式、表格、图像等元素的识别、定位和还原能力,探索从图像到结构化文档的端到端方案。结合真实场景进行数据构建、实验设计与效果分析,持续优化模型在复杂文档解析任务中的表现; 2. 文档推理:面向统计图表、学术论文、行业报告等高信息密度文档,研究多模态大模型的图文理解、逻辑推理和数值分析能力,提升模型在复杂文档问答、证据整合和长上下文推理任务中的表现。围绕关键任务开展数据整理、评测设计和实验迭代,持续分析并改进模型在复杂文档推理中的效果; 3. 文档智能体:探索基于多模态大模型的文档智能体能力,包括跨文档检索、信息搜集、任务规划、工具调用和结果验证等,推动模型完成如研报生成、信息抽取、跨文档对比分析等复杂任务。结合具体业务场景,参与任务设计、效果评估和系统迭代,提升智能体在真实任务中的完成质量。

1、负责自动驾驶方向VLA/VLM/端到端算法的研究和落地 2、强化学习算法研发:设计、研究和优化针对自动驾驶场景的大规模强化学习算法,提升系统的鲁棒性与泛化能力。 3、模型落地与优化:探索强化学习模型在自动驾驶中的应用场景,负责从理论到工程实践的全流程落地,实现模型高效训练与在线部署。