logo of 10jqka

同花顺多模态大模型算法工程师(博士专项)

校招全职ai 算法类地点:杭州状态:招聘

任职要求


1.计算机视觉、多模态学习、自然语言处理机器学习等相关专业,硕士及以上优先。
2.熟悉 VLM、多模态大模型OCR、Layout Analysis、Document AI、Video Understanding、CLIP、BLIP、LLaVA、Qwen-VL、InternVL 等方向。
3.熟悉 PyTorch,有模型训练、微调、评测和部署经验。
4.具备图像/文本/…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


面向金融图表、研报图片、公告表格、K 线图、路演视频、财经直播、音视频内容、投研材料等场景,建设文本、图像、表格、音频、视频统一理解与生成能力,支撑多模态金融 AI 产品。
岗位职责
1.负责多模态模型研发,包括图文理解、OCR、表格理解、图表解析、视频理解、音频理解、多模态检索和多模态生成。
2.建设面向金融场景的图表/表格/截图/研报/公告/行情图像理解能力,支持信息抽取、问答、摘要、数据解释和风险识别。
3.探索多模态大模型在金融投研中的应用,包括图表问答、财报表格理解、K 线形态理解、研报图表解析、音视频摘要等。
4.参与多模态 RAG、多模态 Agent、多模态评测和模型优化工作。
5.优化模型在复杂版面、密集表格、金融图形、长视频、低质量截图等场景下的准确率和鲁棒性。
6.与产品、工程、数据团队合作,推动多模态能力在问财、iFinD、资讯、投研助手等产品中落地。
包括英文材料
OpenCV+
NLP+
机器学习+
大模型+
OCR+
PyTorch+
CVPR+
ICCV+
还有更多 •••
相关职位

logo of sf
实习研发类

1、业务介绍: 聚焦物流供应链,基于文本/图像/视频多模态数据,构建垂域多模态大模型,创新PT-SFT-RLHF方法论,赋能安全检测、违规巡检,降本增效。 2、岗位内容: 负责垂域多模态模型继续预训练,视频理解等能力的攻坚。 3、研究内容: (1)基于物流供应链领域文本/图像/视频数据,探索构建垂域多模态大模型,创新提炼垂域适配的PT-SFT-RLHF各阶段数据构建、模型训练与评测方法论; (2)探索垂域多模态大模型前沿应用方向,提升垂域多模态基础能力,包括目标检测,视频分类,视频问答,视频描述等任务,赋能安全检测、违规巡检等业务,实现降本增效。

更新于 2026-07-08深圳
logo of horizon
社招算法序列

【工作职责】 1.负责面向自动驾驶极端场景下多模态大模型系统的算法研发与优化 2.负责面向自动驾驶图像质量评估相关算法的研发与优化 3.深度参与数据闭环、模型训练和部署、场景泛化性提升

更新于 2026-06-29北京|上海
logo of pingantech
社招3年以上计算机网络技术类

1、负责视觉-语言大模型(VLM)研发与优化,推动中医智能诊疗、医学图像分析等场景的端到端算法落地。 2、针对舌象、面色、关节等多类医学图像,开发分类、检测、分割及异常检测算法,支撑辅助诊断与健康评估。 3、设计跨模态融合架构,实现图像、文本等多源数据的协同建模与联合推理。 4、基于LLM/VLM进行SFT、RLHF、LoRA等微调,优化辨证论治、报告生成、医学问答等任务,提升临床实用性。 5、开发具备自主推理与工具调用能力的Agentic智能体,覆盖辅助诊断、用药监测、随访管理等自动化场景。 6、构建医学知识图谱,结合RAG技术增强模型可解释性与专业可信度。 7、跟踪前沿技术,探索创新应用,确保算法符合医疗伦理与监管要求。

更新于 2026-07-13深圳
logo of tencent
社招5年以上CAI中台技术

1.负责多模态大模型(如图文理解、图文结合生成)的核心算法研究、设计与实现,包括但不限于模型结构创新、对齐技术、指令微调等,提升模型在线上业务的表现; 2.研究文生图、文生视频的强化学习后训练方法,提升图文一致性和生成稳定性; 3.紧密跟踪国内外多模态AI、大模型领域的最新研究进展,探索原生多模态生图和编辑模型设计和训练; 4.设计、实现并优化大规模多模态数据的预处理、清洗、标注、特征提取及高效融合方法; 5.参与团队内部的技术分享、专利申请、论文发表等工作,提升团队整体技术水平。

更新于 2025-09-24深圳