
同花顺多模态大模型算法工程师(博士专项)
校招全职ai 算法类地点:杭州状态:招聘
任职要求
1.计算机视觉、多模态学习、自然语言处理、机器学习等相关专业,硕士及以上优先。 2.熟悉 VLM、多模态大模型、OCR、Layout Analysis、Document AI、Video Understanding、CLIP、BLIP、LLaVA、Qwen-VL、InternVL 等方向。 3.熟悉 PyTorch,有模型训练、微调、评测和部署经验。 4.具备图像/文本/…
登录查看完整任职要求
微信扫码,1秒登录
工作职责
面向金融图表、研报图片、公告表格、K 线图、路演视频、财经直播、音视频内容、投研材料等场景,建设文本、图像、表格、音频、视频统一理解与生成能力,支撑多模态金融 AI 产品。 岗位职责 1.负责多模态模型研发,包括图文理解、OCR、表格理解、图表解析、视频理解、音频理解、多模态检索和多模态生成。 2.建设面向金融场景的图表/表格/截图/研报/公告/行情图像理解能力,支持信息抽取、问答、摘要、数据解释和风险识别。 3.探索多模态大模型在金融投研中的应用,包括图表问答、财报表格理解、K 线形态理解、研报图表解析、音视频摘要等。 4.参与多模态 RAG、多模态 Agent、多模态评测和模型优化工作。 5.优化模型在复杂版面、密集表格、金融图形、长视频、低质量截图等场景下的准确率和鲁棒性。 6.与产品、工程、数据团队合作,推动多模态能力在问财、iFinD、资讯、投研助手等产品中落地。
包括英文材料
OpenCV+
https://learnopencv.com/getting-started-with-opencv/
At LearnOpenCV we are on a mission to educate the global workforce in computer vision and AI.
https://opencv.org/university/free-opencv-course/
This free OpenCV course will teach you how to manipulate images and videos, and detect objects and faces, among other exciting topics in just about 3 hours.
NLP+
https://www.youtube.com/watch?v=fNxaJsNG3-s&list=PLQY2H8rRoyvzDbLUZkbudP-MFQZwNmU4S
Welcome to Zero to Hero for Natural Language Processing using TensorFlow!
https://www.youtube.com/watch?v=R-AG4-qZs1A&list=PLeo1K3hjS3uuvuAXhYjV2lMEShq2UYSwX
Natural Language Processing tutorial for beginners series in Python.
https://www.youtube.com/watch?v=rmVRLeJRkl4&list=PLoROMvodv4rMFqRtEuo6SGjY4XbRIVRd4
The foundations of the effective modern methods for deep learning applied to NLP.
机器学习+
https://www.youtube.com/watch?v=0oyDqO8PjIg
Learn about machine learning and AI with this comprehensive 11-hour course from @LunarTech_ai.
https://www.youtube.com/watch?v=i_LwzRVP7bg
Learn Machine Learning in a way that is accessible to absolute beginners.
https://www.youtube.com/watch?v=NWONeJKn6kc
Learn the theory and practical application of machine learning concepts in this comprehensive course for beginners.
https://www.youtube.com/watch?v=PcbuKRNtCUc
Learn about all the most important concepts and terms related to machine learning and AI.
大模型+
https://www.youtube.com/watch?v=xZDB1naRUlk
You will build projects with LLMs that will enable you to create dynamic interfaces, interact with vast amounts of text data, and even empower LLMs with the capability to browse the internet for research papers.
https://www.youtube.com/watch?v=zjkBMFhNj_g
OCR+
https://www.ibm.com/think/topics/optical-character-recognition
Optical character recognition (OCR) is a technology that uses automated data extraction to quickly convert images of text into a machine-readable format.
https://www.youtube.com/watch?v=or8AcS6y1xg
Optical character recognition (OCR) is sometimes referred to as text recognition.
PyTorch+
https://datawhalechina.github.io/thorough-pytorch/
PyTorch是利用深度学习进行数据科学研究的重要工具,在灵活性、可读性和性能上都具备相当的优势,近年来已成为学术界实现深度学习算法最常用的框架。
https://www.youtube.com/watch?v=V_xro1bcAuA
Learn PyTorch for deep learning in this comprehensive course for beginners. PyTorch is a machine learning framework written in Python.
CVPR+
https://cvpr.thecvf.com/
ICCV+
https://iccv.thecvf.com/
ICCV is the premier international computer vision event comprising the main conference and several co-located workshops and tutorials.
还有更多 •••
相关职位
实习研发类
1、业务介绍: 聚焦物流供应链,基于文本/图像/视频多模态数据,构建垂域多模态大模型,创新PT-SFT-RLHF方法论,赋能安全检测、违规巡检,降本增效。 2、岗位内容: 负责垂域多模态模型继续预训练,视频理解等能力的攻坚。 3、研究内容: (1)基于物流供应链领域文本/图像/视频数据,探索构建垂域多模态大模型,创新提炼垂域适配的PT-SFT-RLHF各阶段数据构建、模型训练与评测方法论; (2)探索垂域多模态大模型前沿应用方向,提升垂域多模态基础能力,包括目标检测,视频分类,视频问答,视频描述等任务,赋能安全检测、违规巡检等业务,实现降本增效。
更新于 2026-07-08深圳

社招算法序列
【工作职责】 1.负责面向自动驾驶极端场景下多模态大模型系统的算法研发与优化 2.负责面向自动驾驶图像质量评估相关算法的研发与优化 3.深度参与数据闭环、模型训练和部署、场景泛化性提升
更新于 2026-06-29北京|上海

社招3年以上计算机网络技术类
1、负责视觉-语言大模型(VLM)研发与优化,推动中医智能诊疗、医学图像分析等场景的端到端算法落地。 2、针对舌象、面色、关节等多类医学图像,开发分类、检测、分割及异常检测算法,支撑辅助诊断与健康评估。 3、设计跨模态融合架构,实现图像、文本等多源数据的协同建模与联合推理。 4、基于LLM/VLM进行SFT、RLHF、LoRA等微调,优化辨证论治、报告生成、医学问答等任务,提升临床实用性。 5、开发具备自主推理与工具调用能力的Agentic智能体,覆盖辅助诊断、用药监测、随访管理等自动化场景。 6、构建医学知识图谱,结合RAG技术增强模型可解释性与专业可信度。 7、跟踪前沿技术,探索创新应用,确保算法符合医疗伦理与监管要求。
更新于 2026-07-13深圳