
同花顺多模态算法实习生
校招全职AI 算法类地点:杭州状态:招聘
任职要求
硕士及以上学历,计算机视觉、图形学、机器人或人工智能相关专业; 精通 Python、C++ 等编程语言,熟悉主流深度学习框架(如 PyTorch、TensorFlow 等); 对大模型的底层原理和应用有较为深入的理解;有实际应用经…
登录查看完整任职要求
微信扫码,1秒登录
工作职责
负责研发虚拟数字人多模态交互算法,整合语音、文本、表情、肢体动作等多模态信息,实现自然流畅的人机交互; 持续优化多模态交互算法,提升数字人对复杂多模态输入的理解与处理能力,增强交互的精准性和实时性; 探索端到端的数字人多模态交互技术; 跟踪人工智能领域的前沿技术在虚拟数字人项目的应用和落地。
包括英文材料
学历+
OpenCV+
https://learnopencv.com/getting-started-with-opencv/
At LearnOpenCV we are on a mission to educate the global workforce in computer vision and AI.
https://opencv.org/university/free-opencv-course/
This free OpenCV course will teach you how to manipulate images and videos, and detect objects and faces, among other exciting topics in just about 3 hours.
Python+
https://liaoxuefeng.com/books/python/introduction/index.html
中文,免费,零起点,完整示例,基于最新的Python 3版本。
https://www.learnpython.org/
a free interactive Python tutorial for people who want to learn Python, fast.
https://www.youtube.com/watch?v=K5KVEU3aaeQ
Master Python from scratch 🚀 No fluff—just clear, practical coding skills to kickstart your journey!
https://www.youtube.com/watch?v=rfscVS0vtbw
This course will give you a full introduction into all of the core concepts in python.
C+++
https://www.learncpp.com/
LearnCpp.com is a free website devoted to teaching you how to program in modern C++.
https://www.youtube.com/watch?v=ZzaPdXTrSb8
深度学习+
https://d2l.ai/
Interactive deep learning book with code, math, and discussions.
PyTorch+
https://datawhalechina.github.io/thorough-pytorch/
PyTorch是利用深度学习进行数据科学研究的重要工具,在灵活性、可读性和性能上都具备相当的优势,近年来已成为学术界实现深度学习算法最常用的框架。
https://www.youtube.com/watch?v=V_xro1bcAuA
Learn PyTorch for deep learning in this comprehensive course for beginners. PyTorch is a machine learning framework written in Python.
还有更多 •••
相关职位
实习无人机业务部
1、研发用于Ego/Exo的视频理解/动作识别模型,推动具身智能场景下多模态感知与环境交互理解能力的提升。 2、参与端到端规划算法的模型设计、训练调优、泛化能力与鲁棒性提升,包括但不限于模型预训练、后训练和真机部署工作,将训练好的模型部署到实际机器人系统中进行验证和测试 3、参与遥操数据的收集与处理,包括但不限于处理机器人开源数据及规范化工作,同时设计并执行数据自采方案,对收集到的数据进行处理以满足后续模型训练需求
更新于 2026-07-16北京
实习算法与软件
1.负责多模态内容感知、理解及多模态文档处理相关的大模型研发工作,包括但不限于多模态或视觉预训练模型的下游任务微调与优化 2.负责视觉语言大模型(VLM)在内容理解与文档处理等场景的应用探索,深入开展大模型SFT(指令微调)、强化学习微调(如DPO/GRPO等)算法研究 3.负责基于大模型的 Agent 能力建设与应用落地,围绕复杂任务拆解、流程编排、工具调用、记忆管理、规划与执行等方向开展研发,推动 Agent 在多模态理解、文档处理、内容生产与业务自动化等场景中的实践 4.跟进计算机视觉及多模态领域前沿工作,探索前沿技术落地,并协助整理形成高质量学术论文
北京