安克创新视频/世界模型(具身方向)实习生
校招全职地点:深圳状态:招聘
任职要求
1.硕士及以上学历在读,计算机、人工智能、机器人、自动化等相关专业优先,2026年及以后毕业优先 2.深刻理解视频模型、世界模型核心架构,同时熟悉具身操作模型(VA/VLA/WAM)相关技术 3.熟悉计算机视觉基础知识,如图像分割、深度估计、光流、相机模型、坐标变换或多视角几何 4.熟悉 Python 编程,具备良好的工程能力与代码规范意识 5.熟悉 PyTorch 等深度学习框架,理解 Transformer、Diffusion Model、VAE 等常见模型 具备较强的论文阅读和复现能…
登录查看完整任职要求
微信扫码,1秒登录
工作职责
安克实习生项目是面向正式校招岗位的人才培养与选拔通道。实习期间将按照校招标准进行系统的培养与综合评估,表现优秀者可直接获得校招转正机会,提前锁定正式校招席位。我们以严肃、长期的视角对待每一位实习生,也期待与你共同成长。 【你将参与】 1.参与视频生成模型、视频编辑模型以及世界模型的训练、微调和评估,如 Wan、Cosmos transfer 等 2.参与机器人数据增强算法研发,包括目标分割、深度估计、背景/材质替换、视角一致性与时序一致性优化等 研究以机器人动作、文本指令、深度和分割为条件的视频模型,探索面向机器人控制的世界模型 3.负责机器人视频数据的清洗、标注、采样、增强及质量评估,建设高效可靠的数据处理流水线 4.参与面向视频生成模型的奖励模型研发,为强化学习后训练提供可靠的奖励信号与算法支持 跟进视频生成、世界模型和机器人操作方向的最新论文,探索最新技术
包括英文材料
学历+
OpenCV+
https://learnopencv.com/getting-started-with-opencv/
At LearnOpenCV we are on a mission to educate the global workforce in computer vision and AI.
https://opencv.org/university/free-opencv-course/
This free OpenCV course will teach you how to manipulate images and videos, and detect objects and faces, among other exciting topics in just about 3 hours.
Python+
https://liaoxuefeng.com/books/python/introduction/index.html
中文,免费,零起点,完整示例,基于最新的Python 3版本。
https://www.learnpython.org/
a free interactive Python tutorial for people who want to learn Python, fast.
https://www.youtube.com/watch?v=K5KVEU3aaeQ
Master Python from scratch 🚀 No fluff—just clear, practical coding skills to kickstart your journey!
https://www.youtube.com/watch?v=rfscVS0vtbw
This course will give you a full introduction into all of the core concepts in python.
PyTorch+
https://datawhalechina.github.io/thorough-pytorch/
PyTorch是利用深度学习进行数据科学研究的重要工具,在灵活性、可读性和性能上都具备相当的优势,近年来已成为学术界实现深度学习算法最常用的框架。
https://www.youtube.com/watch?v=V_xro1bcAuA
Learn PyTorch for deep learning in this comprehensive course for beginners. PyTorch is a machine learning framework written in Python.
还有更多 •••
相关职位
实习阿里巴巴日常实习
1. 负责研发大规模世界模型,提升模型对真实世界动态变化的建模能力。 2. 研究可规模化的世界模型架构,解决世界模型在长程预测中的物理一致性问题和长期记忆等问题。 3. 构建世界模型数据体系,探索世界模型在参数与数据规模上的 Scaling Laws。 4. 构建可交互的世界模型系统,并推动技术在实际产品中的落地。
更新于 2026-06-29北京|杭州
实习核心本地商业-基
1. 参与实时交互视频世界模型的算法研发,支持大规模视频模型的预训练与推理。 2. 搭建并优化端到端数据管线与部署架构,突破延迟瓶颈,提升系统实时性。 3. 跟进实时视觉生成前沿技术,推动创新技术产品化。
更新于 2026-06-29北京|深圳

校招技术
岗位职责 1. VLA / 行为模型研发 - 参与或主导面向自动驾驶场景的 VLA / 行为大模型设计与训练; - 融合感知、语言指令、地图/结构信息与历史时序状态,输出安全、稳定且具备“驾驶风格”的行为决策; - 探索模仿学习、强化学习与大模型训练范式的结合,推动一段式 / 端到端能力落地。 2. 世界模型与时序建模 - 研发具备时空一致性的世界模型(World Model),用于环境建模、未来预测与策略评估; - 结合 Diffusion / 自回归等生成式模型,提升复杂交通场景下的多模态预测与不确定性建模能力; - 支撑端到端模型在长时序、复杂交互场景中的稳定性与泛化能力。
更新于 2026-03-24北京