logo of sensetime

商汤元萝卜-机器人算法实习生(VLA方向)

实习兼职技术族-实习地点:北京状态:招聘

任职要求


1、本科及以上学历,计算机科学、人工智能、自动化、电子工程、机器人技术等相关专业优先。
2、熟练掌握 PythonC++ 編程语言。
3、熟悉主流深度学习框架( PyTorchTensorFlow)。
4、具备机器人操作系统(ROS/ROS2)的开发经验。
5、对计算机视觉(CV)、自然语言处理(NLP)、深度学习和机器人控制有基本理解或项目经验。
6、具备良好的学习能力、…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


1、模型复现与实现:复现当前主流的开源VLA模型(如GR00T/ π0.5/SmoIVLA/WALL-OSS等),确保算法正确性和性能。
2、系统集成与测试:将VLA模型集成到公司机器人平台,设计并执行测试方案,评估模型在真实环境中的感知、推理与执行能力。
3、算法优化与创新:针对机器人具体应用场景,对VLA模型进行微调、优化及创新,提升其在复杂环境下的适应性和鲁棒性。
4、多模态数据处理:处理视觉、语言和动作数据,构建和优化训练数据集,支持模型的训练和评估。
5、技术跟踪与报告:跟踪VLA领域的最新研究进展,撰写技术报告,并参与团队技术讨论与分享。
包括英文材料
学历+
Python+
C+++
深度学习+
PyTorch+
TensorFlow+
ROS+
OpenCV+
还有更多 •••
相关职位

logo of sensetime
社招算法工程

1. 仿真环境搭建: 基于lsaac Sim/MuJoCo/Gazebo搭建高保真的家居仿真场景,实现物理属性(摩擦力、质量)的精确模拟。 2. 合成数据生成: 利用程序化生成技术(Procedural Generation)批量生成多样化的物体和房间布局,为感知和VLA模型提供海量训练数据。 3. Sim2Real迁移:研究并解决仿真与真机之间的Gap,通过域随机化(Domain Randomization)等技术确保仿真训结的策略能部署到真机。 4. 数据管线管理:建立真机遥操作(Teleoperation)数据的采集、清洗、标注和管理平台。

更新于 2026-01-22北京
logo of sensetime
社招算法工程

1.VLA模型研发:负责基于Transformer架构的视觉-语言-动作(VLA)大模型的选型、微调与训练(如复现或改进RT-2,XVLA等架构)。 2.多模态数据处理:搭建多模态数据(图像/点云+语言指令+机械臂动作)的预处理与对齐管线,设计高效的数据编码/解码方案。 3.端到端策略学习:探索从像素输入直达关节控制的端到端模仿学习(Imitation Learning)算法,解决不同场景下的泛化性问题。 4.模型轻量化部署:配合系统工程师,将庞大的VLA模型量化、剪枝,并部署在端侧计算平台(Jetson Orin等)上进行实时推理。

更新于 2026-01-22北京
logo of sensetime
社招算法研究

1.环境感知与目标识别:基于深度相机(如RealSense)的RGB-D数据,开发实时环境感知算法,实现家庭场景下的目标检测、图像分割、物体识别(如餐具、家具)及场景理解。 2.三维视觉与抓取支持:利用点云数据研发物体姿态估计、三维重建算法,为机械臂抓取提供精准位姿信息,优化抓取点检测。 3.视觉SLAM与定位(可选):实现视觉SLAM算法,融合多传感器数据(如IMU),构建室内环境地图并支持机器人自主导航与定位。 4.多模态融合与系统集成:协同控制与算法团队,将视觉感知结果与语言指令、控制策略结合,为视觉-语言-行动模型提供输入,并适配ROS2等机器人系统。 5.算法优化与创新:跟踪前沿视觉算法(如Transformer、基础模型),针对嵌入式平台(如Jetson)进行模型压缩、推理加速,提升实时性与鲁棒性。

更新于 2025-11-06北京
logo of sensetime
社招算法研究

1. 物体位姿估计:研发物体位姿估计(6D Pose Estimation)算法,支持对物体的精准识别与定位。 2. 场景理解与重建:利用语义SLAM或NERF技术,构建家居环境的3D语义地图,为VLA模型提供环境上下文。 3. 透明/反光物体识别:针对玻璃、金属等难点物体,优化深度修复与检测算法。 4. 视觉伺服:配合控制工程师,开发基于视觉反馈的闭环控制(Visual Servoing),提升抓取成功率。

更新于 2026-01-22北京