logo of antgroup

蚂蚁金服研究型实习生-基于大模型VLA的控制技术研究

实习兼职研究型实习生地点:上海状态:招聘

任职要求


研究领域:
-目前正在攻读计算机科学或相关STEM领域的学士,硕士或博士学位
-具有一种或多种通用编程语言的经验,包括但不限于: Java,C/C ++ 、Python、JavaScriptGo
-具有上述研究领域的…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


研究领域:
  人工智能
项目简介:
  随着人工智能技术的快速发展,机器人领域正从传统的工业自动化向智能化、消费级方向转变。桌面机器人作为面向用户的电子消费品,旨在通过视觉、语言和行动(VLA,Vision-Language-Action)的深度融合,实现与人类的自然交互,并完成复杂的任务。这类机器人不仅可以提高用户的生活质量,还能在教育、娱乐、办公等场景中提供智能化服务。
包括英文材料
学历+
Java+
C+
还有更多 •••
相关职位

logo of antgroup
实习研究型实习生

研究领域: 人工智能 项目简介: · 背景:研发流程中如代码质量、Bug、安全军规等潜在风险较为难以发现,特别是从方法内部的单元测试、bug发现和修复、质量军规,进一步演进到仓库级别甚至仓库和系分文档之间的深度代码风险发现,既是业务上的痛点,也是技术上需要攻坚的难题。 · 研究内容:本项目计划围绕研发流程中如代码质量、Bug、安全军规等潜在深度风险,研究基于代码大模型技术的前置风险防范,在问题发生、影响扩大前及时发现。整个分析过程中涉及大量语义文本、代码片段,期望通过大模型结合Agent技术来理解和构建研发风险左移防线,具体包括但不限于:从单元级到仓库级再到仓库结合系分文档的全链路分级的质量测试技术、bug发现和修复技术、代码军规模式发现和扫描技术等,以及涉及其中的复杂推理技术、自动agent工作流技术等。 · 业务价值:提前发现蚂蚁源于研发流程代码内的深度风险,降低潜在风险。 · 关联战略:DeepRisk研发风险左移战役

北京|杭州
logo of alibaba
实习阿里巴巴研究型实

专注于多模态大模型与人机交互技术的创新研究及实践,具体职责包括: 1、探索多模态大模型(文本/图像/语音/视频等)的交互式应用场景,研发新型人机交互范式; 2、针对多模态交互复杂任务推理进行探索及研究,提升多模态、多跳推理场景下的复杂任务完成率; 3、优化多模态数据的融合算法,提升模型对复杂交互场景的理解与响应能力; 4、构建高效的多模态交互系统模型架构,研究低延迟、高并发的实时交互技术方案。

更新于 2026-07-24北京|杭州
logo of alibaba
实习阿里巴巴研究型实

我们是Token Foundry - 多模态交互团队,正在寻找对具身智能与数字人前沿交叉领域充满热情的研究型实习生。本项目在团队在生成理解一体化方面的坚实基础,共同构建下一代具身智能与多模态数字人大模型,进一步打通“感知-理解-生成-执行”全链路,在统一架构下探索环境理解、行为生成与多模态交互的深度协同。 你将参与如下关键方向: 1. 设计并实现支持自然语言指令到连续动作序列端到端控制的生成理解一体化具身基础模型; 2. 构建能响应语音、文本、视觉等全模态输入,实时高质量数字人生成大模型; 3. 开发融合真实与仿真数据的千万级多模态具身训练平台; 4. 优化模型推理效率,推动大模型在机器人端侧或实时交互场景中的部署。 优秀成果可形成专利/论文,或发布ModelScope开源社区

更新于 2026-06-09北京|杭州
logo of tongyi
实习通义研究型实习生

我们是通义实验室多模态交互团队,正在寻找对具身智能与数字人前沿交叉领域充满热情的研究型实习生。本项目在团队在生成理解一体化方面的坚实基础(如Z-Image等代表性工作),共同构建下一代具身智能与多模态数字人大模型,进一步打通“感知-理解-生成-执行”全链路,在统一架构下探索环境理解、行为生成与多模态交互的深度协同。 你将参与如下关键方向: 1. 设计并实现支持自然语言指令到连续动作序列端到端控制的生成理解一体化具身基础模型; 2. 构建能响应语音、文本、视觉等全模态输入,实时高质量数字人生成大模型; 3. 开发融合真实与仿真数据的千万级多模态具身训练平台; 4. 优化模型推理效率,推动大模型在机器人端侧或实时交互场景中的部署。 优秀成果可形成专利/论文,或发布通义开源社区

更新于 2025-12-11北京|杭州