logo of alibaba

阿里巴巴研究型实习生 - Computer Use Agent的能力演进与落地实践

实习兼职阿里巴巴研究型实习生地点:北京 | 杭州 | 上海状态:招聘

任职要求


1. 计算机科学、人工智能、机器学习深度学习、软件工程或相关专业在读硕士/博士,具备扎实的数理基础和编程基础。
2. 对大语言模型或多模态大模型有浓厚兴趣,了解深度学习、模型训练、优化算法、生成式模型、自监督学习等方向中的一个或多个,具备相关课程、项目或科研经历者优先。
3. 具备较强的学习能力和研究潜力,能够快速理解并复现前沿论文、跟踪技术进展;有论文、开源项目、竞赛或…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


参与 GUI / Hybrid Computer Use Agent 在 Computer / Mobile / Browser 等真实数字环境中的能力演进与落地实践,使模型能够理解、操作并协同完成跨平台、跨界面、跨工具、跨任务流的复杂用户任务,持续提升 Agent 在开放环境中的泛化性、鲁棒性、协同性与实际可用性,拓展大模型在真实人机交互场景中的能力边界。

1. GUI Agent:重点探索 GUI 在Computer / Mobile / Browse场景下的Agent能力提升与OOD任务能力泛化影响分析,研究大规模自然GUI轨迹Pre-training、用户协同能力。
2. Hybrid Agent:设计CLI & GUI 统一范式下的Universal Digital Agent Harness & Behavior Pattern,探索用户协同CUA场景下的有效实践方案。
3. Envs Scaling & Training Scaling:在大规模合成环境和现实环境数据中CPT->RL端到端优化迭代。
4. Preference & Feedback Modeling:探索用户协同Computer Use场景下用户偏好和用户反馈的收集、建模与处理机制,研究显式反馈与隐式反馈的统一表征方式,建立可用于训练和评估的反馈闭环。
包括英文材料
机器学习+
深度学习+
大模型+
算法+
还有更多 •••
相关职位

logo of tongyi
实习通义研究型实习生

基于开源的 Diffusion 图像和视频生成模型,构建基础推理和训练引擎,探索前沿的 AIGC 技术,具体职责包括: 1、加入魔搭社区 DiffSynth-Studio 等开源项目的开发,接入先进的图像和视频生成模型,为业界提供领先的推理和训练引擎基建。 2、基于丰富的开源模型生态,探索 AIGC 技术的全新能力,开展多元化的科研项目,包括但不限于图像生成的思维链、跨模态模型的能力集成、理解-生成统一架构模型等,发表高水平学术论文。 3、参与魔搭社区的运营活动,为新模型的开源提供技术支持,推动 AI 技术的普及推广。

更新于 2026-06-17北京|杭州
logo of tongyi
实习通义研究型实习生

阿里巴巴通义实验室-对话智能团队 以大模型对话技术为核心,研究及应用方向包括智能客服、个性化对话、角色扮演、分身复刻、社交智能、数字人等,主要业务场景包括: (1) 通义晓蜜—阿里云智能客服,国内对话式AI市占率第一; (2) 通义星尘-类人智能体创作平台。2020年以来,围绕预训练、对话智能、大模型等方向发表80+篇国际顶会论文,欢迎对大模型感兴趣的你加入我们,一起创造人机对话的未来。 拟研究技术方向: 1. 角色扮演技术(Role-Playing Agent)的研究,在相关性、人设一致性、吸引力、情感、道德等维度取得显著提升; 2. 分身复刻(Character AI)的研究,探索角色所处虚拟世界建模与演化; 3. 数字专家的研究,包括用户心理推断、策略搜索推理等技术; 4. 多模态Character模型的研究,包括语音端到端角色对话模型。

更新于 2026-05-28北京|杭州
logo of tongyi
实习通义研究型实习生

当前视觉语言模型(VLM)以通用图片和视频理解为主,而人物往往是图片或视频的重要组成部分,因此对图片、视频中的人物进行精准、精细的理解非常重要。本项目重点围绕人物视频,对视频中人物的行为变化、人与人的互动行为、人与物的互动行为等使用文字的方式进行理解。

更新于 2026-05-20杭州
logo of tongyi
实习通义研究型实习生

NeRF&3D GS是很有潜力的新兴3D重建技术,这几年获得非常大的关注,有非常多的进展,但是实时训练和渲染一直是难以克服的问题。本项目拟通过快速、泛化NeRF、3DGS等方法,基于多视角图像的输入,在秒级时间内完内物体、场景重建和新视角图像渲染。

更新于 2026-05-20北京|杭州