logo of alibaba

阿里巴巴复杂多模态信息理解与Tool-use-Bravo Star

实习兼职阿里巴巴2027届实习生地点:杭州状态:招聘

任职要求


1、具备大模型、多模态相关研究经验;
2、熟悉主流训练框架例如 VeRL 等;
3、编程能力扎实,熟练使用 Python、PyTorch;
4、…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


负责研究大模型在复杂多模态内容理解、跨模态推理和工具使用方面的能力提升,探索多模态模型的统一表示、任务分解与交互策略。
1、设计和优化多模态模型的reasoning和agentic能力;
2、构建多模态数据、任务与评测体系;
3、研究多模态场景下工具调用设计等。
包括英文材料
大模型+
还有更多 •••
相关职位

logo of antgroup
社招3年以上技术类-算法

1. 复杂文档结构化解析: 专注于复杂文档的深度解析,包括版面分析(Layout Analysis)、公式表格识别(Formula Table Recognition & Reconstruction)、关键信息抽取(Key Information Extraction, KIE)等,将非结构化的文档图像或PDF高效地转换成机器可读的结构化数据。 2. 文档问答(DocVQA)系统构建: 研发和迭代文档视觉问答模型,让大模型能够精准理解用户的自然语言提问,并结合视觉与文本信息,从复杂的文档(如研究报告、财务报表、合同、票据等)中定位、抽取并生成结构化答案。 3. 核心OCR能力提升: 负责前沿OCR技术的研发与优化,攻克手写体、低质量图像、艺术字、复杂排版等挑战性场景下的文字检测与识别难题,显著提升多模态大模型底层的文字信息获取(Text-in-Image)精度与鲁棒性。 4. 前沿技术探索与创新: 紧密跟踪多模态、OCR及文档智能领域的最新研究成果,结合业务需求进行技术预研、方案设计和原型实现,推动技术创新和专利产出。 5. 模型与系统优化: 负责构建和完善相关方向的数据集、评测体系和模型训练/推理流程,并与工程团队紧密合作,推动算法模型的性能优化与实际落地。

更新于 2026-07-15杭州
logo of alibaba
实习阿里巴巴2027

负责 Agentic Model 的训练方法、能力提升与评测体系研究,探索大模型在自主决策、规划与工具调用等方面的强化路径,包括但不限于: 1、设计与优化 Agentic Model 的训练架构与方法; 2、构建与改进训练数据、策略与环境; 3、建立与完善 Agentic 能力评估体系; 4、与工程团队协作推动模型在系统中的集成与验证。

更新于 2026-04-08杭州
logo of jd
校招空间与具身智能方

1. 负责复杂几何条件与交互场景下的导航模型研发,强化空间理解与环境预测能力; 2. 探索世界模型在弱纹理、遮挡、动态场景下的应用,保障空间预测一致性; 3. 开展导航规划研究并验证快系统部署可行性,提升模型在复杂空间的通过灵活性; 4. 优化导航问题建模,将固定姿态导航能力向空间约束运动规划任务拓展。

更新于 2026-06-23北京