阿里巴巴复杂场景的 Agentic Model 训练-阿里星
任职要求
1、具备大模型、RL 相关研究经验; 2、熟悉主流训练框架例如 VeRL 等; 3、编程能力扎实,熟练使用 Python、PyTorch; 4、具备良好的…
工作职责
负责 Agentic Model 的训练方法、能力提升与评测体系研究,探索大模型在自主决策、规划与工具调用等方面的强化路径,包括但不限于: 1、设计与优化 Agentic Model 的训练架构与方法; 2、构建与改进训练数据、策略与环境; 3、建立与完善 Agentic 能力评估体系; 4、与工程团队协作推动模型在系统中的集成与验证。
1、进行端到端自动驾驶大模型算法架构设计:研发基于多模态感知(激光雷达、摄像头等)的端到端自动驾驶模型,实现感知-决策-规划端到端建模方法的算法创新和车端应用; 2、探索VLM和VLA方法在端到端自动驾驶场景中的算法创新和应用,建立数据标准,提升自动驾驶困难场景的场景理解和决策规划能力; 3、设计面向端到端自动驾驶的强化学习算法(如多智能体RL、分层RL、逆强化学习),解决长尾场景决策难题。
随着近些年机器学习与表征学习的发展,非结构化数据的查询和分析变得更加普遍。通过表征学习,我们可以把图片或文本嵌入到高维空间从而用高维向量来代表这些图片或文本。进一步的,通过在高维空间中查找最近邻,我们可以对非结构化数据进行语义搜索。例如,通过检索增强生成技术(RAG),我们可以将外部知识或领域知识进行向量化,利用向量空间中的近邻搜索得到对应的原始知识,对大语言模型的生成结果进行增强,来减少大模型出现幻觉或知识过时的现象。 为了提升数据库产品对AI应用的支持,阿里云瑶池数据库也全面提升了向量检索能力,在PolarDB、RDS、AnalyticDB、Lindorm、Tair等产品中集成了向量功能,实现结构化数据、半结构化数据、多模数据、向量数据的一体化处理。 然而,目前向量索引主要关注查询速度和准确率,对于实际复杂场景下的搜索问题还没有足够的研究。例如,分布式架构下的向量查询索引、结构化与非结构化数据的联合查询,以及数据动态增删场景下的索引优化等问题,都需要进一步探索和研究。
1. 负责复杂几何条件与交互场景下的导航模型研发,强化空间理解与环境预测能力; 2. 探索世界模型在弱纹理、遮挡、动态场景下的应用,保障空间预测一致性; 3. 开展导航规划研究并验证快系统部署可行性,提升模型在复杂空间的通过灵活性; 4. 优化导航问题建模,将固定姿态导航能力向空间约束运动规划任务拓展。
负责Accio B2B场景下的全网AI搜索与复杂推理能力研究,重点攻克跨语言、跨数据源的深度信息检索,以及面向采购决策、供应商评估等复杂商业场景的多步推理与知识融合能力。做出有影响力的研究成果,并推动其在Accio实际业务场景中落地。 1、研究B2B场景下复杂query的理解与推理能力建设,包括多步意图分解、动态检索策略规划、多源信息聚合与冲突消解等; 2、设计面向全网搜索与复杂推理的post-training方案,探索检索-推理联合优化的数据构造、奖励建模与训练方法; 3、构建面向B2B搜索场景的Agentic评测体系,覆盖信息准确性、推理深度、多源整合质量等多个维度。