蚂蚁金服【蚂蚁星-Plan A】算法工程师-智能体 (强化学习方向)
任职要求
有人工智能和大模型相关开发和研究经历,发表过顶级…工作职责
AReaL团队聚焦强化学习技术,结合大模型泛化能力,研发开源开放的决策模型和强化学习训练系统,并应用于通用智能体模型和产品。 1. AReaL团队聚焦强化学习技术,结合大模型泛化能力,研发开源开放的决策模型和强化学习训练系统,并应用于智能体方向; 2. 参与蚂蚁自研强化学习推理模型的算法和训练系统研发。
AReaL团队聚焦强化学习技术,结合大模型泛化能力,研发开源开放的决策模型和强化学习训练系统,并应用于通用智能体模型和产品。 1. AReaL团队聚焦强化学习技术,结合大模型泛化能力,研发开源开放的决策模型和强化学习训练系统,并应用于智能体方向; 2. 参与蚂蚁自研强化学习推理模型的算法和训练系统研发。
蚂蚁ASystem会探索和构建高性能的 AI 自学习基础系统,让语言交互、智能体、具身智能等各类 AI 场景都能基于这个基础系统走向高效的自我演进,迈向更高的智能水平。 1. 探索和研究新一代训推混合计算系统,寻求从算子到训推并行原理下的系统创新,实现大规模T级参数模型训练和100X性能提升; 2. 以“X+RL”范式构建新一代强化学习框架,实现多轮交互、过程奖励、大规模模拟环境等,支持各类智能体和搜索场景学习能力提升; 3. 通过先进软硬件设计和优化,研究并持续优化分布式并行计算和调度系统,提升大模型在训推一体、长推理效率和弹性训练能力,大幅降低智能计算成本。
1.负责具身智能的核心算法研发,聚焦强化学习(RL)与模仿学习(IL)技术,推动智能体在复杂物理环境中的感知、决策与行动能力; 2.设计并实现基于强化学习的端到端训练框架,解决稀疏奖励、多任务学习、长周期规划等挑战性问题; 3.开发高效的模仿学习算法,结合人类示范数据与自主探索策略,提升智能体在真实场景中的泛化性与安全性; 4.针对机器人控制、多模态感知-动作闭环等场景,优化算法在计算效率、实时性与鲁棒性方面的表现; 5.与硬件、仿真团队紧密协作,推动算法在实体机器人或虚拟环境中的部署与验证。
蚂蚁集团大安全事业群机器智能团队致力于打造安全科技的核心竞争力,做可信AI的持续引领者,为广大支付宝用户的数字化生活提供全方位安全保障。作为蚂蚁集团安全版图中的核心力量,我们正以最前沿的AI算法为刃、以大模型为盾,编织数字世界的"安全之网"。在这里,大模型、智能体、AI安全等热门的研究不再是纸上谈兵,每一个方向都在落地成为真实业务场景、十亿级用户的智慧防线。 关于团队,过去获得过浙江省科技进步一等奖、中国电子学会科技进步一等奖,人工智能学会吴文俊人工智能自然科学奖一等奖,中国图象图形学学会科技进步一等奖、多次获得中国计算机学会科技进步奖、世界人工智能大会SAIL之星与"镇馆之宝",等多个重量级奖项。可信AI专利布局全球第一,主导制定ITU国际风控标准。多名Kaggle Grandmaster ,拿过多个KDD Cup/CVPR/NeurIPS/ICCV/CVPR/ECCV等多个顶会竞赛冠军,累计发表近百篇顶会论文; 在这里,你将有机会和毕业于海内外著名高校的行业专家们、众多KDD Cup/CVPR 等比赛冠军、Kaggle Grandmaster 、顶会论文作者们共同根植蚂蚁丰富的场景数据,利用海量算力探索创新前沿算法应用,使用领先的机器学习算法解决风控业务问题,构建数据与知识驱动的智能风控体系,提升用户的支付安全体验。 加入我们,让我们一起为世界带来微小而美好的改变。 1. 参与和负责针对对抗攻击、后门植入、数据泄露等内生安全威胁的主动防御机制; 2. 研发基于RL的大模型安全对齐技术; 3. 通过实时对抗攻防与安全态势感知实现防御策略的自主进化; 4. 探索模型训练推理全链路的可控性增强技术。