logo of alibaba

阿里巴巴集团安全部-强化学习/Agent算法工程师/专家-行为风控方向

社招全职3年以上地点:北京状态:招聘

任职要求


1、硕士研究生及以上学历,计算机、人工智能、软件、信息安全、统计和数学专业优先;
2、3年以上大模型/强化学习相关研发经验,深刻理解RLHF/Agent训练经验;
3、具备业务风控领域(作弊、欺诈、账号安全、恶意行为等方向)的实战经验,对风险数据(日志、行为序列、用户画像、图数据)有敏锐的洞察…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


岗位面向行为风控这一高度复杂且动态对抗的业务场景,支持反爬、作弊、欺诈、账号安全、恶意行为等核心风控业务,聚焦大模型强化学习与Agent等核心技术,构建下一代智能风控基座和行业权威的行为域基模解决方案。
1、面向行为域的结构化/序列化/图表化数据体系,构建面向结构化数据的后训练和评测方案,产出行为特色的“世界模型”;
2、围绕行为风控的复杂任务,设计并迭代强化学习方案,包括但不限于:Reward System、RL、复杂决策、自我博弈等方向,构建全链路情报分析与风险决策能力;
3、面向行为分析、识别、挖掘、链路还原、路径推演等场景,设计可规模化扩展的Agent训练环境和迭代方案;
包括英文材料
学历+
大模型+
强化学习+
RLHF+
还有更多 •••
相关职位

logo of alibaba
社招3年以上技术类-安全

工作内容: 1.负责RASP能力的规划及设计、样板间上线及运营,包括RASP能力方案设计、技术选型、功能实现原型、规则维护与优化、样板间运营等; 2.负责部分木马分析、运行时漏洞分析与挖掘,配合各团队完成安全加固工作;

更新于 2026-06-18北京|杭州
logo of alibaba
社招2年以上技术类-算法

1. 参与面向网络安全领域的垂直大模型交付工作,包括基于大模型做流程设计、agent优化和模型安全能力提升; 2. 负责对接阿里内部各个业务线的网络安全需求,包括情报安全、流量安全、数据安全等不同场景,构建高质量业务数据,优化交付流程; 3. 开展大模型全流程训练工作,包括预训练、CPT、SFT、GRPO及安全工具结合的Agentic RL; 4. 针对经典且依赖安全专家经验的的安全任务(如漏洞检测、流量情报分析、代码生成等)优化模型能力,提升其在真实攻防场景中的模型性能与鲁棒性; 5. 探索大模型在代码安全、漏洞挖掘、逆向工程等方向的应用,并推动技术成果落地与学术发表。

更新于 2026-07-03北京
logo of alibaba
社招3年以上技术类-算法

1、探索知识和评测驱动的模型自主训练闭环链路,实现大模型训练自进化框架 2、基于业务需求,利用自主训练闭环链路训练安全基础模型,保持通用能力不降的前提下提升业务效果 3、与工程团队合作搭建Agentic环境,负责Agent相关训练和评测 4、研究安全场景的知识和评测问题,发表论文、专利、开源评测集等成果

更新于 2026-06-17北京|杭州
logo of alibaba
社招3年以上技术类-算法

1. 集团多种业务场景下,对千亿级流量进行攻击流量识别、人机识别相关算法研究; 2. 通过 LLM 对海量流量及各端审计数据进行分析,不断提升大模型在流量识别场景下的分析及归因能力; 3. 搭建端云协同的风控模型系统,不断提升各类异常流量的防控能力; 4. 跟踪风控领域前沿技术,结合多模态数据,进行原型系统的研发和验证

更新于 2026-06-17杭州