阿里巴巴日常实习生-大模型算法(Agentic RL / Reward 方向)-Qwen基础模型
任职要求
1. 学历:计算机、人工智能、数学等相关专业本科及以上在读。 2. 编程基础:精通 Python,熟练使用 PyTorch;具备扎实的机器学习与深度学习基础。 3. LLM 认知:对大语言模型的基本原理有一定了解,使用过或关注过主流 LLM。 4. RL 兴趣:对强化学习与大模型对齐有浓厚兴趣,了解 PPO / GRPO 等基本流程。 加分项(非硬性要求,有以下任…
工作职责
你将加入 Qwen 团队,深度参与大模型在 Agent 与 Coding 场景下的前沿算法研究。核心方向是构建支撑大规模 Agentic RL 训练的奖励信号体系,提升模型的对齐质量与 RL 训练上限。具体包括: 1. Coding Reward System:参与面向 Code Agent 的 Reward System 研发,探索 Outcome 与 Process Level 的自动化 Rewarding 机制,助力解决长程 Coding Trajectory 下的 Credit Assignment 与 Reward 稀疏性问题。 2. Agentic User Experience Reward:参与 Agent 任务的用户体验建模与 Reward 优化研究,协助探索 User Reward Modeling,为弥合 Benchmark 指标与用户实际体验之间的鸿沟提供数据与算法支持。 3. Reward 评估与数据迭代:以 Reward 信号为核心,参与数据筛选、难例挖掘与合成迭代实验。 你将获得: 1. 顶级算力资源与工程基础设施,直接参与 Qwen 基座模型核心训练流程。 2. 资深算法工程师带教,深入 Agentic RL 与 Reward System 最前沿方向。 3. 实习期间的工作成果有机会落地到 Qwen 正式版本。
岗位面向行为风控这一高度复杂且动态对抗的业务场景,支持反爬、作弊、欺诈、账号安全、恶意行为等核心风控业务,聚焦大模型后训练与Agentic等前沿技术,探索下一代智能风控基座和行为域基模解决方案。 1、参与行为域数据体系建设:面向行为风控场景中的结构化、序列化、图表化等数据,参与数据处理、任务构建和评测方案设计;探索面向结构化数据的大模型后训练方法,参与行为特色“世界模型”的研究与验证。 2、参与强化学习方案设计:围绕行为风控中的复杂任务,参与Reward System、RL后训练、复杂决策、自我博弈等方向的研究与实验;协助推进全链路情报分析与风险决策能力的建模和优化。 3、参与Agent训练环境和方案构建:面向行为分析、识别、挖掘、链路还原、路径推演等场景,参与可扩展Agent训练环境的设计、搭建与迭代;支持复杂任务下Agent能力评测、训练数据构造和效果分析。 4、参与技术探索与效果分析:跟进大模型后训练、RLHF、Agent、世界模型等方向的前沿研究;结合业务场景,参与实验设计、结果分析和方案迭代,推动研究成果向真实业务问题靠近。
参与安全部各种风控场景模型建设,真实体验大模型训练的各个阶段,包括不限于预训练、后训练,利用各种学术知识解决业务中实际遇到的问题,真正将大模型的能力赋能各类安全场景。
1. 协助团队开展大模型核心应用的评测算法研发工作,参与benchmark构建和评测框架搭建工作; 2. 参与构建和扩充高质量的评测数据集,协助打通线上/线下benchmark沉淀链路; 3. 辅助研发和调优基于 LLM-as-a-Judge 的自动化评测体系,提升评测指标的置信度与对齐率; 4. 参与自动化评测及竞品横评中的 Badcase 归因,为算法模型迭代提供数据支撑与优化建议; 5. 跟踪大模型评测领域(LLM Evaluation、RAG Evaluation)的前沿技术与开源框架,协助整理技术资料并探索创新评测方案。