阿里云阿里云智能-智能体评测与优化专家(金融)-新金融行业线(杭州/北京)
任职要求
1,计算机科学、人工智能、机器学习、数学、统计学、金融工程等相关专业,本科及以上学历,硕士或博士优先。 2, 具备大语言模型、智能Agent或机器学习系统相关研发经验,熟悉模型训练、评测、优化及部署的完整流程。 3, 熟悉大模型Post-training技术,包括但不限于SFT、偏好对齐、奖励模型、模型蒸馏及强化学习等。 4,具备Agent评测体系建设经验,能够独立完成评测标准设计、数据集构建、自动化评测、Trace分析、错误归因和…
工作职责
我们正在寻找一位具有深厚技术背景和丰富经验的Agent评测与优化专家,加入我们的团队,共同推动前沿技术的发展。您将负责主导模型在复杂金融任务中的评测工作,涵盖数据清洗、Trace 轨迹归因,模型蒸馏与对齐、奖励模型训练、领域能力,DeepResearch等方面,以优化模型性能并在金融任务中取得卓越效果。 您将: 1,主导Agent的评测,优化,模型post-training与Harness 的自动优化工作: 2,优化模型在金融任务中的效果:通过各种技术手段,确保模型在金融任务中的准确性和鲁棒性。 3,具备产品化思维,能够在客户现场完成算法架构设计与实施 4,设计和实现高效的模型优化策略:结合最新的研究成果和技术趋势,设计并实现高效的模型优化策略。 5,性能监控和反馈机制:实施和优化模型在实际应用中的部署,包括性能监控和反馈机制。 6,撰写技术文档和研究报告:与团队和利益相关者沟通项目进展与成果,撰写详细的技术文档和研究报告。
1、设计面向云安全场景(入侵检测、自动化渗透、合规审计)的大模型评测体系,定义“懂安全的 AI”量化标准; 2、落地自动化攻击算法,构建红蓝智能体对抗环境,持续挑战 AI 极限,评估其接管复杂防御决策的资质; 3、深入研究并创新应用 Claude、OpenAI评测框架等前沿技术,构建云安全领域的评测标杆; 4、探索多智能体对抗、自动化反馈强化学习等技术,实现评测结果直接驱动模型进化的闭环系统。
简介:随着 OpenClaw、Claude Code 等 Agent 进入实战领域,传统的静态评测已无法衡量 Agent 的长程规划、自主纠错与真实环境交互能力。我们寻找对 Agent 评测范式有独特见解的同学,共同定义下一代 Agent 的考卷。你将参与的工作有: 1、评测范式研究与落地: ①针对 OpenClaw 及 Claude Code 等主流 Agent,构建基于真实生产力场景,如自动化办公、复杂代码重构、多工具协同等的动态评测沙盒环境。 ②探索从“单轮对话”转向“长程任务”的评测机制,研究如何量化 Agent 的记忆一致性与环境感知力。 2、高价值方案产出: ①设计并构建能反映用户体感的评测集,不仅关注 通过率,更深入拆解用户在交互过程中的使用体验。 ②建立 Agent 错误归因体系,针对 Agent 陷入死循环、幻觉指令、工具调用失败等典型场景进行深度诊断。 3、未来形态探索: ①跟踪前沿 Agent 发展,研究在多智能体协同、自主进化等未来形态下的 Agent 形态和相应的评测基准。 ②利用 LLM/Agent-as-a-Judge 的方式,提升自动化评测的准确性与效率。

1. 统筹汽车垂类AI对话App全链路智能体效果评测体系,搭建Agent标准化评测框架和自动化机评流水线及平台 2. 负责智能体全生命周期效果监控,驱动Agent核心能力持续优化,对智能体自动化评测覆盖率、人机打分一致率、业务问题闭环效果全权负责。 3. 面向看车/选车/买车/用车业务场景,负责评测数据集与行业基准建设,设计分层评测体系及场景化评测用例,定义多维度评测指标体系 4. 联动算法研发、数据标注及产品运营团队,打通「评测→根因分析→方案修复→复测验证」完整优化闭环,指引智能体迭代方向,提升用户全场景问答体验 5. 建立覆盖智能体需求开发、版本测试、线上灰度、线上数据回流全生命周期的质量管控标准,将评测准入规则嵌入产品迭代流程
1.评测体系与基准构建: 负责构建覆盖 FPS、RPG 等多品类游戏的智能体评测基准(Benchmark),设计科学、全面、客观的多维度评估指标与覆盖长尾的测试集,真实反映模型在复杂游戏环境下的性能表现; 2.自动化管线与平台研发:设计并实现可扩展、高效、稳定的自动化评测流水线(Pipeline),支持大规模并行游戏对局运行、评测指标计算; 3.行为评估机制: 研发行为相似度算法,量化智能体与人类玩家在视觉观测与操作序列上的差异,验证 VLA 模型的对齐效果; 4.对抗评测机制: 设计新旧模型对战、人机对战等对抗机制,验证智能体策略的强度稳定性与竞技表现; 5.技术追踪: 持续追踪业界最新的AI评测方法论,不断完善评测矩阵,保持技术领先性。