LongRCA Bench: 智能体失败根因诊断基准

LongRCA Bench: 智能体失败根因诊断基准

Adrian Cole
153
original

LongRCA Bench 是面向长周期 AI 智能体的失败诊断基准,包含 1,140 条无注入错误的中长轨迹,中位步数 145。最强基线根因步骤准确率仅 13.2%,而论文提出的 RCTA 方法将其提升至 24.1%,并实现 51.1% 的责任角色识别率。该研究揭示角色归属与精确根因定位应作为独立评估目标。

当一个 AI 智能体在长达上百步的任务里最终失败时,你只知道结果错了,却往往说不清是哪一步、哪一个角色最先带偏了方向。这正是 LongRCA Bench 试图解决的问题。

这篇发表于 arXiv 的预印本论文,提出了一个专门针对长轨迹智能体失败诊断的基准。不同于传统评测只关心最终成败,LongRCA Bench 要求模型在完整的执行过程中,定位出最早的决定性根因步骤,并指出该步骤归属于哪个角色。

更真实的失败数据

基准包含 1,140 条失败轨迹,覆盖五个领域,且全部是自然发生的失败,没有人为注入错误。每条轨迹都有人类专家独立标注的负责角色和最早根因步骤,标注一致性经过了单独评分。值得注意的是,轨迹的中位长度达到 145 步,远超以往研究常见的短轨迹。

  • 五个不同领域的复杂任务场景
  • 无注入错误的真实失败样本
  • 人类独立评分的关键标注

这样的设计让评测更接近实际生产环境中的智能体故障——问题往往藏在数十步之前,而不是在最后一刻才暴露。

现有基线力不从心

论文报告了多个基线模型的表现:最强基线在精确根因步骤识别上只有 13.2% 的准确率。这个数字说明,面对上百步的轨迹,单靠通用的推理模型很难准确定位真正的失误起点。

作为对比,作者提出了 Root-Cause Trajectory Attribution(RCTA) 方法。这是一种无需训练的诊断技术,通过从分段摘要中检索候选错误步骤,再回溯到更早的交接指令,最终将精确根因步骤准确率提升到 24.1%,负责角色识别率达到 51.1%。虽然仍有很大提升空间,但已经是接近一倍的改进。

对智能体开发意味着什么

这项研究的实际影响很直接:长周期智能体的可观测性和故障排查正在成为独立的研究课题。对于正在构建复杂 agent 系统的开发团队来说,光有结果日志已经不够,需要更细粒度的过程追踪和自动化根因分析工具。LongRCA Bench 提供了一个标准化的评估环境,可以横向量化不同诊断方法的真实水平。

论文还特别强调,责任角色的归属和精确根因步骤的定位,应该被分开评估。这两者是不同难度的问题,混在一起会掩盖模型的真实短板。

值得关注的下一步

如果你在开发智能体应用,可以留意这个基准的公开数据集和官方实现(论文尚未提供直接链接)。同时,建议在自己的系统中记录每一步执行的角色、上下文和交接信息——这些正是未来 AI 诊断工具所依赖的基础数据。对研究者而言,24.1% 的准确率意味着长轨迹根因定位仍有大片空白可以挖掘。

LongRCA Bench 的出现,让“智能体为什么失败”这个问题有了更科学的回答方式。

AI智能体失败诊断根因分析长轨迹基准测试机器学习人工智能智能体可观测性LongRCARCTA

分享

评论

0
0/500 字符

暂无评论

成为第一个评论的人

探索更多

开源项目

Awesome AI for Science:精选 AI 科学发现资源

这是一个精选 AI 工具、库、论文、数据集和框架的仓库,覆盖物理、化学、生物学和材料科学。为研究人员和开发者提供快速掌握 AI 在科学探索中应用的价值资源。拥有超过1700颗星,采用 MIT 许可证。

earth2studio: NVIDIA 面向天气与气候的深度学习框架

earth2studio 是 NVIDIA 开源的一个深度学习框架,专为天气和气候领域设计。它简化了从研究到部署的完整工作流,提供通用 API 和预训练模型,帮助研究人员快速构建 AI 驱动的天气预报和气候模拟应用,降低开发门槛并加速领域创新。

ai4paper:面向研究者的开源 AI 学术平台

ai4paper 是一个面向研究人员的开源 AI 平台,声称可访问2.4亿篇学术论文。其核心功能包括全文 PDF 翻译、AI 驱动的文献搜索和一键生成评论,通过网页界面即可使用,无需安装插件。该平台还支持 Zotero 集成,并可通过小程序订阅期刊,旨在提升文献综述和学术写作的效率。项目主要使用 HTML 编写,采用 MIT 许可证,截至采集时在 GitHub 上获得2739个星标。

openscience: 面向科学研究的开源 AI 工作台

openscience 是一个由 synthetic-sciences 开源的 AI 工作台,专为科学研究场景设计。项目使用 TypeScript 构建,在 GitHub 已获超 3.2k 星标,仓库包含前后端、CLI 和评估模块。目前公开文档有限,适合对 AI for Science 感兴趣的团队关注。

ResearchStudio:微软开源 AI 协作研究工具

ResearchStudio 是微软发布的开源 AI 协作工具,旨在支持研究人员从问题提出到最终发表的完整学术旅程。它集成了文献综述、实验设计、数据分析和论文写作等功能,并利用大型语言模型提供智能建议。该项目特别适合希望优化工作流程的学术研究者。主要编程语言为 Python,采用 MIT 许可证,采集时 GitHub 星标数为 1911。

open-science: 本地优先的AI科研工作台

open-science 是一个开源、本地优先、模型无关的 AI 研究工作台,专为科学发现设计。它让科研人员在自己的机器上运行 AI 辅助流程,不绑定特定模型,兼顾数据隐私与灵活性。