RubricForge: 自动生成评估规则,减少AI智能体虚假高评价

RubricForge: 自动生成评估规则,减少AI智能体虚假高评价

Emma Carter
26
original

RubricForge 是一种新型 AI 智能体评估方法,通过反射进化从少量带标注轨迹中生成可读的评分规则,无需调用环境奖励。在 tau-bench 和 WebShop 上,它将虚假通过率降低近一半,让每个评判结果都有据可查,适合对智能体可靠性要求严格的场景。

用大模型当裁判,在智能体评测里已经是常态。环境奖励信号贵、慢、部署时拿不到,于是人们让第二个大模型打分。问题在于,这种无奖励的代理裁判往往会被“流畅但不成功”的轨迹骗过去,给出过高评价。论文团队把这个问题叫做 over-crediting,也就是虚假好评。

从手工规则到自动归纳

现有的自动裁判有两种路子:要么像 G-Eval 那样手工写评分细则,要么微调裁判模型的权重。两者都有短板——手工规则跟不上任务变化,微调权重则让评判过程变成一个黑盒。RubricForge 换了个思路:不手写规则,也不用调权重,而是根据少量带真实标签的轨迹自动归纳出评判细则。这些细则完全是文本形式,人类可读,每一次打分都能追溯到具体的评判条目。

具体流程分三步:用反射进化在标注轨迹上迭代优化规则,目标是让规则与真实环境奖励的一致性最大化;然后冻结这条规则;最后在留出轨迹上只用一次模型调用完成评判,全程不碰环境奖励。整个优化产物是一段可读文本,这带来一个额外好处:任何一条评判结果都可以归因到具体条目,不像微调模型那样说不清道不明。

两个基准任务的实测表现

论文用了一个冻结的 7B 模型同时充当智能体和裁判,在 tau-bench(从 220 条回滚中取 173 条带标签轨迹)和 WebShop(160 条)上做了对照。结果有点意思:RubricForge 的主要提升是“忠诚度”而非整体一致率。它的边缘优势在统计上并不显著,绝对分数校准还略输泛 G-Eval 裁判,但在最关键的一项指标上明显胜出:虚假通过率在 tau-bench 上从 0.173 降到 0.115,几乎砍半。

作者认为,在无奖励测评里,虚假通过率比总一致率更关键——因为一个虚假通过会让有问题的智能体上线,而虚假失败最多只是重试一次。

另外,在 WebShop 分级结果的排序相关性上,RubricForge 也略高(Spearman 0.410 对 0.370)。实验中还出现了三次“抓住本来会被放过的失败案例”,并且没有发生一次反向误伤。

这研究对谁有意义

  • 做智能体评测的团队:如果被 G-Eval 这类手工规则的不稳定性困扰,这提供了一种低成本自动生成规则的方式。
  • 重视可解释性的合规场景:评判规则和结果都可追溯,便于审计。
  • 依赖单一裁判模型的部署方:用一个小模型既能做智能体又能当裁判,省去额外奖励计算。

当然,局限也很明显。目前实验规模有限,且作者明确提到与泛化模型的差距在统计上不显著。官方公开的技术细节有限,更多架构差异还得等完整论文。

几点实用参考

对打算复现或借鉴的人,有几个要点:第一,RubricForge 的核心价值在降低过度好评率,而非提升普通打分一致性,评价它时别盯错指标;第二,它输出的规则是文本,意味着你可以直接检查裁判到底在按什么标准打分;第三,使用时注意基础模型的选择,7B 模型的表现在不同任务上未必稳定。

总体来说,这更像一次方向验证:让评估规则从真实反馈里“长出来”,比在权重里调来调去更可控。后续若能在更多任务和更大模型上确认稳定的收益,有望成为自动评测基建里一个可靠的新选项。

AI智能体评测自动评分子规则大模型评判无奖励评估可解释AIRubricForge过度好评

分享

评论

0
0/500 字符

暂无评论

成为第一个评论的人

探索更多

开源项目

Awesome AI for Science:精选 AI 科学发现资源

这是一个精选 AI 工具、库、论文、数据集和框架的仓库,覆盖物理、化学、生物学和材料科学。为研究人员和开发者提供快速掌握 AI 在科学探索中应用的价值资源。拥有超过1700颗星,采用 MIT 许可证。

earth2studio: NVIDIA 面向天气与气候的深度学习框架

earth2studio 是 NVIDIA 开源的一个深度学习框架,专为天气和气候领域设计。它简化了从研究到部署的完整工作流,提供通用 API 和预训练模型,帮助研究人员快速构建 AI 驱动的天气预报和气候模拟应用,降低开发门槛并加速领域创新。

ai4paper:面向研究者的开源 AI 学术平台

ai4paper 是一个面向研究人员的开源 AI 平台,声称可访问2.4亿篇学术论文。其核心功能包括全文 PDF 翻译、AI 驱动的文献搜索和一键生成评论,通过网页界面即可使用,无需安装插件。该平台还支持 Zotero 集成,并可通过小程序订阅期刊,旨在提升文献综述和学术写作的效率。项目主要使用 HTML 编写,采用 MIT 许可证,截至采集时在 GitHub 上获得2739个星标。

openscience: 面向科学研究的开源 AI 工作台

openscience 是一个由 synthetic-sciences 开源的 AI 工作台,专为科学研究场景设计。项目使用 TypeScript 构建,在 GitHub 已获超 3.2k 星标,仓库包含前后端、CLI 和评估模块。目前公开文档有限,适合对 AI for Science 感兴趣的团队关注。

ResearchStudio:微软开源 AI 协作研究工具

ResearchStudio 是微软发布的开源 AI 协作工具,旨在支持研究人员从问题提出到最终发表的完整学术旅程。它集成了文献综述、实验设计、数据分析和论文写作等功能,并利用大型语言模型提供智能建议。该项目特别适合希望优化工作流程的学术研究者。主要编程语言为 Python,采用 MIT 许可证,采集时 GitHub 星标数为 1911。

open-science: 本地优先的AI科研工作台

open-science 是一个开源、本地优先、模型无关的 AI 研究工作台,专为科学发现设计。它让科研人员在自己的机器上运行 AI 辅助流程,不绑定特定模型,兼顾数据隐私与灵活性。