用大模型当裁判,在智能体评测里已经是常态。环境奖励信号贵、慢、部署时拿不到,于是人们让第二个大模型打分。问题在于,这种无奖励的代理裁判往往会被“流畅但不成功”的轨迹骗过去,给出过高评价。论文团队把这个问题叫做 over-crediting,也就是虚假好评。
从手工规则到自动归纳
现有的自动裁判有两种路子:要么像 G-Eval 那样手工写评分细则,要么微调裁判模型的权重。两者都有短板——手工规则跟不上任务变化,微调权重则让评判过程变成一个黑盒。RubricForge 换了个思路:不手写规则,也不用调权重,而是根据少量带真实标签的轨迹自动归纳出评判细则。这些细则完全是文本形式,人类可读,每一次打分都能追溯到具体的评判条目。
具体流程分三步:用反射进化在标注轨迹上迭代优化规则,目标是让规则与真实环境奖励的一致性最大化;然后冻结这条规则;最后在留出轨迹上只用一次模型调用完成评判,全程不碰环境奖励。整个优化产物是一段可读文本,这带来一个额外好处:任何一条评判结果都可以归因到具体条目,不像微调模型那样说不清道不明。
两个基准任务的实测表现
论文用了一个冻结的 7B 模型同时充当智能体和裁判,在 tau-bench(从 220 条回滚中取 173 条带标签轨迹)和 WebShop(160 条)上做了对照。结果有点意思:RubricForge 的主要提升是“忠诚度”而非整体一致率。它的边缘优势在统计上并不显著,绝对分数校准还略输泛 G-Eval 裁判,但在最关键的一项指标上明显胜出:虚假通过率在 tau-bench 上从 0.173 降到 0.115,几乎砍半。
作者认为,在无奖励测评里,虚假通过率比总一致率更关键——因为一个虚假通过会让有问题的智能体上线,而虚假失败最多只是重试一次。
另外,在 WebShop 分级结果的排序相关性上,RubricForge 也略高(Spearman 0.410 对 0.370)。实验中还出现了三次“抓住本来会被放过的失败案例”,并且没有发生一次反向误伤。
这研究对谁有意义
- 做智能体评测的团队:如果被 G-Eval 这类手工规则的不稳定性困扰,这提供了一种低成本自动生成规则的方式。
- 重视可解释性的合规场景:评判规则和结果都可追溯,便于审计。
- 依赖单一裁判模型的部署方:用一个小模型既能做智能体又能当裁判,省去额外奖励计算。
当然,局限也很明显。目前实验规模有限,且作者明确提到与泛化模型的差距在统计上不显著。官方公开的技术细节有限,更多架构差异还得等完整论文。
几点实用参考
对打算复现或借鉴的人,有几个要点:第一,RubricForge 的核心价值在降低过度好评率,而非提升普通打分一致性,评价它时别盯错指标;第二,它输出的规则是文本,意味着你可以直接检查裁判到底在按什么标准打分;第三,使用时注意基础模型的选择,7B 模型的表现在不同任务上未必稳定。
总体来说,这更像一次方向验证:让评估规则从真实反馈里“长出来”,比在权重里调来调去更可控。后续若能在更多任务和更大模型上确认稳定的收益,有望成为自动评测基建里一个可靠的新选项。











评论
暂无评论
成为第一个评论的人