RubricForge: 自動生成評估規則,減少AI智慧體虛假高評價

RubricForge: 自動生成評估規則,減少AI智慧體虛假高評價

Emma Carter
26
original

RubricForge 是一種新型 AI 智慧體評估方法,通過反射進化從少量帶標註軌跡中生成可讀的評分規則,無需呼叫環境獎勵。在 tau-bench 和 WebShop 上,它將虛假通過率降低近一半,讓每個評判結果都有據可查,適合對智慧體可靠性要求嚴格的場景。

用大模型當裁判,在智慧體評測裡已經是常態。環境獎勵訊號貴、慢、部署時拿不到,於是人們讓第二個大模型打分。問題在於,這種無獎勵的代理裁判往往會被「流暢但不成功」的軌跡騙過去,給出過高評價。論文團隊把這個問題叫做 over-crediting,也就是虛假好評。

從手工規則到自動歸納

現有的自動裁判有兩種路子:要麼像 G-Eval 那樣手工寫評分細則,要麼微調裁判模型的權重。兩者都有短板——手工規則跟不上任務變化,微調權重則讓評判過程變成一個黑盒。RubricForge 換了個思路:不手寫規則,也不用調權重,而是根據少量帶真實標籤的軌跡自動歸納出評判細則。這些細則完全是文字形式,人類可讀,每一次打分都能追溯到具體的評判條目。

具體流程分三步:用反射進化在標註軌跡上迭代優化規則,目標是讓規則與真實環境獎勵的一致性最大化;然後凍結這條規則;最後在留出軌跡上只用一次模型呼叫完成評判,全程不碰環境獎勵。整個優化產物是一段可讀文字,這帶來一個額外好處:任何一條評判結果都可以歸因到具體條目,不像微調模型那樣說不清道不明。

兩個基準任務的實測表現

論文用了一個凍結的 7B 模型同時充當智慧體和裁判,在 tau-bench(從 220 條回滾中取 173 條帶標籤軌跡)和 WebShop(160 條)上做了對照。結果有點意思:RubricForge 的主要提升是「忠誠度」而非整體一致率。它的邊緣優勢在統計上並不顯著,絕對分數校準還略輸泛 G-Eval 裁判,但在最關鍵的一項指標上明顯勝出:虛假通過率在 tau-bench 上從 0.173 降到 0.115,幾乎砍半。

作者認為,在無獎勵測評裡,虛假通過率比總一致率更關鍵——因為一個虛假通過會讓有問題的智慧體上線,而虛假失敗最多隻是重試一次。

另外,在 WebShop 分級結果的排序相關性上,RubricForge 也略高(Spearman 0.410 對 0.370)。實驗中還出現了三次「抓住本來會被放過的失敗案例」,並且沒有發生一次反向誤傷。

這研究對誰有意義

  • 做智慧體評測的團隊:如果被 G-Eval 這類手工規則的不穩定性困擾,這提供了一種低成本自動生成規則的方式。
  • 重視可解釋性的合規場景:評判規則和結果都可追溯,便於審計。
  • 依賴單一裁判模型的部署方:用一個小模型既能做智慧體又能當裁判,省去額外獎勵計算。

當然,侷限也很明顯。目前實驗規模有限,且作者明確提到與泛化模型的差距在統計上不顯著。官方公開的技術細節有限,更多架構差異還得等完整論文。

幾點實用參考

對打算復現或借鑑的人,有幾個要點:第一,RubricForge 的核心價值在降低過度好評率,而非提升普通打分一致性,評價它時別盯錯指標;第二,它輸出的規則是文字,意味著你可以直接檢查裁判到底在按什麼標準打分;第三,使用時注意基礎模型的選擇,7B 模型的表現在不同任務上未必穩定。

總體來說,這更像一次方向驗證:讓評估規則從真實反饋裡「長出來」,比在權重裡調來調去更可控。後續若能在更多工和更大模型上確認穩定的收益,有望成為自動評測基建裡一個可靠的新選項。

AI智慧體評測自動評分子規則大模型評判無獎勵評估可解釋AIRubricForge過度好評

分享

評論

0
0/500 字元

暫無評論

成為第一個評論的人

探索更多

開源專案

Awesome AI for Science: 精選AI科學發現資源

這是一個精選AI工具、庫、論文、數據集和框架的倉庫,覆蓋物理、化學、生物學和材料科學。為研究人員和開發者提供快速掌握AI在科學探索中應用的價值資源。擁有超過1700顆星,採用MIT許可證。

earth2studio: NVIDIA 面向天氣與氣候的深度學習框架

earth2studio 是 NVIDIA 開源的一個深度學習框架,專為天氣和氣候領域設計。它簡化了從研究到部署的完整工作流,提供通用 API 和預訓練模型,幫助研究人員快速構建 AI 驅動的天氣預報和氣候模擬應用,降低開發門檻並加速領域創新。

ai4paper: 面向研究者的開源AI學術平臺

ai4paper是一個面向研究人員的開源AI平臺,聲稱可訪問2.4億篇學術論文。其核心功能包括全文PDF翻譯、AI驅動的文獻搜索和一鍵生成評論,通過網頁界面即可使用,無需安裝插件。該平臺還支持Zotero集成,並可通過小程序訂閱期刊,旨在提升文獻綜述和學術寫作的效率。項目主要使用HTML編寫,採用MIT許可證,截至採集時在GitHub上獲得2739個星標。

openscience: 面向科學研究的開源 AI 工作臺

openscience 是一個由 synthetic-sciences 開源的 AI 工作臺,專為科學研究場景設計。專案使用 TypeScript 構建,在 GitHub 已獲超 3.2k 星標,倉庫包含前後端、CLI 和評估模組。目前公開文件有限,適合對 AI for Science 感興趣的團隊關注。

ResearchStudio: 微軟開源AI協作研究工具

ResearchStudio 是微軟發布的開源 AI 協作工具,旨在支持研究人員從問題提出到最終發表的完整學術旅程。它集成了文獻綜述、實驗設計、數據分析和論文寫作等功能,並利用大型語言模型提供智能建議。該項目特別適合希望優化工作流程的學術研究者。主要程式語言為 Python,採用 MIT 許可證,採集時 GitHub 星標數為 1911。

open-science: 本地優先的AI科研工作臺

open-science 是一個開源、本地優先、模型無關的 AI 研究工作臺,專為科學發現設計。它讓科研人員在自己的機器上執行 AI 輔助流程,不繫結特定模型,兼顧資料隱私與靈活性。