DASH: 自適應門控提升推理模型蒸餾

DASH: 自適應門控提升推理模型蒸餾

Marcus Chen
63
original

arXiv 新研究提出 DASH,針對 on-policy self-distillation 中監督訊號時間結構利用不足的問題,將區域性差異與序列均值的差距對映為自適應傳播門,動態調整 token 級監督權重。在三個數學推理基準、三個模型規模上均優於標準 OPSD,且無需額外前向傳播。

讓大模型學會推理,正在成為 AI 社羣最熱門的賽道之一。主流做法是 RLVR(可驗證獎勵強化學習),給模型最終答案打分,再讓強化學習去優化。但問題在於,最終答案的反饋太稀疏了——中間推理了十步,只有最後一步得到褒貶,前面九步幾乎得不到有效訊號。

於是有人提出 OPSD(on-policy self-distillation),思路很直接:讓一個更強的教師模型在學生模型生成的過程中,對每一個 token 給出稠密的分佈監督。相當於每一步都有人批改作業,而不是等交卷才給一個總分。聽起來很美好,但新近掛在 arXiv 上的論文《DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models》發現,標準 OPSD 還有一個被忽略的盲區。

標準 OPSD 的盲區

論文指出,標準 OPSD 給每個區域性位置的監督權重是相同的。不管這一步的偏差出現在推理的哪個環節,也不管之前已經積累了多少偏差,模型都用同樣的係數來加權。這在自迴歸生成裡並不合理——同一個偏差大小,可能出現在完全不同的「偏差歷史」之後,它們的含義也應該不同。

打個比方:一個學生剛開始做題時就出錯,和一個做了十步之後才出錯,老師強調的重點應當不一樣。前者可能反映基礎概念沒掌握,後者可能只是區域性筆誤。地方標量無法區分這些時間上下文,標準 OPSD 自然也就做不到自適應。

DASH 的門控機制

DASH 的做法是把每個 token 的區域性蒸餾訊號與整段序列的平均差異做比較,將差距對映成兩個自適應傳播門。這些門再控制反向傳播時的多步聚合強度。簡單說,模型會根據偏差的演化軌跡動態調整每個位置的監督權重,而不再一刀切。

這個設計相當務實。更關鍵的是,DASH 完全複用了 OPSD 已經算好的教師和學生分佈,只是改變了聚合方式。也就是說,不增加任何額外的教師或學生前向傳播,就能獲得更好的監督訊號。這對算力緊張的研究團隊來說,是個很有吸引力的特性。

實驗與結果

論文在三個數學推理基準三個不同規模的模型上進行了對比實驗。結果顯示,DASH 在每一個基準、每一個規模上都優於他們復現的標準 OPSD 基線。雖然不是碾壓性的差距,但「全面佔優」已經能說明時間結構資訊的價值被長期低估了。

值得注意的是,所有對比都建立在「matched vanilla OPSD reruns」上,也就是說基線是認真復現過的,而不是拿一個弱基線來襯托自己。這一點很加分。

論文共 17 頁,4 個圖,9 個表,程式碼已經放出連結。作者來自國內研究機構,但從摘要看不便猜測具體單位。

對研究者和工程師意味著什麼

這項研究對兩類人最有用:一是做LLM 推理優化的研究者,尤其是那些正在 RLVR 和蒸餾之間找平衡的團隊;二是想在有限算力內提升模型數學能力的工程組。DASH 的改動很小,實現門檻低,直接套到現有 OPSD 流程上就能試。

  • 核心貢獻:把時間上下文引入 token 級監督權重,而非增加模型容量。
  • 計算成本:零額外前向傳播,幾乎沒有開銷。
  • 驗證廣度:三個數學推理基準 × 三個模型規模,結論具有一致性。

當然,侷限也很明顯:實驗集中在數學推理任務,程式碼生成、通用對話等場景是否同樣受益尚未驗證。另外,論文沒有給出具體得分提升的絕對數字,只有「全面優於」的相對結論,讀者需要等程式碼或完整論文給出細節。

整體來看,DASH 是那種「小切口、大啟發」的工作。它沒有引入新的架構,只是重新審視了監督訊號在時間維度上的分佈。對於剛剛把推理模型推向主流的研究社羣來說,這種對細節的較真,往往比堆引數更值得關注。

推理模型強化學習自蒸餾RLVRDASH數學推理大模型訓練監督訊號自適應門控OPSD

分享

評論

0
0/500 字元

暫無評論

成為第一個評論的人

探索更多

開源專案

Awesome AI for Science: 精選AI科學發現資源

這是一個精選AI工具、庫、論文、數據集和框架的倉庫,覆蓋物理、化學、生物學和材料科學。為研究人員和開發者提供快速掌握AI在科學探索中應用的價值資源。擁有超過1700顆星,採用MIT許可證。

earth2studio: NVIDIA 面向天氣與氣候的深度學習框架

earth2studio 是 NVIDIA 開源的一個深度學習框架,專為天氣和氣候領域設計。它簡化了從研究到部署的完整工作流,提供通用 API 和預訓練模型,幫助研究人員快速構建 AI 驅動的天氣預報和氣候模擬應用,降低開發門檻並加速領域創新。

ai4paper: 面向研究者的開源AI學術平臺

ai4paper是一個面向研究人員的開源AI平臺,聲稱可訪問2.4億篇學術論文。其核心功能包括全文PDF翻譯、AI驅動的文獻搜索和一鍵生成評論,通過網頁界面即可使用,無需安裝插件。該平臺還支持Zotero集成,並可通過小程序訂閱期刊,旨在提升文獻綜述和學術寫作的效率。項目主要使用HTML編寫,採用MIT許可證,截至採集時在GitHub上獲得2739個星標。

ResearchStudio: 微軟開源AI協作研究工具

ResearchStudio 是微軟發布的開源 AI 協作工具,旨在支持研究人員從問題提出到最終發表的完整學術旅程。它集成了文獻綜述、實驗設計、數據分析和論文寫作等功能,並利用大型語言模型提供智能建議。該項目特別適合希望優化工作流程的學術研究者。主要程式語言為 Python,採用 MIT 許可證,採集時 GitHub 星標數為 1911。

open-science: 本地優先的AI科研工作臺

open-science 是一個開源、本地優先、模型無關的 AI 研究工作臺,專為科學發現設計。它讓科研人員在自己的機器上執行 AI 輔助流程,不繫結特定模型,兼顧資料隱私與靈活性。