讓大模型學會推理,正在成為 AI 社羣最熱門的賽道之一。主流做法是 RLVR(可驗證獎勵強化學習),給模型最終答案打分,再讓強化學習去優化。但問題在於,最終答案的反饋太稀疏了——中間推理了十步,只有最後一步得到褒貶,前面九步幾乎得不到有效訊號。
於是有人提出 OPSD(on-policy self-distillation),思路很直接:讓一個更強的教師模型在學生模型生成的過程中,對每一個 token 給出稠密的分佈監督。相當於每一步都有人批改作業,而不是等交卷才給一個總分。聽起來很美好,但新近掛在 arXiv 上的論文《DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models》發現,標準 OPSD 還有一個被忽略的盲區。
標準 OPSD 的盲區
論文指出,標準 OPSD 給每個區域性位置的監督權重是相同的。不管這一步的偏差出現在推理的哪個環節,也不管之前已經積累了多少偏差,模型都用同樣的係數來加權。這在自迴歸生成裡並不合理——同一個偏差大小,可能出現在完全不同的「偏差歷史」之後,它們的含義也應該不同。
打個比方:一個學生剛開始做題時就出錯,和一個做了十步之後才出錯,老師強調的重點應當不一樣。前者可能反映基礎概念沒掌握,後者可能只是區域性筆誤。地方標量無法區分這些時間上下文,標準 OPSD 自然也就做不到自適應。
DASH 的門控機制
DASH 的做法是把每個 token 的區域性蒸餾訊號與整段序列的平均差異做比較,將差距對映成兩個自適應傳播門。這些門再控制反向傳播時的多步聚合強度。簡單說,模型會根據偏差的演化軌跡動態調整每個位置的監督權重,而不再一刀切。
這個設計相當務實。更關鍵的是,DASH 完全複用了 OPSD 已經算好的教師和學生分佈,只是改變了聚合方式。也就是說,不增加任何額外的教師或學生前向傳播,就能獲得更好的監督訊號。這對算力緊張的研究團隊來說,是個很有吸引力的特性。
實驗與結果
論文在三個數學推理基準、三個不同規模的模型上進行了對比實驗。結果顯示,DASH 在每一個基準、每一個規模上都優於他們復現的標準 OPSD 基線。雖然不是碾壓性的差距,但「全面佔優」已經能說明時間結構資訊的價值被長期低估了。
值得注意的是,所有對比都建立在「matched vanilla OPSD reruns」上,也就是說基線是認真復現過的,而不是拿一個弱基線來襯托自己。這一點很加分。
論文共 17 頁,4 個圖,9 個表,程式碼已經放出連結。作者來自國內研究機構,但從摘要看不便猜測具體單位。
對研究者和工程師意味著什麼
這項研究對兩類人最有用:一是做LLM 推理優化的研究者,尤其是那些正在 RLVR 和蒸餾之間找平衡的團隊;二是想在有限算力內提升模型數學能力的工程組。DASH 的改動很小,實現門檻低,直接套到現有 OPSD 流程上就能試。
- 核心貢獻:把時間上下文引入 token 級監督權重,而非增加模型容量。
- 計算成本:零額外前向傳播,幾乎沒有開銷。
- 驗證廣度:三個數學推理基準 × 三個模型規模,結論具有一致性。
當然,侷限也很明顯:實驗集中在數學推理任務,程式碼生成、通用對話等場景是否同樣受益尚未驗證。另外,論文沒有給出具體得分提升的絕對數字,只有「全面優於」的相對結論,讀者需要等程式碼或完整論文給出細節。
整體來看,DASH 是那種「小切口、大啟發」的工作。它沒有引入新的架構,只是重新審視了監督訊號在時間維度上的分佈。對於剛剛把推理模型推向主流的研究社羣來說,這種對細節的較真,往往比堆引數更值得關注。











評論
暫無評論
成為第一個評論的人