让大模型学会推理,正在成为 AI 社区最热门的赛道之一。主流做法是 RLVR(可验证奖励强化学习),给模型最终答案打分,再让强化学习去优化。但问题在于,最终答案的反馈太稀疏了——中间推理了十步,只有最后一步得到褒贬,前面九步几乎得不到有效信号。
于是有人提出 OPSD(on-policy self-distillation),思路很直接:让一个更强的教师模型在学生模型生成的过程中,对每一个 token 给出稠密的分布监督。相当于每一步都有人批改作业,而不是等交卷才给一个总分。听起来很美好,但新近挂在 arXiv 上的论文《DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models》发现,标准 OPSD 还有一个被忽略的盲区。
标准 OPSD 的盲区
论文指出,标准 OPSD 给每个局部位置的监督权重是相同的。不管这一步的偏差出现在推理的哪个环节,也不管之前已经积累了多少偏差,模型都用同样的系数来加权。这在自回归生成里并不合理——同一个偏差大小,可能出现在完全不同的“偏差历史”之后,它们的含义也应该不同。
打个比方:一个学生刚开始做题时就出错,和一个做了十步之后才出错,老师强调的重点应当不一样。前者可能反映基础概念没掌握,后者可能只是局部笔误。地方标量无法区分这些时间上下文,标准 OPSD 自然也就做不到自适应。
DASH 的门控机制
DASH 的做法是把每个 token 的局部蒸馏信号与整段序列的平均差异做比较,将差距映射成两个自适应传播门。这些门再控制反向传播时的多步聚合强度。简单说,模型会根据偏差的演化轨迹动态调整每个位置的监督权重,而不再一刀切。
这个设计相当务实。更关键的是,DASH 完全复用了 OPSD 已经算好的教师和学生分布,只是改变了聚合方式。也就是说,不增加任何额外的教师或学生前向传播,就能获得更好的监督信号。这对算力紧张的研究团队来说,是个很有吸引力的特性。
实验与结果
论文在三个数学推理基准、三个不同规模的模型上进行了对比实验。结果显示,DASH 在每一个基准、每一个规模上都优于他们复现的标准 OPSD 基线。虽然不是碾压性的差距,但“全面占优”已经能说明时间结构信息的价值被长期低估了。
值得注意的是,所有对比都建立在“matched vanilla OPSD reruns”上,也就是说基线是认真复现过的,而不是拿一个弱基线来衬托自己。这一点很加分。
论文共 17 页,4 个图,9 个表,代码已经放出链接。作者来自国内研究机构,但从摘要看不便猜测具体单位。
对研究者和工程师意味着什么
这项研究对两类人最有用:一是做LLM 推理优化的研究者,尤其是那些正在 RLVR 和蒸馏之间找平衡的团队;二是想在有限算力内提升模型数学能力的工程组。DASH 的改动很小,实现门槛低,直接套到现有 OPSD 流程上就能试。
- 核心贡献:把时间上下文引入 token 级监督权重,而非增加模型容量。
- 计算成本:零额外前向传播,几乎没有开销。
- 验证广度:三个数学推理基准 × 三个模型规模,结论具有一致性。
当然,局限也很明显:实验集中在数学推理任务,代码生成、通用对话等场景是否同样受益尚未验证。另外,论文没有给出具体得分提升的绝对数字,只有“全面优于”的相对结论,读者需要等代码或完整论文给出细节。
整体来看,DASH 是那种“小切口、大启发”的工作。它没有引入新的架构,只是重新审视了监督信号在时间维度上的分布。对于刚刚把推理模型推向主流的研究社区来说,这种对细节的较真,往往比堆参数更值得关注。











评论
暂无评论
成为第一个评论的人