DASH: 自适应门控提升推理模型蒸馏

DASH: 自适应门控提升推理模型蒸馏

Marcus Chen
63
original

arXiv 新研究提出 DASH,针对 on-policy self-distillation 中监督信号时间结构利用不足的问题,将局部差异与序列均值的差距映射为自适应传播门,动态调整 token 级监督权重。在三个数学推理基准、三个模型规模上均优于标准 OPSD,且无需额外前向传播。

让大模型学会推理,正在成为 AI 社区最热门的赛道之一。主流做法是 RLVR(可验证奖励强化学习),给模型最终答案打分,再让强化学习去优化。但问题在于,最终答案的反馈太稀疏了——中间推理了十步,只有最后一步得到褒贬,前面九步几乎得不到有效信号。

于是有人提出 OPSD(on-policy self-distillation),思路很直接:让一个更强的教师模型在学生模型生成的过程中,对每一个 token 给出稠密的分布监督。相当于每一步都有人批改作业,而不是等交卷才给一个总分。听起来很美好,但新近挂在 arXiv 上的论文《DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models》发现,标准 OPSD 还有一个被忽略的盲区。

标准 OPSD 的盲区

论文指出,标准 OPSD 给每个局部位置的监督权重是相同的。不管这一步的偏差出现在推理的哪个环节,也不管之前已经积累了多少偏差,模型都用同样的系数来加权。这在自回归生成里并不合理——同一个偏差大小,可能出现在完全不同的“偏差历史”之后,它们的含义也应该不同。

打个比方:一个学生刚开始做题时就出错,和一个做了十步之后才出错,老师强调的重点应当不一样。前者可能反映基础概念没掌握,后者可能只是局部笔误。地方标量无法区分这些时间上下文,标准 OPSD 自然也就做不到自适应。

DASH 的门控机制

DASH 的做法是把每个 token 的局部蒸馏信号与整段序列的平均差异做比较,将差距映射成两个自适应传播门。这些门再控制反向传播时的多步聚合强度。简单说,模型会根据偏差的演化轨迹动态调整每个位置的监督权重,而不再一刀切。

这个设计相当务实。更关键的是,DASH 完全复用了 OPSD 已经算好的教师和学生分布,只是改变了聚合方式。也就是说,不增加任何额外的教师或学生前向传播,就能获得更好的监督信号。这对算力紧张的研究团队来说,是个很有吸引力的特性。

实验与结果

论文在三个数学推理基准三个不同规模的模型上进行了对比实验。结果显示,DASH 在每一个基准、每一个规模上都优于他们复现的标准 OPSD 基线。虽然不是碾压性的差距,但“全面占优”已经能说明时间结构信息的价值被长期低估了。

值得注意的是,所有对比都建立在“matched vanilla OPSD reruns”上,也就是说基线是认真复现过的,而不是拿一个弱基线来衬托自己。这一点很加分。

论文共 17 页,4 个图,9 个表,代码已经放出链接。作者来自国内研究机构,但从摘要看不便猜测具体单位。

对研究者和工程师意味着什么

这项研究对两类人最有用:一是做LLM 推理优化的研究者,尤其是那些正在 RLVR 和蒸馏之间找平衡的团队;二是想在有限算力内提升模型数学能力的工程组。DASH 的改动很小,实现门槛低,直接套到现有 OPSD 流程上就能试。

  • 核心贡献:把时间上下文引入 token 级监督权重,而非增加模型容量。
  • 计算成本:零额外前向传播,几乎没有开销。
  • 验证广度:三个数学推理基准 × 三个模型规模,结论具有一致性。

当然,局限也很明显:实验集中在数学推理任务,代码生成、通用对话等场景是否同样受益尚未验证。另外,论文没有给出具体得分提升的绝对数字,只有“全面优于”的相对结论,读者需要等代码或完整论文给出细节。

整体来看,DASH 是那种“小切口、大启发”的工作。它没有引入新的架构,只是重新审视了监督信号在时间维度上的分布。对于刚刚把推理模型推向主流的研究社区来说,这种对细节的较真,往往比堆参数更值得关注。

推理模型强化学习自蒸馏RLVRDASH数学推理大模型训练监督信号自适应门控OPSD

分享

评论

0
0/500 字符

暂无评论

成为第一个评论的人

探索更多

开源项目

Awesome AI for Science:精选 AI 科学发现资源

这是一个精选 AI 工具、库、论文、数据集和框架的仓库,覆盖物理、化学、生物学和材料科学。为研究人员和开发者提供快速掌握 AI 在科学探索中应用的价值资源。拥有超过1700颗星,采用 MIT 许可证。

earth2studio: NVIDIA 面向天气与气候的深度学习框架

earth2studio 是 NVIDIA 开源的一个深度学习框架,专为天气和气候领域设计。它简化了从研究到部署的完整工作流,提供通用 API 和预训练模型,帮助研究人员快速构建 AI 驱动的天气预报和气候模拟应用,降低开发门槛并加速领域创新。

ai4paper:面向研究者的开源 AI 学术平台

ai4paper 是一个面向研究人员的开源 AI 平台,声称可访问2.4亿篇学术论文。其核心功能包括全文 PDF 翻译、AI 驱动的文献搜索和一键生成评论,通过网页界面即可使用,无需安装插件。该平台还支持 Zotero 集成,并可通过小程序订阅期刊,旨在提升文献综述和学术写作的效率。项目主要使用 HTML 编写,采用 MIT 许可证,截至采集时在 GitHub 上获得2739个星标。

ResearchStudio:微软开源 AI 协作研究工具

ResearchStudio 是微软发布的开源 AI 协作工具,旨在支持研究人员从问题提出到最终发表的完整学术旅程。它集成了文献综述、实验设计、数据分析和论文写作等功能,并利用大型语言模型提供智能建议。该项目特别适合希望优化工作流程的学术研究者。主要编程语言为 Python,采用 MIT 许可证,采集时 GitHub 星标数为 1911。

open-science: 本地优先的AI科研工作台

open-science 是一个开源、本地优先、模型无关的 AI 研究工作台,专为科学发现设计。它让科研人员在自己的机器上运行 AI 辅助流程,不绑定特定模型,兼顾数据隐私与灵活性。