EntropyMoE: 熵感知路由让无分词器大模型更省算力

EntropyMoE: 熵感知路由让无分词器大模型更省算力

Ryan Mitchell
45
original

字节级大模型无需分词器,但计算分配粗放。EntropyMoE 用 patch 熵做 MoE 路由,让算力跟着信息复杂度走,在 bits-per-byte 上优于稠密与稀疏基线,为无分词器模型的高效推理提供了新思路。

大语言模型通常依赖 tokenizer 把文本切成词元,才能喂给 Transformer。但词元切分本身带着很多问题:词汇表外词、跨语言不平衡、字节序列被强行打断。于是“无分词器”路线近年来逐渐升温——直接拿原始字节当输入,再用动态 patch 把这些字节拼成可变长度的单位。字节级模型因此变得更加自主,也让不少研究者看到了长尾语言和噪声场景下的潜力。

不过,这类架构有个明显的短板:无论 patch 是空白还是复杂语义片段,前馈网络都用同样的稠密计算去处理。可 patch 的粒度差异很大,有的只有几个字节,有的包含数十个甚至更多,信息密度千差万别。用固定算力“一刀切”,对资源和模型能力都是一种浪费。

用熵当路由信号,算力跟着复杂度走

刚刚公开在 arXiv 上的预印本论文提出了 EntropyMoE。它把全局 patch Transformer 里的稠密前馈模块换成了 Top-K 专家层,每个动态 patch 成为专家路由的最小单位。路由依据不是额外的 embedding,而是 patch 的 ——也就是构建 patch 时本就在用的粒度信号。这样一来,路由决策和 patch 的内在构造逻辑天然对齐,省去了重新学习一套表示的成本。

换句话说,计算资源不再平均分配给每个 patch,而是根据 patch 的信息量动态调配,复杂的 patch 可以激活更多专家,简单的 patch 则花更少的算力。

论文还强调,patch 熵和 patch 长度共同定义了路由的特征空间,用来调节专家的专业化。而每个 patch 的字节覆盖范围,决定了它在负载核算中的权重。这套设计避免了把单个字节当作路由单位可能带来的碎片化问题,也保留了动态 patch 的可解释性。

实验结果:bits-per-byte 更低,下游表现不输

在保留数据上,EntropyMoE 取得了低于所有匹配稠密和稀疏基线的 bits-per-byte,同时下游任务准确率与对照组相当。bits-per-byte 是衡量语言模型压缩能力的核心指标,更低通常意味着模型能更好地捕捉数据规律。能够在压缩效率上胜出,说明熵路由没有白费算力,反而是真的把计算资源用在了关键地方。

具体的工作还包括:

  • 每个动态 patch 作为专家路由的基本单位,字节覆盖范围用于负载核算
  • Top-K 专家层替换稠密 FFN,激活更稀疏、计算更省
  • 路由直接从 patch 熵出发,无需额外特征工程或辅助分类头

对无分词器路线意味着什么

这项工作的意义在于把 Mixture-of-Experts 从 tokenizer-based 表示扩展到了 tokenizer-free 的字节 patch 表示。过去 MoE 通常作用在固定词元上,而字节级模型没有天然的词元边界,怎么在动态 patch 里做路由是个难点。EntropyMoE 告诉你,熵就是一个不错的坐标——它既反映了 patch 的信息复杂度,也和 patch 的构造过程同源。

对研究者和工程师来说,这是一个值得跟踪的研究方向。无分词器模型在长上下文、跨语言和低资源语言场景中有天然优势,但计算效率一直是软肋。把稀疏计算的条件和输入本身的信息密度挂钩,这种思路可能比单纯堆专家更务实。

目前公开的还只是预印本摘要,具体实现、训练规模、消融实验的完整数据都还需要看全文。想在实践中参考它的人,不妨等正式版本或开源代码发布后,再针对自己的使用场景做评估。

EntropyMoE无分词器大模型混合专家模型字节级LLMMoE路由熵感知机器学习研究大模型效率稀疏计算

分享

评论

0
0/500 字符

暂无评论

成为第一个评论的人

探索更多

开源项目

Awesome AI for Science:精选 AI 科学发现资源

这是一个精选 AI 工具、库、论文、数据集和框架的仓库,覆盖物理、化学、生物学和材料科学。为研究人员和开发者提供快速掌握 AI 在科学探索中应用的价值资源。拥有超过1700颗星,采用 MIT 许可证。

earth2studio: NVIDIA 面向天气与气候的深度学习框架

earth2studio 是 NVIDIA 开源的一个深度学习框架,专为天气和气候领域设计。它简化了从研究到部署的完整工作流,提供通用 API 和预训练模型,帮助研究人员快速构建 AI 驱动的天气预报和气候模拟应用,降低开发门槛并加速领域创新。

ai4paper:面向研究者的开源 AI 学术平台

ai4paper 是一个面向研究人员的开源 AI 平台,声称可访问2.4亿篇学术论文。其核心功能包括全文 PDF 翻译、AI 驱动的文献搜索和一键生成评论,通过网页界面即可使用,无需安装插件。该平台还支持 Zotero 集成,并可通过小程序订阅期刊,旨在提升文献综述和学术写作的效率。项目主要使用 HTML 编写,采用 MIT 许可证,截至采集时在 GitHub 上获得2739个星标。

ResearchStudio:微软开源 AI 协作研究工具

ResearchStudio 是微软发布的开源 AI 协作工具,旨在支持研究人员从问题提出到最终发表的完整学术旅程。它集成了文献综述、实验设计、数据分析和论文写作等功能,并利用大型语言模型提供智能建议。该项目特别适合希望优化工作流程的学术研究者。主要编程语言为 Python,采用 MIT 许可证,采集时 GitHub 星标数为 1911。

open-science: 本地优先的AI科研工作台

open-science 是一个开源、本地优先、模型无关的 AI 研究工作台,专为科学发现设计。它让科研人员在自己的机器上运行 AI 辅助流程,不绑定特定模型,兼顾数据隐私与灵活性。