大语言模型通常依赖 tokenizer 把文本切成词元,才能喂给 Transformer。但词元切分本身带着很多问题:词汇表外词、跨语言不平衡、字节序列被强行打断。于是“无分词器”路线近年来逐渐升温——直接拿原始字节当输入,再用动态 patch 把这些字节拼成可变长度的单位。字节级模型因此变得更加自主,也让不少研究者看到了长尾语言和噪声场景下的潜力。
不过,这类架构有个明显的短板:无论 patch 是空白还是复杂语义片段,前馈网络都用同样的稠密计算去处理。可 patch 的粒度差异很大,有的只有几个字节,有的包含数十个甚至更多,信息密度千差万别。用固定算力“一刀切”,对资源和模型能力都是一种浪费。
用熵当路由信号,算力跟着复杂度走
刚刚公开在 arXiv 上的预印本论文提出了 EntropyMoE。它把全局 patch Transformer 里的稠密前馈模块换成了 Top-K 专家层,每个动态 patch 成为专家路由的最小单位。路由依据不是额外的 embedding,而是 patch 的 熵——也就是构建 patch 时本就在用的粒度信号。这样一来,路由决策和 patch 的内在构造逻辑天然对齐,省去了重新学习一套表示的成本。
换句话说,计算资源不再平均分配给每个 patch,而是根据 patch 的信息量动态调配,复杂的 patch 可以激活更多专家,简单的 patch 则花更少的算力。
论文还强调,patch 熵和 patch 长度共同定义了路由的特征空间,用来调节专家的专业化。而每个 patch 的字节覆盖范围,决定了它在负载核算中的权重。这套设计避免了把单个字节当作路由单位可能带来的碎片化问题,也保留了动态 patch 的可解释性。
实验结果:bits-per-byte 更低,下游表现不输
在保留数据上,EntropyMoE 取得了低于所有匹配稠密和稀疏基线的 bits-per-byte,同时下游任务准确率与对照组相当。bits-per-byte 是衡量语言模型压缩能力的核心指标,更低通常意味着模型能更好地捕捉数据规律。能够在压缩效率上胜出,说明熵路由没有白费算力,反而是真的把计算资源用在了关键地方。
具体的工作还包括:
- 每个动态 patch 作为专家路由的基本单位,字节覆盖范围用于负载核算
- Top-K 专家层替换稠密 FFN,激活更稀疏、计算更省
- 路由直接从 patch 熵出发,无需额外特征工程或辅助分类头
对无分词器路线意味着什么
这项工作的意义在于把 Mixture-of-Experts 从 tokenizer-based 表示扩展到了 tokenizer-free 的字节 patch 表示。过去 MoE 通常作用在固定词元上,而字节级模型没有天然的词元边界,怎么在动态 patch 里做路由是个难点。EntropyMoE 告诉你,熵就是一个不错的坐标——它既反映了 patch 的信息复杂度,也和 patch 的构造过程同源。
对研究者和工程师来说,这是一个值得跟踪的研究方向。无分词器模型在长上下文、跨语言和低资源语言场景中有天然优势,但计算效率一直是软肋。把稀疏计算的条件和输入本身的信息密度挂钩,这种思路可能比单纯堆专家更务实。
目前公开的还只是预印本摘要,具体实现、训练规模、消融实验的完整数据都还需要看全文。想在实践中参考它的人,不妨等正式版本或开源代码发布后,再针对自己的使用场景做评估。











评论
暂无评论
成为第一个评论的人