大語言模型通常依賴 tokenizer 把文字切成詞元,才能餵給 Transformer。但詞元切分本身帶著很多問題:詞彙表外詞、跨語言不平衡、位元組序列被強行打斷。於是「無分詞器」路線近年來逐漸升溫——直接拿原始位元組當輸入,再用動態 patch 把這些位元組拼成可變長度的單位。位元組級模型因此變得更加自主,也讓不少研究者看到了長尾語言和噪聲場景下的潛力。
不過,這類架構有個明顯的短板:無論 patch 是空白還是複雜語義片段,前饋網路都用同樣的稠密計算去處理。可 patch 的粒度差異很大,有的只有幾個位元組,有的包含數十個甚至更多,資訊密度千差萬別。用固定算力「一刀切」,對資源和模型能力都是一種浪費。
用熵當路由訊號,算力跟著複雜度走
剛剛公開在 arXiv 上的預印本論文提出了 EntropyMoE。它把全域性 patch Transformer 裡的稠密前饋模組換成了 Top-K 專家層,每個動態 patch 成為專家路由的最小單位。路由依據不是額外的 embedding,而是 patch 的 熵——也就是構建 patch 時本就在用的粒度訊號。這樣一來,路由決策和 patch 的內在構造邏輯天然對齊,省去了重新學習一套表示的成本。
換句話說,計算資源不再平均分配給每個 patch,而是根據 patch 的資訊量動態調配,複雜的 patch 可以啟用更多專家,簡單的 patch 則花更少的算力。
論文還強調,patch 熵和 patch 長度共同定義了路由的特徵空間,用來調節專家的專業化。而每個 patch 的位元組覆蓋範圍,決定了它在負載核算中的權重。這套設計避免了把單個位元組當作路由單位可能帶來的碎片化問題,也保留了動態 patch 的可解釋性。
實驗結果:bits-per-byte 更低,下游表現不輸
在保留資料上,EntropyMoE 取得了低於所有匹配稠密和稀疏基線的 bits-per-byte,同時下游任務準確率與對照組相當。bits-per-byte 是衡量語言模型壓縮能力的核心指標,更低通常意味著模型能更好地捕捉資料規律。能夠在壓縮效率上勝出,說明熵路由沒有白費算力,反而是真的把計算資源用在了關鍵地方。
具體的工作還包括:
- 每個動態 patch 作為專家路由的基本單位,位元組覆蓋範圍用於負載核算
- Top-K 專家層替換稠密 FFN,啟用更稀疏、計算更省
- 路由直接從 patch 熵出發,無需額外特徵工程或輔助分類頭
對無分詞器路線意味著什麼
這項工作的意義在於把 Mixture-of-Experts 從 tokenizer-based 表示擴充套件到了 tokenizer-free 的位元組 patch 表示。過去 MoE 通常作用在固定詞元上,而位元組級模型沒有天然的詞元邊界,怎麼在動態 patch 裡做路由是個難點。EntropyMoE 告訴你,熵就是一個不錯的座標——它既反映了 patch 的資訊複雜度,也和 patch 的構造過程同源。
對研究者和工程師來說,這是一個值得跟蹤的研究方向。無分詞器模型在長上下文、跨語言和低資源語言場景中有天然優勢,但計算效率一直是軟肋。把稀疏計算的條件和輸入本身的資訊密度掛鉤,這種思路可能比單純堆專家更務實。
目前公開的還只是預印本摘要,具體實現、訓練規模、消融實驗的完整資料都還需要看全文。想在實踐中參考它的人,不妨等正式版本或開原始碼釋出後,再針對自己的使用場景做評估。











評論
暫無評論
成為第一個評論的人