EntropyMoE: 熵感知路由讓無分詞器大模型更省算力

EntropyMoE: 熵感知路由讓無分詞器大模型更省算力

Ryan Mitchell
45
original

位元組級大模型無需分詞器,但計算分配粗放。EntropyMoE 用 patch 熵做 MoE 路由,讓算力跟著資訊複雜度走,在 bits-per-byte 上優於稠密與稀疏基線,為無分詞器模型的高效推理提供了新思路。

大語言模型通常依賴 tokenizer 把文字切成詞元,才能餵給 Transformer。但詞元切分本身帶著很多問題:詞彙表外詞、跨語言不平衡、位元組序列被強行打斷。於是「無分詞器」路線近年來逐漸升溫——直接拿原始位元組當輸入,再用動態 patch 把這些位元組拼成可變長度的單位。位元組級模型因此變得更加自主,也讓不少研究者看到了長尾語言和噪聲場景下的潛力。

不過,這類架構有個明顯的短板:無論 patch 是空白還是複雜語義片段,前饋網路都用同樣的稠密計算去處理。可 patch 的粒度差異很大,有的只有幾個位元組,有的包含數十個甚至更多,資訊密度千差萬別。用固定算力「一刀切」,對資源和模型能力都是一種浪費。

用熵當路由訊號,算力跟著複雜度走

剛剛公開在 arXiv 上的預印本論文提出了 EntropyMoE。它把全域性 patch Transformer 裡的稠密前饋模組換成了 Top-K 專家層,每個動態 patch 成為專家路由的最小單位。路由依據不是額外的 embedding,而是 patch 的 ——也就是構建 patch 時本就在用的粒度訊號。這樣一來,路由決策和 patch 的內在構造邏輯天然對齊,省去了重新學習一套表示的成本。

換句話說,計算資源不再平均分配給每個 patch,而是根據 patch 的資訊量動態調配,複雜的 patch 可以啟用更多專家,簡單的 patch 則花更少的算力。

論文還強調,patch 熵和 patch 長度共同定義了路由的特徵空間,用來調節專家的專業化。而每個 patch 的位元組覆蓋範圍,決定了它在負載核算中的權重。這套設計避免了把單個位元組當作路由單位可能帶來的碎片化問題,也保留了動態 patch 的可解釋性。

實驗結果:bits-per-byte 更低,下游表現不輸

在保留資料上,EntropyMoE 取得了低於所有匹配稠密和稀疏基線的 bits-per-byte,同時下游任務準確率與對照組相當。bits-per-byte 是衡量語言模型壓縮能力的核心指標,更低通常意味著模型能更好地捕捉資料規律。能夠在壓縮效率上勝出,說明熵路由沒有白費算力,反而是真的把計算資源用在了關鍵地方。

具體的工作還包括:

  • 每個動態 patch 作為專家路由的基本單位,位元組覆蓋範圍用於負載核算
  • Top-K 專家層替換稠密 FFN,啟用更稀疏、計算更省
  • 路由直接從 patch 熵出發,無需額外特徵工程或輔助分類頭

對無分詞器路線意味著什麼

這項工作的意義在於把 Mixture-of-Experts 從 tokenizer-based 表示擴充套件到了 tokenizer-free 的位元組 patch 表示。過去 MoE 通常作用在固定詞元上,而位元組級模型沒有天然的詞元邊界,怎麼在動態 patch 裡做路由是個難點。EntropyMoE 告訴你,熵就是一個不錯的座標——它既反映了 patch 的資訊複雜度,也和 patch 的構造過程同源。

對研究者和工程師來說,這是一個值得跟蹤的研究方向。無分詞器模型在長上下文、跨語言和低資源語言場景中有天然優勢,但計算效率一直是軟肋。把稀疏計算的條件和輸入本身的資訊密度掛鉤,這種思路可能比單純堆專家更務實。

目前公開的還只是預印本摘要,具體實現、訓練規模、消融實驗的完整資料都還需要看全文。想在實踐中參考它的人,不妨等正式版本或開原始碼釋出後,再針對自己的使用場景做評估。

EntropyMoE無分詞器大模型混合專家模型位元組級LLMMoE路由熵感知機器學習研究大模型效率稀疏計算

分享

評論

0
0/500 字元

暫無評論

成為第一個評論的人

探索更多

開源專案

Awesome AI for Science: 精選AI科學發現資源

這是一個精選AI工具、庫、論文、數據集和框架的倉庫,覆蓋物理、化學、生物學和材料科學。為研究人員和開發者提供快速掌握AI在科學探索中應用的價值資源。擁有超過1700顆星,採用MIT許可證。

earth2studio: NVIDIA 面向天氣與氣候的深度學習框架

earth2studio 是 NVIDIA 開源的一個深度學習框架,專為天氣和氣候領域設計。它簡化了從研究到部署的完整工作流,提供通用 API 和預訓練模型,幫助研究人員快速構建 AI 驅動的天氣預報和氣候模擬應用,降低開發門檻並加速領域創新。

ai4paper: 面向研究者的開源AI學術平臺

ai4paper是一個面向研究人員的開源AI平臺,聲稱可訪問2.4億篇學術論文。其核心功能包括全文PDF翻譯、AI驅動的文獻搜索和一鍵生成評論,通過網頁界面即可使用,無需安裝插件。該平臺還支持Zotero集成,並可通過小程序訂閱期刊,旨在提升文獻綜述和學術寫作的效率。項目主要使用HTML編寫,採用MIT許可證,截至採集時在GitHub上獲得2739個星標。

ResearchStudio: 微軟開源AI協作研究工具

ResearchStudio 是微軟發布的開源 AI 協作工具,旨在支持研究人員從問題提出到最終發表的完整學術旅程。它集成了文獻綜述、實驗設計、數據分析和論文寫作等功能,並利用大型語言模型提供智能建議。該項目特別適合希望優化工作流程的學術研究者。主要程式語言為 Python,採用 MIT 許可證,採集時 GitHub 星標數為 1911。

open-science: 本地優先的AI科研工作臺

open-science 是一個開源、本地優先、模型無關的 AI 研究工作臺,專為科學發現設計。它讓科研人員在自己的機器上執行 AI 輔助流程,不繫結特定模型,兼顧資料隱私與靈活性。