EntropyMoE:パッチのエントロピーで無トークナイザーLLMを効率化

EntropyMoE:パッチのエントロピーで無トークナイザーLLMを効率化

Ryan Mitchell
45
original

トークナイザーを使わないバイトレベルLLMの弱点は、計算配分の粗さにある。EntropyMoEはパッチのエントロピーでMoEルーティングを行い、bits-per-byteで稠密・疎なベースラインを上回る。無トークナイザー路線の効率化に新しい視点を提示した。

大規模言語モデルは、テキストを「トークン」に切り分けてからTransformerに入力するのが一般的だ。ただ、トークナイザーには語彙外の単語や、言語によってトークン化の効率が異なる問題、バイト列を無理やり分断してしまう欠陥がある。最近はこの仕組みを捨てて、生のバイト列を直接入力にする無トークナイザー路線がじわじわ注目されている。入力は動的な長さの「パッチ」にまとめられ、モデル自身がテキストの区切り方を学ぶ。

このアプローチには利点が多い一方、欠点もある。パッチが空白のような単純なものか、複雑な意味を持ったまとまりかに関係なく、フィードフォワード層は同じ密な計算を実行してしまう。パッチは数バイトしかないこともあれば、数十バイト以上の情報を含むこともあり、情報密度はまちまち。固定の計算量で処理するのは、資源の使い方としてどう考えてももったいない。

ルーティングの合図は「エントロピー」

arXivに公開されたプレプリントで提案されたEntropyMoEは、この無駄をMixture-of-Expertsで解消する。具体的には、グローバルパッチTransformerの中にある密なFFNを、Top-Kエキスパート層に置き換える。

ルーティングの最小単位は動的パッチで、信号に使うのは追加のembeddingではなく、パッチを作るときに計算したエントロピー。パッチにどれだけ情報が詰まっているかを、そのまま専門家ネットワークの選び分けに使うわけだ。

計算資源を各パッチに均等に振り分けるのをやめ、情報量に応じて配分する。複雑なパッチには多くのエキスパートを割り当て、単純なパッチには少ない計算で済ませる。

ここがポイントで、パッチのエントロピーとパッチ長を組み合わせてルーティングの特徴空間を作る。パッチがカバーするバイト範囲が負荷計算の重みになり、バイト単位に細分化した際の断片化を防ぎつつ、動的パッチの解釈もしやすくしている。

結果はbits-per-byteに表れている

論文の実験は、EntropyMoEがマッチする密なモデルと疎なモデルのベースラインを、すべて下回るbits-per-byteを達成したと報告する。下流タスクの精度は従来と同じ水準を保っている。bits-per-byteはモデルの圧縮効率を示す指標で、低いほどデータ規則性をうまく捉えている。

具体的な工夫は次の3点にまとめられる。

  • 動的パッチごとにTop-Kエキスパートを選び、バイト範囲に応じて負荷を計算
  • 密なFFNを疎なMoE層へ置き換え、活性化する専門家を限定
  • ルーティングにパッチのエントロピーのみを使い、追加の分類ヘッドが不要

エントロピーという「パッチ構築と同源」の量をルーティングに使うことで、新たに表現を学習するコストを避けつつ、計算の重点を情報量の多いパッチへ移している。この設計はかなり理にかなっている。

無トークナイザー型LLMの今後を占う

MoEの研究はこれまで、固定トークンを単位にすることが多かった。一方で無トークナイザー型にはトークン境界が存在せず、動的パッチ上でどうルーティングするかが課題だった。EntropyMoEの「エントロピー」という解は、長いコンテキストや低リソース言語を扱いたい研究・実務の現場に刺さる。

ただし、現時点で公開されているのはプレプリントの要旨レベル。実装の詳細や訓練規模、アブレーションの完全なデータはまだ確認できない。実際の導入を視野に入れるなら、正式版かコードが公開されてから、自分の扱うデータ領域で評価するのが良さそうだ。

EntropyMoE無トークナイザーLLM混合専門家モデルバイトレベル言語モデルエントロピールーティング大規模言語モデル効率化疎な計算動的パッチ機械学習論文arXivプレプリント

共有

コメント

0
0/500 文字

コメントはまだありません

最初のコメントを書きましょう

もっと見る

オープンソース代替

Awesome AI for Science:AIによる科学発見の厳選リソース

これは、物理学・化学・生物学・材料科学を対象とした、AIツール、ライブラリ、論文、データセット、フレームワークの厳選リポジトリです。研究者や開発者が科学探索におけるAI活用の価値を迅速に把握できるリソースを提供します。1,700以上のスターを獲得し、MITライセンスを採用しています。

earth2studio: NVIDIAによる天気・気候向けディープラーニングフレームワーク

earth2studioは、NVIDIAがオープンソースで公開している、天気と気候の分野に特化したディープラーニングフレームワークです。研究からデプロイまでの完全なワークフローを簡素化し、汎用APIと事前学習済みモデルを提供することで、研究者がAIを活用した天気予報や気候シミュレーションアプリケーションを迅速に構築できるようにし、開発のハードルを下げて分野のイノベーションを加速します。

ai4paper:研究者向けのオープンソースAI学術プラットフォーム

ai4paper は研究者向けのオープンソースAIプラットフォームであり、2.4億件の学術論文にアクセスできると謳っています。主な機能には、全文PDF翻訳、AI駆動の文献検索、ワンクリックでのコメント生成が含まれます。ウェブインターフェースで利用でき、プラグインのインストールは不要です。また、Zotero統合をサポートし、ミニアプリでジャーナルを購読することもでき、文献レビューと学術執筆の効率向上を目指しています。このプロジェクトは主にHTMLで書かれており、MITライセンスを採用し、収集時点でGitHubで2739スターを獲得しています。

ResearchStudio:マイクロソフトが公開したオープンソースのAI共同研究ツール

ResearchStudioは、マイクロソフトが公開したオープンソースのAI共同研究ツールで、研究者が問題提起から最終的な論文発表に至るまでの学術研究の全プロセスを支援することを目的としています。文献レビュー、実験計画、データ分析、論文執筆などの機能を統合し、大規模言語モデルを活用してスマートな提案を提供します。このプロジェクトは、ワークフローの最適化を希望する学術研究者に特に適しています。主要なプログラミング言語はPythonで、MITライセンスを採用しており、収集時点でのGitHubスター数は1911です。

open-science: ローカル優先のAI研究ワークベンチ

open-science は、科学発見のために設計された、オープンソースでローカル優先、モデル非依存のAI研究ワークベンチです。研究者は自分のマシンでAI支援プロセスを実行でき、特定のモデルに縛られず、データプライバシーと柔軟性を両立できます。