論文の概要: EntropyMoE: Entropy-Aware Sparse Expert Routing for Tokenizer-Free LLMs
- arxiv url: http://arxiv.org/abs/2608.06398v1
- Date: Fri, 31 Jul 2026 15:50:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-10 16:21:25.235239
- Title: EntropyMoE: Entropy-Aware Sparse Expert Routing for Tokenizer-Free LLMs
- Title(参考訳): EntropyMoE:Tokenizer-Free LLMのためのEntropy-Aware Sparse Expert Routing
- Authors: Bo Liu, Muxuab Yu, Yu Zhang, Pengfei Gao, Yongping Zhang,
- Abstract要約: 動的バイトパッチ用に設計されたMixture-of-Experts (MoE)アーキテクチャであるEntropyMoEを紹介する。
MoEはGlobal patch Transformerの高密度フィードフォワードモジュールをTop-K専門家層に置き換える。
実験の結果,EntropyMoEは密度と疎度で一致したベースラインの中で,1バイト当たりの保持ビット数が最少であることが確認された。
- 参考スコア(独自算出の注目度): 7.854557330862945
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent byte-level large language models (LLMs) have made tokenizer-free modeling increasingly competitive by grouping bytes into dynamically sized patches. However, existing byte-patch architectures still apply the same dense feed-forward computation to every patch. This uniform computation cannot adapt model capacity to variations in patch semantics and granularity. We address this limitation with EntropyMoE, a Mixture-of-Experts (MoE) architecture designed for dynamic byte patches. EntropyMoE replaces the dense feed-forward modules in the global patch Transformer with Top-K expert layers. Each dynamic patch serves as the basic unit of expert routing, and its byte coverage determines its contribution to workload accounting. The router selects experts directly from patch entropy, using the same granularity signal that underlies dynamic patch construction to organize sparse computation. Patch entropy and length jointly define the feature space for regulating expert specialization. Experiments show that EntropyMoE achieves the lowest held-out bits-per-byte among matched dense and sparse baselines while maintaining comparable downstream accuracy. These results establish patch entropy as an effective routing coordinate for sparse conditional computation and extend Mixture-of-Experts modeling beyond tokenizer-based representations.
- Abstract(参考訳): 近年,バイトレベルの大規模言語モデル (LLM) は,動的サイズのパッチにバイトをグループ化することによって,トークンフリーなモデリングの競争力を高めている。
しかし、既存のバイトパッチアーキテクチャは、パッチ毎に同じ密度のフィードフォワード計算を適用している。
この一様計算は、パッチのセマンティクスや粒度のバリエーションにモデルキャパシティを適用することはできない。
動的バイトパッチ用に設計されたMixture-of-Experts (MoE)アーキテクチャであるEntropyMoEを用いて,この制限に対処する。
EntropyMoEは、グローバルパッチトランスフォーマーの高密度フィードフォワードモジュールをTop-K専門家層に置き換える。
各動的パッチはエキスパートルーティングの基本単位として機能し、そのバイトカバレッジはワークロードの会計への貢献を決定する。
ルータはパッチエントロピーから直接専門家を選別し、ダイナミックパッチ構築の基盤となる同じ粒度信号を用いてスパース計算を組織する。
パッチエントロピーと長さは専門家の専門化を規制する特徴空間を共同で定義する。
実験により、EntropyMoEは、同等のダウンストリーム精度を維持しながら、一致した密度とスパースベースラインの中で、最小の保持ビット/バイトを実現していることが示された。
これらの結果は、スパース条件計算のための効果的なルーティング座標としてパッチエントロピーを確立し、トークン化子に基づく表現を超えてMixture-of-Expertsモデリングを拡張した。
関連論文リスト
- MoECodec: Image Compression for joint human and machine perception via Mixture-of-Experts [37.49087932678935]
MoECodecはトークン対応の画像圧縮フレームワークで、単一のモデル内で複数のダウンストリームタスクをサポートする。
MoECodecは、Transformerベースの圧縮モデルにおけるFFN層を置き換える。
論文 参考訳(メタデータ) (2026-06-19T01:56:25Z) - ByteFlow: Language Modeling through Adaptive Byte Compression without a Tokenizer [17.871012556931067]
textbfByteFlow Netは、トークン化ツールを完全に取り除く新しい階層アーキテクチャである。
ByteFlow Netは、潜在表現の符号化率に基づいて圧縮駆動セグメンテーションを実行する。
実験により、このチャンキング戦略がかなりのパフォーマンス向上をもたらすことが示されている。
論文 参考訳(メタデータ) (2026-03-03T23:20:31Z) - Routing by Analogy: kNN-Augmented Expert Assignment for Mixture-of-Experts [32.65737144630759]
Mixture-of-Experts (MoE)アーキテクチャは、パラメトリックな"router"を使用して、トークンを専門家のまばらなサブセットにディスパッチすることで、大きな言語モデルを効率的にスケールする。
我々は、類似したケースのメモリから最適な専門家の割り当てを再利用する検索強化ルーティングフレームワークであるkNN-MoEを紹介する。
実験の結果、kNN-MoEはゼロショットベースラインよりも優れており、計算コストのかかる微調整に匹敵することがわかった。
論文 参考訳(メタデータ) (2026-01-05T14:16:11Z) - SliceMoE: Routing Embedding Slices Instead of Tokens for Fine-Grained and Balanced Transformer Scaling [0.0]
Mixture-of-Experts (MoE)レイヤは、トークンをフィードフォワードの専門家のまばらなサブセットにルーティングすることで、トランスフォーマーをスケールする。
我々はトークンの隠れベクトルの連続スライスをルーティングするアーキテクチャであるSliceMoEを紹介する。
WikiText-103言語モデリング、WMT En-De翻訳、および3つのテキスト分類データセットの実験により、SliceMoEは密度の高いベースラインよりも1.7倍高速な推論が可能となった。
論文 参考訳(メタデータ) (2025-10-05T16:57:32Z) - EntroPE: Entropy-Guided Dynamic Patch Encoder for Time Series Forecasting [50.794700596484894]
IntroPE(Entropy-Guided Dynamic Patch)は,条件付きエントロピーによる遷移点を動的に検出する新しい時間情報フレームワークである。
これは、パッチの計算上の利点を維持しながら、時間構造を保存する。
長期予測ベンチマークによる実験では、EntroPEは精度と効率の両方を改善している。
論文 参考訳(メタデータ) (2025-09-30T12:09:56Z) - Re-Densification Meets Cross-Scale Propagation: Real-Time Neural Compression of LiDAR Point Clouds [83.39320394656855]
LiDARポイントクラウドは、様々なアプリケーションに基本的だが、高精度スキャンは、かなりのストレージと送信オーバーヘッドを発生させる。
既存の手法では、非順序の点を階層的なオクツリーやボクセル構造に変換して、密度から疎い予測符号化を行うのが一般的である。
筆者らのフレームワークは2つの軽量モジュールから構成されている。まず、Geometry Re-Densification Moduleがエンコードされたスパース幾何を再認識し、より密なスケールで特徴を抽出し、予測符号化のための特徴を再分離する。
論文 参考訳(メタデータ) (2025-08-28T06:36:10Z) - Mixture-of-Modules: Reinventing Transformers as Dynamic Assemblies of Modules [96.21649779507831]
そこで我々は,Mix-of-modules (MoM) と呼ばれる新しいアーキテクチャを提案する。
MoMは、任意の層がその位置に関係なくトークンを計算することができるという直感によって動機付けられている。
MoMはトランスフォーマーのための統一されたフレームワークを提供するだけでなく、冗長性を減らすための柔軟で学習可能なアプローチを提供する。
論文 参考訳(メタデータ) (2024-07-09T08:50:18Z) - AutoMoE: Heterogeneous Mixture-of-Experts with Adaptive Computation for
Efficient Neural Machine Translation [104.0979785739202]
ニューラルネットワーク翻訳(NMT)タスクにおいて、Mixture-of-Expert(MoE)モデルが最先端のパフォーマンスを得た。
既存のMoEモデルは、ネットワーク全体に同じサイズの専門家が一様に配置される均質な設計を主に考慮している。
計算制約下での不均一なMoEを設計するためのフレームワークであるAutoMoEを開発した。
論文 参考訳(メタデータ) (2022-10-14T05:32:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。