論文の概要: The Evolution of Mixture-of-Experts Architectures in Large Language Models: Routing, Topology, Load Balancing, and Expert Parallelism
- arxiv url: http://arxiv.org/abs/2608.08650v1
- Date: Sun, 09 Aug 2026 11:46:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.908023
- Title: The Evolution of Mixture-of-Experts Architectures in Large Language Models: Routing, Topology, Load Balancing, and Expert Parallelism
- Title(参考訳): 大規模言語モデルにおけるMixture-of-Expertsアーキテクチャの進化:ルーティング、トポロジ、ロードバランシング、エキスパート並列性
- Abstract要約: この調査は、主要な論文、公式な技術報告、および現代のMixture-of-Expertsシステムを組織化するための以前の調査を合成する。
アーキテクチャ上のマイルストーンを,8世代ではなく,6つのメインライン開発と2つのブランチを持つ依存性グラフとして記述する。
我々は、等予算事前学習実験、品質とシステムメトリクス、オープンリサーチの質問で締めくくります。
- 参考スコア(独自算出の注目度): 3.3534582603188476
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Mixture-of-Experts models increase parameter capacity while keeping the computation activated by each token bounded, but their architectural evolution cannot be explained by a chronological list of model releases alone. This technical survey synthesizes primary papers, official technical reports, and prior surveys to organize modern Mixture-of-Experts systems along five coupled dimensions: expert granularity, expert topology, routing freedom, the scope of load balancing, and execution structure. We describe eight architectural milestones as a dependency graph with six mainline developments and two orthogonal branches, rather than as eight successive generations. We then analyze individual systems through four control planes: Expert Topology, Routing, Balance, and Expert Parallelism. These planes specify which experts exist, which experts process each token, how aggregate load is controlled, and how selected computation is mapped onto physical devices. The framework connects algorithmic choices such as Top-k routing, shared experts, fine-grained experts, and dynamic expert composition with systems concerns including token dispatch, device placement, all-to-all communication, and communication-computation overlap. We conclude with equal-budget pretraining experiments, quality and systems metrics, and open research questions. The main trend is a shift from merely activating more sparse parameters toward decoupling semantic routing, computational budgets, and physical execution.
- Abstract(参考訳): Mixture-of-Expertsモデルは、各トークンによって活性化された計算を保ちながらパラメータ容量を増加させるが、それらのアーキテクチャの進化は、モデルリリースの時系列リストだけでは説明できない。
この技術調査は、エキスパートの粒度、専門家のトポロジ、ルーティングの自由、ロードバランシングのスコープ、実行構造という5つの複合次元に沿って、モダンなMixture-of-Expertsシステムを組織化するための、主要な論文、公式な技術レポート、以前の調査を合成する。
8つのアーキテクチャ上のマイルストーンを,6つのメインライン開発と2つの直交枝を持つ依存性グラフとして記述する。
次に、エキスパートトポロジ、ルーティング、バランス、エキスパート並列性という4つのコントロールプレーンを通じて、個々のシステムを分析します。
これらのプレーンは、どの専門家が存在するか、どの専門家がトークンを処理するか、どのように集約された負荷を制御するか、選択された計算が物理的なデバイスにどのようにマッピングされるかを指定する。
このフレームワークは、Top-kルーティング、共有専門家、きめ細かい専門家、動的エキスパート構成などのアルゴリズムの選択を、トークンディスパッチ、デバイス配置、オール・ツー・オール通信、通信-計算オーバーラップといったシステムの懸念と結びつけている。
我々は、等予算事前学習実験、品質とシステムメトリクス、オープンリサーチの質問で締めくくります。
主なトレンドは、単にスパースパラメータの活性化から、セマンティックルーティングの分離、計算予算、物理実行へのシフトである。
関連論文リスト
- Unifying Graph Neural Networks Through a Common Layer Equation [75.88127999406392]
7つのコンポーネントを通して被覆されたアーキテクチャを表現する共通層方程式を導入する。
中央の因子化は、伝達銀行によってエンコードされた情報と、メッセージマップによってエンコードされた動きとを分離する。
この統合を明確化し、標準層とコンポーネント割り当ての作業的削減を通じて、チェック可能にする。
論文 参考訳(メタデータ) (2026-08-17T04:37:59Z) - Agentic Designer: Progressive Multi-Agent Collaboration for Structure-Aware Interior Layout Generation [84.5255199507027]
Agentic Designerは、構造を意識した内部レイアウト生成を反復的かつ制約的に検証された決定プロセスとして定式化する、プログレッシブなフレームワークである。
提案、検証、合成、調整のモジュールステージにレイアウトを分解することで、フレームワークは3つの特殊エージェント、ジェネレータ、評価器、精錬器を協調する。
この機構は、各配置がコミットされる前に段階的に幾何的検証と補正を行い、エラーの蓄積を防止する。
論文 参考訳(メタデータ) (2026-07-23T02:46:11Z) - From Prompt to Process: a Process Taxonomy and Comparative Assessment of Frameworks Supporting AI Software Development Agents [0.0]
AI機能をプロセスに変換する運用フレームワークに重点を置いています。
仕様駆動による完全な軽量な開発、エージェント駆動のアジャイル計画、エージェント上のコンテキストエンジニアリング、ワークツリーの分離とレビュー、レガシーシステムからの運用仕様の回復。
私たちの中心的な貢献は、仕様、コンテキスト、役割、実行、バリデーション、ポータビリティという6次元プロセスの分類です。
論文 参考訳(メタデータ) (2026-06-03T14:49:15Z) - Architectural Design Decisions in AI Agent Harnesses [1.8222732878503212]
本稿では,70件の公開エージェントシステムプロジェクトについて,プロトコル誘導型,ソースベースによる実証研究を行った。
5つの設計次元(サブエージェントアーキテクチャ、コンテキスト管理、ツールシステム、安全機構、オーケストレーション)を特定し、コーパスがファイルパーシスタント、ハイブリッド、階層的コンテキスト戦略を好んでいることを確認する。
軽量ツール,バランスのとれたCLIフレームワーク,マルチエージェントオーケストレータ,エンタープライズシステム,シナリオ仮想化プロジェクトなど,5つの繰り返し発生するアーキテクチャパターンを合成する。
論文 参考訳(メタデータ) (2026-04-20T10:39:34Z) - A Two-Dimensional Framework for AI Agent Design Patterns: Cognitive Function and Execution Topology [54.72352855252792]
本研究では,認知関数軸を7つのカテゴリ,実行位相軸を6つの構造的アーチタイプと組み合わせた2次元分類を提案する。
その結果得られた7x6行列は、27の名前付きパターン、13のオリジナルネームを識別し、AIエージェントアーキテクチャ設計のための原則付き、フレームワークニュートラル、モデルに依存しない語彙を提供する。
論文 参考訳(メタデータ) (2026-03-16T04:01:01Z) - GenAI for Systems: Recurring Challenges and Design Principles from Software to Silicon [62.2138479061386]
ジェネレーティブAIは、コンピュータシステムの設計、最適化、構築方法を変えようとしているが、ソフトウェア、アーキテクチャ、チップデザインコミュニティの間で研究は断片化されている。
本稿では、ハードウェア設計空間探索からRTL合成、物理レイアウト、検証に至るまで、コード生成と分散ランタイムから生成モデルがどのように適用されているかを検討する。
論文 参考訳(メタデータ) (2026-02-16T22:45:33Z) - OFA-MAS: One-for-All Multi-Agent System Topology Design based on Mixture-of-Experts Graph Generative Models [57.94189874119267]
マルチエージェントシステム(MAS)は複雑な問題を解決するための強力なパラダイムを提供する。
現在のグラフ学習に基づく設計手法は、しばしば「1対1」のパラダイムに準拠している。
自然言語で記述されたタスクに対して適応的な協調グラフを生成する一対一のフレームワークOFA-TADを提案する。
論文 参考訳(メタデータ) (2026-01-19T12:23:44Z) - Revisiting the Ordering of Channel and Spatial Attention: A Comprehensive Study on Sequential and Parallel Designs [9.19832186254292]
4つのクラス(シーケンシャル、並列、マルチスケール、残留)で18のトポロジの評価スイートを構築します。
2つのビジョンと9つの医療データセットにまたがって、私たちは"データスケール・メソッド・パフォーマンス"結合法を発見しました。
今後の注目モジュール構築のためのシナリオベースガイドラインを提案する。
論文 参考訳(メタデータ) (2026-01-12T08:32:37Z) - Designing Domain-Specific Agents via Hierarchical Task Abstraction Mechanism [61.01709143437043]
階層型タスク抽象化機構(HTAM)を中心とした新しいエージェント設計フレームワークを提案する。
具体的には、HTAMは、社会的役割のエミュレーションを超えて、代わりに、複数のエージェントシステムを、あるドメインの固有のタスク依存グラフを反映する論理階層に構造化する。
我々は、複雑な地理空間解析に適したマルチエージェントシステムであるEarthAgentとして、このフレームワークをインスタンス化する。
論文 参考訳(メタデータ) (2025-11-21T12:25:47Z) - CODA: Coordinating the Cerebrum and Cerebellum for a Dual-Brain Computer Use Agent with Decoupled Reinforcement Learning [81.08755597239262]
既存のアプローチはトレードオフに苦しむ: ジェネラリストのエージェントは計画に精通するが実行時に性能が悪く、専門のエージェントは反対の弱点を示す。
最近の構成フレームワークは、プランナーとアクターを組み合わせることで、このギャップを埋めようとしているが、それらは通常静的で、訓練不能である。
我々は、ジェネラリストプランナーとスペシャリストエグゼキュータを統合した、新しく訓練可能な構成フレームワークであるCODAを紹介する。
論文 参考訳(メタデータ) (2025-08-27T17:59:50Z) - AI Accelerators for Large Language Model In-ference: Architecture Analysis and Scaling Strategies [10.520360508397237]
大規模言語モデル(LLM)は推論のための特別なハードウェアの新しい波を駆動している。
本稿では,商用AIアクセラレータのワークロード中心,クロスアーキテクチャ性能に関する最初の研究について述べる。
論文 参考訳(メタデータ) (2025-05-13T20:21:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。