論文の概要: Stepped MoE: Segment-Level Routing with Configurable Inference Complexity
- arxiv url: http://arxiv.org/abs/2610.07348v1
- Date: Mon, 05 Oct 2026 20:18:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.64707
- Title: Stepped MoE: Segment-Level Routing with Configurable Inference Complexity
- Title(参考訳): Stepped MoE: 構成可能な推論複雑性を備えたセグメントレベルルーティング
- Abstract要約: 柔軟性のある構造と疎結合なアーキテクチャを組み合わせた統一的なフレームワークを導入し、デプロイ制約とタスク要求の両方に同時に適応するモデルを作成します。
提案手法では,コンテキストと目標の効率仕様の両方を規定したモデルバックボーンを用いて,推定時間における精度-効率トレードオフのきめ細かい制御を可能にする。
- 参考スコア(独自算出の注目度): 12.437778624898838
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Training large language models (LLMs) is resource-intensive, and adapting them for diverse deployment scenarios with varying computational constraints remains challenging. While elastic architectures enable flexible model deployment and sparsely activated models allow input-adaptive computation, existing approaches treat these dimensions independently. Moreover, models catered towards on-device edge inference need to conform to the memory and compute limitations of the serving devices. In this paper, we introduce a unified framework that combines elastic structures with sparsely gated architectures to create models that adapt simultaneously to both deployment constraints and task requirements. Our approach employs a model backbone that conditions on both the context and target efficiency specifications, enabling fine-grained control over the accuracy-efficiency trade-off at inference time. The model learns to activate task-relevant parameters within elastically-nested sub-networks, allowing a single model to span multiple capacity points while maintaining input-adaptive routing. Through experiments we demonstrate that we can create a model that allows the flexibility to use 1,2,3,4 billion parameters while being more accurate than their dense counter-parts (2-5\% on knowledge-intensive benchmarks) and at par with their static versions while delivering similar latency metrics as dense models. Overall, we save on device disk space by sharing the model parameters, allow flexibility of serving based on DRAM and compute available while delivering more accurate results.
- Abstract(参考訳): 大規模言語モデル(LLM)のトレーニングはリソース集約的であり、様々な計算制約のある多様なデプロイメントシナリオにそれらを適用することは依然として困難である。
弾力性のあるアーキテクチャはフレキシブルなモデル展開を可能にし、疎活性化されたモデルは入力適応型計算を可能にするが、既存のアプローチではこれらの次元を独立して扱うことができる。
さらに、デバイス上のエッジ推論を指向したモデルでは、メモリに適合し、提供デバイスの制限を計算する必要がある。
本稿では, 弾性構造と疎ゲートアーキテクチャを組み合わせた統一的なフレームワークを導入し, 配置制約とタスク要求の両方に同時に適応するモデルを作成する。
提案手法では,コンテキストと目標の効率仕様の両方を規定したモデルバックボーンを用いて,推定時間における精度-効率トレードオフのきめ細かい制御を可能にする。
このモデルは、弾性ネストされたサブネットワーク内でタスク関連パラメータを活性化することを学び、入力適応ルーティングを維持しながら、単一のモデルが複数のキャパシティポイントにまたがることを可能にする。
実験を通じて、我々は1,2,340億のパラメータを、より密集したカウンターパート(2~5倍の知識集約型ベンチマーク)よりも正確で、静的なバージョンと同等で、かつ、より密集したモデルと同じようなレイテンシのメトリクスを提供できるモデルを作成できることを示した。
全体として、モデルパラメータを共有することでデバイスディスクスペースを節約し、DRAMに基づくサービス提供の柔軟性と、より正確な結果を提供しながら、利用可能な計算を可能にします。
関連論文リスト
- Elastoformer: Enabling Dynamic Adaptivity via Elastic Model Transformation [0.0]
Elastoformerは、従来のニューラルネットワーク(NN)をリアルタイムな弾性推論が可能なElastic NNに変換するフレームワークである。
我々のフレームワークは最大85%のFLOPの削減、50%のレイテンシの削減、76%のメモリオーバーヘッドの削減を実現している。
論文 参考訳(メタデータ) (2026-09-09T10:52:21Z) - UniScale: Adaptive Unified Inference Scaling via Online Joint Optimization of Model Routing and Test-Time Scaling [35.728353523103074]
モデルルーティングとテスト時間スケーリングを統合するUIS(Unified Inference Scaling)を導入する。
私たちは、UniScaleがUIS空間のシナジーを効果的に活用して、細粒度で一貫した品質とコストのトレードオフを提供することを示す。
論文 参考訳(メタデータ) (2026-05-29T06:31:21Z) - Fine-Grained Model Merging via Modular Expert Recombination [33.253051407398836]
本稿では,MERGEを提案する。MERGEはコンポーネントワイドなモデルマージと,インプットアウェアでオンデマンドなモジュール再結合を推論時に実現する手法である。
MERGEは、クロスタスク性能とストレージ効率のバランスをとる双方向最適化問題として、コンポーネントワイズマージを定式化している。
MERGEは、強いベースラインを一貫して上回り、効果的に一般化することを示す。
論文 参考訳(メタデータ) (2026-02-06T09:55:56Z) - Elastic ViTs from Pretrained Models without Retraining [74.5386166956142]
ビジョンファウンデーションモデルは優れたパフォーマンスを達成するが、事前決定されたサイズの限られたセットでしか利用できない。
本稿では, プルーニングされた視覚変換器のためのシングルショットネットワーク近似であるSnapViTを紹介する。
提案手法は,進化的アルゴリズムを用いて近似した勾配情報とクロスネットワーク構造相関を効率的に結合する。
論文 参考訳(メタデータ) (2025-10-20T16:15:03Z) - Black-box Model Merging for Language-Model-as-a-Service with Massive Model Repositories [21.899117703417517]
進化的アルゴリズム(Evo-Merging)に基づく微分自由最適化フレームワークを提案する。
提案手法は,(1) モデル間の不適切な情報や冗長な情報を識別・フィルタリングする疎結合型デノベーション,(2) 関連モデルに対する最適な組合せ重み付けを動的に計算するシグナック・アウェア・スケーリングの2つの重要な要素から構成される。
提案手法は,様々なタスクにおける最先端の成果を達成し,既存の強靭なベースラインを著しく上回っている。
論文 参考訳(メタデータ) (2025-09-16T10:55:50Z) - SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models [21.933379266533098]
大規模言語モデル(LLM)は、推論品質と計算コストの間に重要なトレードオフをもたらす。
既存のサービス戦略では、固定されたモデルスケールや静的な2段階の投機的デコードを用いることが多い。
本稿では,LLM推論を適応的ルーティング問題として再定義する新しいフレームワークであるsystemnameを紹介する。
論文 参考訳(メタデータ) (2025-05-12T15:46:28Z) - Energy-efficient Task Adaptation for NLP Edge Inference Leveraging
Heterogeneous Memory Architectures [68.91874045918112]
Adapter-ALBERTは、様々なタスクにわたる最大データ再利用のための効率的なモデル最適化である。
検証されたNLPエッジアクセラレータ上でシミュレーションを行うことにより、モデルを不均一なオンチップメモリアーキテクチャにマッピングする利点を実証する。
論文 参考訳(メタデータ) (2023-03-25T14:40:59Z) - SlimSeg: Slimmable Semantic Segmentation with Boundary Supervision [54.16430358203348]
本稿では,単純なスリム化可能なセマンティックセマンティックセマンティクス(SlimSeg)法を提案する。
提案するSlimSegは,様々な主流ネットワークを用いて,計算コストの動的調整と性能向上を実現するフレキシブルなモデルを生成することができることを示す。
論文 参考訳(メタデータ) (2022-07-13T14:41:05Z) - Slimmable Domain Adaptation [112.19652651687402]
重み付けモデルバンクを用いて、ドメイン間の一般化を改善するためのシンプルなフレームワーク、Slimmable Domain Adaptationを導入する。
私たちのフレームワークは、他の競合するアプローチを、複数のベンチマークにおいて非常に大きなマージンで上回ります。
論文 参考訳(メタデータ) (2022-06-14T06:28:04Z) - Adaptive Subcarrier, Parameter, and Power Allocation for Partitioned
Edge Learning Over Broadband Channels [69.18343801164741]
パーティショニングエッジ学習(PARTEL)は、無線ネットワークにおいてよく知られた分散学習手法であるパラメータサーバトレーニングを実装している。
本稿では、いくつかの補助変数を導入してParticleELを用いてトレーニングできるディープニューラルネットワーク(DNN)モデルについて考察する。
論文 参考訳(メタデータ) (2020-10-08T15:27:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。