論文の概要: Cache-Aware Joint Router Adaptation for Memory-Efficient MoE Inference
- arxiv url: http://arxiv.org/abs/2609.04895v1
- Date: Fri, 04 Sep 2026 08:52:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-07 18:15:23.984169
- Title: Cache-Aware Joint Router Adaptation for Memory-Efficient MoE Inference
- Title(参考訳): メモリ効率の良いMoE推論のためのキャッシュ対応ジョイントルータ適応
- Abstract要約: Mixture-of-Expertsはトークンごとに専門家の小さなサブセットだけを起動する。
フルエキスパートセットはGPUメモリを超えることが多く、復号時に繰り返し重み移動を引き起こす。
本稿では,MoEバックボーンと軽量補助キャッシュルータを併用したキャッシュ対応ポストトレーニングフレームワークを提案する。
- 参考スコア(独自算出の注目度): 30.742807062279226
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Mixture-of-Experts (MoE) models activate only a small subset of experts per token, but the full expert set often exceeds GPU memory, causing repeated weight transfers during decoding. We formulate expert-cache management as a model-side algorithmic problem and propose a cache-aware post-training framework that jointly adapts the MoE backbone and lightweight auxiliary cache routers while preserving the native Top-K expert-selection rule at inference. Its update-only mode, Temporal Router, predicts same-layer reuse and retains experts for future tokens without proactive loading. The full Spatio-Temporal Router adds a Spatio Router that uses the causal predecessor's hidden state to refine the temporal cache before target-layer access. We evaluate both modes on Qwen3 and GPT-OSS across GSM8K, MATH, and CommonsenseQA. Temporal Router consistently improves cache hit rate and reduces expert-weight traffic over matched LM-only baselines. On Qwen3, Spatio-Temporal Router achieves the best load-adjusted efficiency across three tasks, improving adjusted hit rate by 1.15--18.03 points and reducing traffic by 4.6--53.3% relative to the strongest evaluated prefetching baseline; results on GPT-OSS are competitive but task-dependent. An auxiliary-only ablation preserves baseline accuracy but yields modest cache gains, whereas joint post-training produces larger improvements. Sensitivity analyses show that cache capacity controls transfer demand, while the refinement budget governs the trade-off between pre-access coverage and proactive traffic.
- Abstract(参考訳): Mixture-of-Experts (MoE)モデルはトークン当たりのエキスパートの小さなサブセットのみを活性化するが、フルエキスパートセットはGPUメモリを超えることが多く、復号時に重み移動が繰り返される。
モデル側アルゴリズム問題としてエキスパートキャッシュ管理を定式化し、推論時にネイティブなTop-Kエキスパート選択ルールを保ちながら、MoEバックボーンと軽量補助キャッシュルータを併用してキャッシュ対応のポストトレーニングフレームワークを提案する。
アップデートのみのモードであるTemporal Routerは、同じレイヤの再利用を予測し、積極的にロードすることなく、将来のトークンのエキスパートを保持する。
完全な Spatio-Temporal Router には Spatio Router が追加されている。これは、因果前者の隠された状態を使用して、ターゲット層アクセスの前に時間キャッシュを洗練する。
我々は,GSM8K,MATH,CommonsenseQAにおいて,Qwen3とGPT-OSSの両方のモードを評価する。
テンポラルルータはキャッシュヒット率を継続的に改善し、LMのみのベースラインにマッチする専門家のトラフィックを減らす。
Qwen3では、時空間ルータは3つのタスクで最高の負荷調整効率を実現し、調整されたヒット率を1.15~18.03ポイント改善し、最も評価の高いプリフェッチベースラインと比較してトラフィックを4.6~53.3%削減した。
補助のみのアブレーションではベースライン精度は保たれるが、緩やかなキャッシュゲインが得られる。
感度分析では、キャッシュキャパシティが転送需要を制御しているのに対し、改良予算はアクセス前カバレッジとアクティブトラフィックの間のトレードオフを制御している。
関連論文リスト
- CRISP: Cliff-awaRe Input-adaptive Sparse Prefilling with Structural-Mass-Motivated Routing [90.63350360476294]
本稿ではCRISP(Cliff-awaRe Input-adaptive Sparse Prefilling)を提案する。
ルーティング決定は、プロキシアテンションマップの構造から直接読み取ることができることを示す。
ソフトマックス後の質量崖を定式化し、厳密な累積被覆閾値が長い文脈でO(n)バックグラウンドノイズを蓄積することを理論的に示す。
論文 参考訳(メタデータ) (2026-09-01T22:49:46Z) - LaCache: Exact Caching and Precision-Adaptive Inference for Diffusion Large Language Models [9.146969118551167]
DLLMは、テキスト生成におけるSAR(Semi-Autoregressive Decoding)による並列生成を可能にする。
現在の方法は、オペレータレベルの深刻な冗長性に悩まされている。
トレーニング不要なアクセラレーションフレームワークであるLaCacheを提案する。
論文 参考訳(メタデータ) (2026-07-16T10:49:15Z) - NaviCache: Test-Time Self-Calibration Caching for Video Generation [82.90113757454375]
NaviCacheはビデオ拡散モデルのためのテスト時間自己校正手法である。
基本的な領域ギャップと非定常的な拡散の性質を橋渡しする。
理論上は、誤差バウンド・スキップのメカニズムを提供する。
論文 参考訳(メタデータ) (2026-06-25T09:28:12Z) - Stochastic KV Routing: Enabling Adaptive Depth-Wise Cache Sharing [29.913403615975174]
高いスループットでトランスフォーマー言語モデルを実行するには、冗長な計算を避けるためにキーバリュー(KV)をキャッシュする必要がある。
KVキャッシュのメモリフットプリントは著しく、サービスコストに大きな影響を与えます。
本稿では,ランダムな層間注意(ランダムな層間注意,ランダムな層間注意,ランダムな層間注意)を提案する。
論文 参考訳(メタデータ) (2026-04-03T14:56:17Z) - WorldCache: Content-Aware Caching for Accelerated Video World Models [50.7543797435026]
我々はPerception-Constrained Dynamic CaCacheフレームワークであるtextbfWorldCacheを紹介する。
WorldCacheは、機能をいつ、どのように再利用するかを改善します。
PAI-Benchで評価されたCosmos-2.5-2Bでは、WorldCacheはtextbf$2.3times$推論スピードアップを実現し、textbf99.4%のベースライン品質を維持している。
論文 参考訳(メタデータ) (2026-03-23T17:59:54Z) - MeanCache: From Instantaneous to Average Velocity for Accelerating Flow Matching Inference [11.934900617930774]
MeanCacheは、効率的なフローマッチング推論のためのトレーニング不要のキャッシュフレームワークである。
我々は,MeanCacheがそれぞれ4.12X,4.56X,3.59Xのアクセラレーションを達成したことを実証した。
論文 参考訳(メタデータ) (2026-01-27T08:35:50Z) - Dr.LLM: Dynamic Layer Routing in LLMs [55.11953638340419]
Dr.LLMは、事前訓練されたモデルに軽量な層ごとのルータを装備し、ブロックをスキップ、実行、繰り返すように決定する、適合性のあるフレームワークである。
ARC(logic)とDART(math)では、Dr.LLMは平均で5つのレイヤを保存しながら、最大3.4%の精度向上を実現している。
論文 参考訳(メタデータ) (2025-10-14T17:51:26Z) - TaoCache: Structure-Maintained Video Generation Acceleration [4.594224594572109]
ビデオ拡散モデルのためのトレーニング不要のプラグイン・アンド・プレイキャッシュ戦略であるTaoCacheを提案する。
モデルのノイズ出力を予測するために固定点視点を採用しており、特に遅延雑音発生の段階で有効である。
論文 参考訳(メタデータ) (2025-08-12T14:40:36Z) - Efficient Inference of Vision Instruction-Following Models with Elastic Cache [76.44955111634545]
我々は,命令追従型大規模視覚言語モデルの効率的なデプロイのための新しい戦略であるElastic Cacheを紹介する。
本稿では,冗長キャッシュを具現化する重要なキャッシュマージ戦略を提案する。
命令符号化では,キャッシュの重要性を評価するために周波数を利用する。
様々なLVLMの結果は、Elastic Cacheが効率を向上するだけでなく、言語生成における既存のプルーニングメソッドよりも優れていることを示している。
論文 参考訳(メタデータ) (2024-07-25T15:29:05Z) - Digital Twin-Assisted Data-Driven Optimization for Reliable Edge Caching in Wireless Networks [60.54852710216738]
我々はD-RECと呼ばれる新しいデジタルツインアシスト最適化フレームワークを導入し、次世代無線ネットワークにおける信頼性の高いキャッシュを実現する。
信頼性モジュールを制約付き決定プロセスに組み込むことで、D-RECは、有利な制約に従うために、アクション、報酬、状態を適応的に調整することができる。
論文 参考訳(メタデータ) (2024-06-29T02:40:28Z) - A Learning-Based Caching Mechanism for Edge Content Delivery [2.412158290827225]
5GネットワークとIoT(Internet of Things)の台頭により、ネットワークのエッジはますます拡大している。
このシフトは、特に限られたキャッシュストレージとエッジにおける多様な要求パターンのために、ユニークな課題をもたらす。
HR-Cacheは、ハザードレート(HR)順序付けの原則に基づく学習ベースのキャッシュフレームワークである。
論文 参考訳(メタデータ) (2024-02-05T08:06:03Z) - Caching Placement and Resource Allocation for Cache-Enabling UAV NOMA
Networks [87.6031308969681]
本稿では,非直交多重アクセス(NOMA)をサポートした大規模アクセス機能を有する無人航空機(UAV)セルネットワークについて検討する。
コンテンツ配信遅延最小化のための長期キャッシュ配置と資源配分最適化問題をマルコフ決定プロセス(MDP)として定式化する。
そこで我々は,UAVがemphsoft $varepsilon$-greedy戦略を用いて行動の学習と選択を行い,行動と状態の最適な一致を探索する,Qラーニングに基づくキャッシュ配置とリソース割り当てアルゴリズムを提案する。
論文 参考訳(メタデータ) (2020-08-12T08:33:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。