論文の概要: Cache-Aware Joint Router Adaptation for Memory-Efficient MoE Inference
- arxiv url: http://arxiv.org/abs/2609.04895v2
- Date: Thu, 10 Sep 2026 08:25:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-11 14:47:34.225382
- Title: Cache-Aware Joint Router Adaptation for Memory-Efficient MoE Inference
- Title(参考訳): メモリ効率の良いMoE推論のためのキャッシュ対応ジョイントルータ適応
- Authors: Zhenhe Wu, Yaping Jin, Qinghua Xing, Hang Zhou, Wei He, Xianjie Wu, Xianfu Cheng, Jian Yang, Hanting Chen,
- Abstract要約: Mixture-of-Experts (MoE)モデルはトークン当たりのエキスパート数が少ないが、フルエキスパートセットはGPUメモリを超える可能性がある。
本稿では,MoEバックボーンと軽量補助ルータを併用したキャッシュ対応ポストトレーニングを提案する。
我々は,GSM8K,MATH,CommonsenseQAにおいて,Qwen3とGPT-OSSの両方のモードを評価する。
- 参考スコア(独自算出の注目度): 30.742807062279226
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Mixture-of-Experts (MoE) models activate few experts per token, yet their full expert sets can exceed GPU memory and require repeated weight transfers during decoding. We formulate expert-cache management as a model-side algorithmic problem and propose cache-aware post-training that jointly adapts the MoE backbone and lightweight auxiliary routers while preserving the native inference-time Top-K rule. The update-only Temporal Router learns same-layer retention across tokens without proactive loading. The full Spatio-Temporal Router adds a Spatio Router that uses the causal predecessor's hidden state to refine the temporal cache before target-layer access. We evaluate both modes on Qwen3 and GPT-OSS across GSM8K, MATH, and CommonsenseQA. Temporal Router consistently improves hit rate and reduces expert-weight traffic over matched LM-only baselines. On Qwen3, the full mode improves adjusted hit rate by 1.15--18.03 points and reduces traffic by 4.6--53.3\% relative to the strongest evaluated prefetching baseline; GPT-OSS results are competitive but task-dependent. Auxiliary-only training preserves baseline accuracy but yields modest coverage gains; joint post-training achieves substantially higher coverage. Sensitivity analyses distinguish the effects of cache capacity, refinement budget, and cache-loss weight on coverage, traffic, and quality.
- Abstract(参考訳): Mixture-of-Experts (MoE)モデルではトークン毎に専門家がほとんどいないが、フル専門家セットはGPUメモリを超え、復号中に重み付けを繰り返し行う必要がある。
我々は,モデル側アルゴリズム問題としてエキスパート・キャッシュ管理を定式化し,ネイティブ推論時間Top-Kルールを保ちながら,MoEバックボーンと軽量補助ルータを併用したキャッシュ・アウェア・ポストトレーニングを提案する。
更新のみのTemporal Routerは、積極的にロードすることなくトークン間の同層保持を学習する。
完全な Spatio-Temporal Router には Spatio Router が追加されている。これは、因果前者の隠された状態を使用して、ターゲット層アクセスの前に時間キャッシュを洗練する。
我々は,GSM8K,MATH,CommonsenseQAにおいて,Qwen3とGPT-OSSの両方のモードを評価する。
テンポラルルータはヒット率を継続的に改善し、LMのみのベースライン上でのエキスパートウェイトトラフィックを減らす。
Qwen3では、フルモードは調整されたヒット率を1.15--18.03ポイント改善し、最も評価の高いプレフェッチベースラインと比較してトラフィックを4.6--53.3\%削減する。
補助訓練はベースライン精度を維持するが、適度なカバレッジ向上をもたらす。
感度分析は、キャッシュ容量、精細化予算、キャッシュロス重量がカバレッジ、トラフィック、品質に与える影響を区別する。
関連論文リスト
- CRISP: Cliff-awaRe Input-adaptive Sparse Prefilling with Structural-Mass-Motivated Routing [90.63350360476294]
本稿ではCRISP(Cliff-awaRe Input-adaptive Sparse Prefilling)を提案する。
ルーティング決定は、プロキシアテンションマップの構造から直接読み取ることができることを示す。
ソフトマックス後の質量崖を定式化し、厳密な累積被覆閾値が長い文脈でO(n)バックグラウンドノイズを蓄積することを理論的に示す。
論文 参考訳(メタデータ) (2026-09-01T22:49:46Z) - LaCache: Exact Caching and Precision-Adaptive Inference for Diffusion Large Language Models [9.146969118551167]
DLLMは、テキスト生成におけるSAR(Semi-Autoregressive Decoding)による並列生成を可能にする。
現在の方法は、オペレータレベルの深刻な冗長性に悩まされている。
トレーニング不要なアクセラレーションフレームワークであるLaCacheを提案する。
論文 参考訳(メタデータ) (2026-07-16T10:49:15Z) - NaviCache: Test-Time Self-Calibration Caching for Video Generation [82.90113757454375]
NaviCacheはビデオ拡散モデルのためのテスト時間自己校正手法である。
基本的な領域ギャップと非定常的な拡散の性質を橋渡しする。
理論上は、誤差バウンド・スキップのメカニズムを提供する。
論文 参考訳(メタデータ) (2026-06-25T09:28:12Z) - MeanCache: From Instantaneous to Average Velocity for Accelerating Flow Matching Inference [11.934900617930774]
MeanCacheは、効率的なフローマッチング推論のためのトレーニング不要のキャッシュフレームワークである。
我々は,MeanCacheがそれぞれ4.12X,4.56X,3.59Xのアクセラレーションを達成したことを実証した。
論文 参考訳(メタデータ) (2026-01-27T08:35:50Z) - Dr.LLM: Dynamic Layer Routing in LLMs [55.11953638340419]
Dr.LLMは、事前訓練されたモデルに軽量な層ごとのルータを装備し、ブロックをスキップ、実行、繰り返すように決定する、適合性のあるフレームワークである。
ARC(logic)とDART(math)では、Dr.LLMは平均で5つのレイヤを保存しながら、最大3.4%の精度向上を実現している。
論文 参考訳(メタデータ) (2025-10-14T17:51:26Z) - Efficient Inference of Vision Instruction-Following Models with Elastic Cache [76.44955111634545]
我々は,命令追従型大規模視覚言語モデルの効率的なデプロイのための新しい戦略であるElastic Cacheを紹介する。
本稿では,冗長キャッシュを具現化する重要なキャッシュマージ戦略を提案する。
命令符号化では,キャッシュの重要性を評価するために周波数を利用する。
様々なLVLMの結果は、Elastic Cacheが効率を向上するだけでなく、言語生成における既存のプルーニングメソッドよりも優れていることを示している。
論文 参考訳(メタデータ) (2024-07-25T15:29:05Z) - Digital Twin-Assisted Data-Driven Optimization for Reliable Edge Caching in Wireless Networks [60.54852710216738]
我々はD-RECと呼ばれる新しいデジタルツインアシスト最適化フレームワークを導入し、次世代無線ネットワークにおける信頼性の高いキャッシュを実現する。
信頼性モジュールを制約付き決定プロセスに組み込むことで、D-RECは、有利な制約に従うために、アクション、報酬、状態を適応的に調整することができる。
論文 参考訳(メタデータ) (2024-06-29T02:40:28Z) - A Learning-Based Caching Mechanism for Edge Content Delivery [2.412158290827225]
5GネットワークとIoT(Internet of Things)の台頭により、ネットワークのエッジはますます拡大している。
このシフトは、特に限られたキャッシュストレージとエッジにおける多様な要求パターンのために、ユニークな課題をもたらす。
HR-Cacheは、ハザードレート(HR)順序付けの原則に基づく学習ベースのキャッシュフレームワークである。
論文 参考訳(メタデータ) (2024-02-05T08:06:03Z) - Caching Placement and Resource Allocation for Cache-Enabling UAV NOMA
Networks [87.6031308969681]
本稿では,非直交多重アクセス(NOMA)をサポートした大規模アクセス機能を有する無人航空機(UAV)セルネットワークについて検討する。
コンテンツ配信遅延最小化のための長期キャッシュ配置と資源配分最適化問題をマルコフ決定プロセス(MDP)として定式化する。
そこで我々は,UAVがemphsoft $varepsilon$-greedy戦略を用いて行動の学習と選択を行い,行動と状態の最適な一致を探索する,Qラーニングに基づくキャッシュ配置とリソース割り当てアルゴリズムを提案する。
論文 参考訳(メタデータ) (2020-08-12T08:33:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。