論文の概要: Asymmetric Virtual Memory Paging for Hybrid Mamba-Transformer Inference
- arxiv url: http://arxiv.org/abs/2605.22416v1
- Date: Thu, 21 May 2026 12:37:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-22 16:35:42.257181
- Title: Asymmetric Virtual Memory Paging for Hybrid Mamba-Transformer Inference
- Title(参考訳): ハイブリッドマンバ変換器推論のための非対称仮想メモリページング
- Authors: An Xuan Nguyen,
- Abstract要約: Jambaのようなハイブリッド言語モデルは、注意層とステートスペースモデル(SSM)を混合します。
統一プールパッドSSMは、ページサイズが7.3倍になる。
非対称仮想メモリページング(AVMP)は、2つのキャッシュタイプを仮想アドレス空間の後方にある物理的に異なるプールに分離する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Hybrid language models like Jamba mix attention layers with State Space Models (SSMs), creating two memory cache types with opposite profiles: Key-Value (KV) caches grow linearly with sequence length, while SSM states stay fixed per layer. Current inference engines handle this poorly. Unified pools pad SSM states to attention page sizes, wasting up to 7.3x capacity. Static dual pools cannot adapt when prompt distributions shift between requests. We present Asymmetric Virtual Memory Paging (AVMP). The allocator separates the two cache types into physically distinct pools behind a unified virtual address space, and migrates capacity between pools when one runs out. Migration triggers only on allocation failure, keeping behavior deterministic. We evaluate AVMP across 270 synthetic cells plus 60 cells of ShareGPT trace replay on an RTX 3060 12GB. Out-of-Memory events drop 7.6% and request throughput improves 1.83x to 13.3x across synthetic workloads and 2.36x on ShareGPT. All gains hold under paired-bootstrap 95% confidence intervals. A phase-time breakdown reveals two distinct mechanisms: shorter OOM recovery on capacity-pressured workloads, and faster allocation calls on KV-heavy workloads. Implementation is pure Python; Triton integration is future work.
- Abstract(参考訳): Jambaのようなハイブリッド言語モデルは注意層とステートスペースモデル(SSM)を混合し、反対プロファイルを持つ2つのメモリキャッシュタイプを生成する。
現在の推論エンジンは、これをうまく処理しない。
統一プールパッドSSMは、ページサイズが7.3倍になる。
静的なデュアルプールは、リクエスト間の配布が即時シフトしても適応できない。
Asymmetric Virtual Memory Paging (AVMP) を提案する。
アロケータは2つのキャッシュタイプを、統一された仮想アドレス空間の後方にある物理的に異なるプールに分離し、一方が切れたときにプール間でキャパシティを移行する。
マイグレーションはアロケーション障害のみをトリガーし、動作決定性を維持する。
RTX 3060 12GBで270個の合成細胞と60個のShareGPTトレースリプレイのAVMPを評価した。
メモリ外イベントは7.6%減少し、要求スループットは合成ワークロードで1.83倍から13.3倍、ShareGPTでは2.36倍向上した。
すべての利得は、95%の信頼区間でペアリングブートストラップで保持される。
フェーズタイムのブレークダウンでは、キャパシティ圧縮ワークロードでのOOMリカバリの短縮と、KV重ワークロードでのアロケーション呼び出しの高速化の2つのメカニズムが明らかにされている。
実装は純粋なPythonで、Tritonの統合は今後の作業だ。
関連論文リスト
- Attend Locally, Remember Linearly: Linear Attention as Cross-Frame Memory for Autoregressive Video Diffusion [61.57938553036056]
ARL2は、二次的なクロスフレームアテンションを固定サイズのリカレント状態に置き換えるハイブリッドアテンションモジュールである。
本研究では,フレーム内ソフトマックスブランチとフレーム間リカレント線形ブランチの2つに分割し,ストリームコンテキストの固定サイズ状態を維持する。
75%の層がハイブリッドリニアアテンションに置き換えられ、最大2.26ウォールクロックのスピードアップと54%のメモリ削減を実現した。
論文 参考訳(メタデータ) (2026-05-15T19:33:45Z) - Predictive Multi-Tier Memory Management for KV Cache in Large-Scale GPU Inference [0.0]
キーバリュー(KV)キャッシュメモリ管理は、大規模GPU推論サービスにおける主要なボトルネックである。
現在のシステムは3つの複合的非効率性に悩まされている。
3つの問題すべてに対処する統一システムを提案する。
論文 参考訳(メタデータ) (2026-04-19T21:34:09Z) - Once-for-All Channel Mixers (HYPERTINYPW): Generative Compression for TinyML [0.0]
提案するHYPER-TINYPWは圧縮・アズ・ジェネレーション方式で、ほとんどのPW重みを生成された重みに置き換える。
共有マイクロMLPは、レイヤごとの小さなコードからロード時に一度PWカーネルを合成し、それらをキャッシュし、標準的な整数演算子で実行する。
商用のMCUランタイムを保存し、ワンオフでのみ追加する。
論文 参考訳(メタデータ) (2026-03-26T01:08:52Z) - PackCache: A Training-Free Acceleration Method for Unified Autoregressive Video Generation via Compact KV-Cache [61.57938553036056]
トレーニング不要なKVキャッシュ管理手法であるPackCacheを導入し,KVキャッシュを3つの協調機構でコンパクト化する。
効率の面では、PackCacheは48フレームの長いシーケンスで1.7-2.2倍のエンドツーエンド生成を高速化する。
論文 参考訳(メタデータ) (2026-01-07T19:51:06Z) - MARLIN: Mixed-Precision Auto-Regressive Parallel Inference on Large Language Models [58.3342517278868]
本稿では,Mixed-precision AutoRegressive LINearカーネルの設計について述べる。
バッチサイズは16-32までサポートでき、量子化のスピードアップが最大 (4times$) になる。
MarLINは非同期メモリアクセス、複雑なタスクスケジューリング、パイプライン化といったテクニックを組み合わせてこれを実現している。
論文 参考訳(メタデータ) (2024-08-21T16:10:41Z) - vTensor: Flexible Virtual Tensor Management for Efficient LLM Serving [53.972175896814505]
大規模言語モデル(LLM)は様々なドメインで広く使われ、数百万の日次要求を処理する。
大規模言語モデル(LLM)は様々なドメインで広く使われ、数百万の日次要求を処理する。
論文 参考訳(メタデータ) (2024-07-22T14:37:58Z) - B'MOJO: Hybrid State Space Realizations of Foundation Models with Eidetic and Fading Memory [91.81390121042192]
我々はB'MOJOと呼ばれるモデル群を開発し、構成可能なモジュール内で理想的メモリと暗黙的メモリをシームレスに結合する。
B'MOJOのイデオティックメモリとフェードメモリを変調する能力は、32Kトークンまでテストされた長いシーケンスの推論をより良くする。
論文 参考訳(メタデータ) (2024-07-08T18:41:01Z) - Dynamic Memory Compression: Retrofitting LLMs for Accelerated Inference [1.9639467358416092]
トランスフォーマーは、大きな言語モデル(LLM)のバックボーンとして登場した。
本稿では,動的メモリ圧縮(DMC)を提案する。
Llama 2 (7B, 13B, 70B) などの事前学習 LLM を DMC トランスフォーマーに適合させ,NVIDIA H100 GPU 上での自己回帰推論で最大 7 倍のスループット向上を実現した。
論文 参考訳(メタデータ) (2024-03-14T17:59:26Z) - GEMEL: Model Merging for Memory-Efficient, Real-Time Video Analytics at
the Edge [10.276140547573437]
エッジビジョンモデル間のアーキテクチャ的類似性を利用した新しいメモリ管理手法であるモデルマージを提案する。
多様なワークロードに対する実験により、GEMELはメモリ使用量を最大60.7%削減し、時間/空間の共有のみと比較して、全体的な精度を8~39%向上することが明らかになった。
論文 参考訳(メタデータ) (2022-01-19T16:45:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。