論文の概要: MOIRA: Mass-Oriented Indexing with Ragged Attention for Long-Context Decoding
- arxiv url: http://arxiv.org/abs/2610.04313v1
- Date: Sat, 03 Oct 2026 05:58:09 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 21:14:37.116903
- Title: MOIRA: Mass-Oriented Indexing with Ragged Attention for Long-Context Decoding
- Title(参考訳): MOIRA: 長期デコードのためのタグ付きアテンション付きマス指向インデックス
- Abstract要約: すべての出力トークンが各層のKVキャッシュを読み取るため、ロングコンテキストの復号化はメモリ帯域幅によって制限される。
クエリに必要なページ数は、KVヘッド、レイヤ、ステップによって大きく異なります。
我々は、KVヘッドと層ごとの予算が適応するvLLMのトレーニングフリーデコードであるMOIRAを提案する。
- 参考スコア(独自算出の注目度): 0.0
- License:
- Abstract: Long-context decoding is limited by memory bandwidth, because every output token reads the KV cache of every layer. Sparse decoding reduces this cost by reading only part of the KV cache. We observe that the number of pages a query needs varies widely across KV heads, layers and steps. Fixed budgets are simple, but they are sized for demanding cases and tuned per workload; adaptive budgets follow this variation more flexibly, but existing designs pay for it with extra selection cost or training. At the kernel level, FlashAttention-3 (FA3) and FlashInfer are designed for rows of similar length: with page lists whose length differs per KV head, they either pad the lists (forfeiting much of the sparse saving), leave thread blocks unbalanced, or rely on a host-side plan that runs outside the CUDA graph. We propose MOIRA, a training-free sparse decode path in vLLM whose budget adapts per KV head and per layer. For every request, layer, KV head and step, a coverage rule keeps the smallest set of pages whose estimated attention mass reaches a fraction $γ$. A new kernel, self-planning attention, lets each thread block derive its own share of the work from the list lengths, so the whole decode step stays inside the CUDA graph. On an H200, at RULER's 128k context, MOIRA with $γ=0.99$ matches dense accuracy while reading about 30% of the pages and reduces the time per output token (TPOT) by 2.2-2.5$\times$ relative to dense FA3; with $γ=0.98$ it reduces TPOT by 2.7$\times$ and stays within the noise of dense. Under high serving load it raises throughput by up to 51%. These results suggest that a budget adapted per head and layer, paired with a kernel that keeps such budgets inside the CUDA graph, makes sparse decoding both flexible and fast.
- Abstract(参考訳): すべての出力トークンが各層のKVキャッシュを読み取るため、ロングコンテキストの復号化はメモリ帯域幅によって制限される。
スパースデコーディングは、KVキャッシュの一部だけを読み取ることで、このコストを削減する。
クエリに必要なページ数は、KVヘッド、レイヤ、ステップによって大きく異なります。
固定予算は単純だが、要求されたケースと作業負荷ごとに調整されるサイズで、適応予算はより柔軟にこのバリエーションに従うが、既存の設計では追加の選択コストやトレーニングを支払っている。
カーネルレベルでは、FlashAttention-3 (FA3) と FlashInfer は、同じ長さの行のために設計されている: KV ヘッドごとに長さが異なるページリストは、リストをパディングする(スパースセーブの大部分を省略する)か、スレッドブロックをアンバランスにするか、CUDA グラフの外で実行されるホストサイドプランに依存する。
我々は、KVヘッドと層ごとの予算が適応するvLLMにおいて、トレーニング不要なスパースデコードパスであるMOIRAを提案する。
すべてのリクエスト、レイヤ、KVヘッド、ステップに対して、カバレッジルールは、推定された注目質量がわずか$γ$に達する最小のページの集合を保持する。
新しいカーネル、自己計画型アテンションにより、各スレッドブロックはリストの長さから作業の共有を導出できるため、デコードステップ全体がCUDAグラフ内に留まる。
H200では、RULERの128kコンテキストにおいて、$γ=0.99$のMOIRAは、ページの約30%を読みながら密度の高い精度に一致し、高密度なFA3と比較して2.2-2.5$\times$のTPOTを2.7$\times$に下げる。
高いサービス負荷下では、スループットを最大51%向上させる。
これらの結果から, CUDAグラフ内にそのような予算を保持するカーネルと, ヘッドとレイヤ毎に適応した予算が組み合わさって, フレキシブルかつ高速なデコーディングを実現することが示唆された。
関連論文リスト
- Where Activation Sparsity and KV-Cache Sparsity Cross in LLM Decoding [25.41362943884425]
2つのブランチとその構成を2つのGPU上で2Kから128Kトークンに記録します。
2つの貯蓄が等しい文脈長であるバイトクロスオーバーと、各分岐に対する理想的なスピードアップ境界を導出する。
スプリットK注意の代わりにマスク付きで高密度ベースラインをタイミングさせることで、同じKVポリシーの約5倍のスピードアップが膨らむ。
論文 参考訳(メタデータ) (2026-09-27T20:11:05Z) - You Only Index Once: Cross-Layer Sparse Attention with Shared Routing [61.29627714699688]
層間スパースアテンション(A)はYOCOなどのKV共有アーキテクチャ上に構築されている。
シングルインデクサはトークンレベルのトップk選択を一度計算し、その結果のインデックスをレイヤ間で再利用する。
その結果、CLSAは正確かつ効率的であり、最大7.6倍のデコードスピードアップと17.1倍のスループット向上を実現している。
論文 参考訳(メタデータ) (2026-06-04T17:54:04Z) - Kwai Summary Attention Technical Report [69.40814939510126]
長文の能力は、次世代の大規模言語モデルの最も重要な方向性の1つになっている。
標準ソフトマックスアテンションは、シーケンスの長さに関して2次時間複雑性を示す。
歴史的文脈を圧縮することでシーケンスモデリングコストを削減する新しいアテンションメカニズムであるKwai Summary Attention (KSA)を提案する。
論文 参考訳(メタデータ) (2026-04-27T12:59:53Z) - ZoomR: Memory Efficient Reasoning through Multi-Granularity Key Value Retrieval [58.575695990976136]
大規模言語モデル(LLM)は複雑な推論タスクにおいて優れたパフォーマンスを示している。
LLMは、最終的な答えに到達する前に、長い中間的思考を生成する必要があることが多い。
我々は,LLMが動詞の推論思考を要約に適応的に圧縮することを可能にする新しいアプローチであるZoomRを紹介する。
論文 参考訳(メタデータ) (2026-04-13T02:00:35Z) - Learning What to Write: Write-Gated KV for Efficient Long-Context Inference [10.915483460983411]
我々は,KVキャッシュ管理を3つのプリミティブの因果系として定式化した。
我々は、キャッシュに入る前にトークンユーティリティを予測する軽量メカニズムであるWrite-Gated KVを介してKVAdmissionをインスタンス化する。
論文 参考訳(メタデータ) (2025-12-19T11:08:58Z) - Attention Is All You Need for KV Cache in Diffusion LLMs [36.94369617373333]
Elastic-Cacheは、拡散大言語モデルのための適応型層対応キャッシュ更新を実行する。
提案手法は,既存の信頼度に基づく手法よりも高いスループット(GSM8Kで6.8時間)を実現する。
論文 参考訳(メタデータ) (2025-10-16T17:59:48Z) - CommVQ: Commutative Vector Quantization for KV Cache Compression [50.37946553931796]
本稿では,長期LLM推論におけるメモリ使用量を大幅に削減するために,CommVQ(CommVQ)を提案する。
まず、KVキャッシュを圧縮するための軽量エンコーダとコードブックを用いた加算量子化を導入する。
提案手法は,RoPE-commutative codebook を用いた加算量子化と低オーバーヘッド化により高い精度を実現する。
論文 参考訳(メタデータ) (2025-06-23T17:50:11Z) - SqueezeAttention: 2D Management of KV-Cache in LLM Inference via Layer-wise Optimal Budget [29.208289711639853]
LLM(Large Language Model)のキーバリューキャッシュを最適化することは、推論コストの削減に不可欠であると考えられている。
既存のKV-cache圧縮アルゴリズムのほとんどは全ての層を等しく扱い、各層に同じKV予算を割り当てている。
注意層の重要性を同定することにより、KV-cacheを2次元から共同で最適化できることが判明した。
論文 参考訳(メタデータ) (2024-04-07T03:08:14Z) - KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache [67.9776980972508]
我々はKIVIというチューニング不要な2ビットKVキャッシュ量子化アルゴリズムを開発した。
KIVI は Llama, Falcon, Mistral のモデルを $mathbf2.6times$ less peak memory を使用しながらほぼ同じ品質を維持することができる。
論文 参考訳(メタデータ) (2024-02-05T06:06:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。