論文の概要: What Attention Recalls and Recurrence Controls in Hybrid Language Models
- arxiv url: http://arxiv.org/abs/2609.04434v1
- Date: Thu, 03 Sep 2026 19:56:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-07 18:15:23.8083
- Title: What Attention Recalls and Recurrence Controls in Hybrid Language Models
- Title(参考訳): ハイブリッド言語モデルにおける意図的リコールと再帰制御
- Abstract要約: ハイブリッド言語モデルは、注意と固定サイズのリカレント状態を組み合わせるが、それぞれのチャネルの役割は不明確である。
プリット・プレフィルは、KVキャッシュのみを保持するか、プリフィルされたコンテキストからリカレント状態だけを保持する。
State-swapは、あるコンテキストからKVキャッシュをペアにし、1つのフォワードパスで別のコンテキストからリカレントステートをペアにする。
- 参考スコア(独自算出の注目度): 8.720372709378324
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Hybrid language models combine attention with a fixed-size recurrent state, but the role of each channel remains unclear. We introduce two cache-level interventions. Split-prefill keeps only the KV cache or only the recurrent state from a prefilled context, then generates an answer. State-swap pairs the KV cache from one context with the recurrent state from another in a single forward pass. On Qwen3.5 and Falcon-H1, the two channels split sharply by function. Exact retrieval survives only through attention (64-98% of full accuracy) and collapses to zero through recurrence. Output language and persona reverse the pattern: both survive recurrence (70-80% and 3-5x) while KV-only drops to ~1% language accuracy. State-swap confirms this causally: the answer takes its value from the KV side and its language from the recurrent side. Recurrent-only generation also accepts words that were never in the context but share meaning or parts with seen items. Attention provides a lookup over what was said; the recurrent state shapes how the model says it next.
- Abstract(参考訳): ハイブリッド言語モデルは、注意を固定サイズのリカレント状態と組み合わせるが、それぞれのチャネルの役割は不明確である。
キャッシュレベルの介入を2つ導入する。
Split-prefillはKVキャッシュのみを保持するか、プリフィルされたコンテキストからリカレントステートのみを保持する。
State-swapは、あるコンテキストからKVキャッシュをペアにし、1つのフォワードパスで別のコンテキストからリカレントステートをペアにする。
Qwen3.5とFalcon-H1では、2つのチャンネルは機能的に大きく分裂した。
厳密な検索は注意(全精度の64-98%)によってのみ生存し、再発によってゼロに崩壊する。
出力言語とペルソナはどちらも再発(70-80%と3-5x)し、KVのみの精度はおよそ1%に低下する。
答は、KV側と言語から、反復側から値を取ります。
リカレント専用生成では、文脈にはない単語も受け入れるが、意味や部分とアイテムを共有できる。
再帰状態は、モデルが次に何を言うかを形作る。
関連論文リスト
- WnW: Waxing-and-Waning KV Cache for Long-Form Speech LLMs [60.6692467625441]
Waxing-and-Waning KVキャッシュはKVヘッドをオフラインキャリブレーションによってアンカー、タイダル、固定ロールに分類する。
3Bバックボーンが2つあるLibri-Speechでは、WnWはほぼフルキャッシュの精度を維持しながら、プリフィルオンリーのベースラインが終了しないGPU上のオーディオトークンの20%しか保持しない。
論文 参考訳(メタデータ) (2026-08-24T01:48:30Z) - Archer: Adaptive Reuse of Cached Hidden States for Efficient Rollback in Diffusion Language Models [28.20034213862415]
拡散言語モデル(DLM)は反復的にシーケンスを洗練し、コンテキストが進化するにつれて、以前の予測を修正できる。
更新毎にグローバルコンテキストが変更され、プロンプト状態とレスポンス状態の両方が再コンパイルされる。
効率的なロールバック(アーチャー)のための隠れた状態の適応的再利用について紹介する。
Archerは、ロールバック可能なDLMのためのトレーニング不要なKVキャッシュ手法である。
論文 参考訳(メタデータ) (2026-08-08T12:13:10Z) - Compute Globally, Materialize Locally: The Memory Contract of Sparse Event-KV [6.096767363900901]
推定とエピソード記憶のスキームは、生成した観測結果が消滅した後も、保持された事象が情報的であるという前提に留まっている。
我々は、提供されたものから、それ以外は同一のエージェント履歴にまたがる以前の観察を省略することによって、それをテストする。
意図的に表現された回答なしのイベントは、価値を指定することなく、Qwen3-8Bでドナーアラインリカバリを6%から51%に引き上げる。
論文 参考訳(メタデータ) (2026-07-26T14:37:53Z) - Position Rebinding Cache Reuse: Replay-Free Visual Revisiting for Interleaved Multimodal Reasoning [51.563653495547335]
マルチモーダル推論は、マルチステップ生成中に視覚的証拠を再考することによって、視覚的接地を改善する。
再生不要な視覚的再考のためのキャッシュレベルフレームワークであるPlace Rebinding Cache Reuse (PRCR)を提案する。
PRCRはリプレイレベルまたはパフォーマンスの向上を実現し、平均精度を5%向上し、視覚的再考を最大数万倍削減する。
論文 参考訳(メタデータ) (2026-06-25T05:47:52Z) - TGV-KV: Text-Grounded KV Eviction for Vision-Language Models [58.34044231794507]
VLM(Vision-Language Models)は自動回帰生成パラダイムを継承し、以前のトークンのキーと値(KV)をキャッシュして推論を高速化する。
VLM(TGV-KV)のためのテキスト・グラウンドKV推定法を提案する。
TGV-KVのスループットは52.6%向上し、極端な維持予算は5%となった。
論文 参考訳(メタデータ) (2026-06-02T03:06:17Z) - The Residual Stream Is All You Need: On the Redundancy of the KV Cache in Transformer Inference [3.378773775514883]
キー値(KV)キャッシュは、トランスフォーマー推論において必須の状態として広く扱われる。
各層におけるキーと値が残留ストリームの決定論的射影であることを証明する。
我々は、境界メモリ推論スキームであるKV-Directを用いて、この結果に基づいて構築する。
論文 参考訳(メタデータ) (2026-03-20T05:59:50Z) - PackCache: A Training-Free Acceleration Method for Unified Autoregressive Video Generation via Compact KV-Cache [61.57938553036056]
トレーニング不要なKVキャッシュ管理手法であるPackCacheを導入し,KVキャッシュを3つの協調機構でコンパクト化する。
効率の面では、PackCacheは48フレームの長いシーケンスで1.7-2.2倍のエンドツーエンド生成を高速化する。
論文 参考訳(メタデータ) (2026-01-07T19:51:06Z) - Sparse Attention across Multiple-context KV Cache [8.236266965773465]
推論効率を改善するために、履歴キーバリュー(KV)キャッシュを再利用することは、主流のアプローチとなっている。
近年の進歩は、KVキャッシュを選択できるスパースアテンション機構によってスループットをさらに向上させる。
本論文では,マルチコンテキストKVキャッシュにおける注意スペーシフィケーションの最初の調査であるSamKVについて述べる。
論文 参考訳(メタデータ) (2025-08-06T02:53:14Z) - Krul: Efficient State Restoration for Multi-turn Conversations with Dynamic Cross-layer KV Sharing [41.792908098945766]
我々は,KVキャッシュの正確かつ効率的な復元を可能にするマルチターンLDM推論システムであるKrulを提案する。
Krulは、レイヤペア間の注目類似性に基づいて圧縮戦略を選択し、再計算ローディングパイプラインを使用してKVキャッシュを復元する。
タイム・ツー・ファースト・トケン(TTFT)の1.5x-2.68倍の削減、KVキャッシュストレージの1.33x-2.35倍の削減を実現している。
論文 参考訳(メタデータ) (2025-07-10T01:51:17Z) - R-KV: Redundancy-aware KV Cache Compression for Reasoning Models [77.84539432982307]
共振モデル(R-KV)のための冗長性を考慮したKVキャッシュ圧縮を提案する。
R-KVはKVキャッシュの10%しか使用せず、完全なKVキャッシュ性能のほぼ100%を保っている。
驚くべきことに、R-KVは完全なKVキャッシュ性能の105%を達成し、KVキャッシュの16%を達成している。
論文 参考訳(メタデータ) (2025-05-30T02:03:24Z) - FlowKV: Enhancing Multi-Turn Conversational Coherence in LLMs via Isolated Key-Value Cache Management [48.904743679691414]
FlowKVはKVキャッシュ管理のための新しいマルチターン分離機構である。
蓄積された圧縮KVキャッシュを過去のターンから保存する。
古い文脈の再圧縮を防ぎ、破滅的な忘れを和らげる。
論文 参考訳(メタデータ) (2025-05-21T10:20:46Z) - Simple linear attention language models balance the recall-throughput tradeoff [60.06020449520365]
線形およびすべり窓の注意を結合したシンプルなアーキテクチャであるBASEDを提案する。
我々は、最大1.3bパラメータの言語モデルをトレーニングし、BASEDがパープレキシティにおいて最強のサブクワッドラティックモデルと一致し、実世界のリコール集約タスクにおいて6.22の精度ポイントでそれらのモデルを上回っていることを示す。
論文 参考訳(メタデータ) (2024-02-28T19:28:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。