論文の概要: On-Demand Attention: Language Models Know When to Recall
- arxiv url: http://arxiv.org/abs/2609.20734v1
- Date: Thu, 17 Sep 2026 17:24:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-20 08:55:54.400785
- Title: On-Demand Attention: Language Models Know When to Recall
- Title(参考訳): On-Demand Attention: 言語モデルはいつリコールするかを知っている
- Abstract要約: 我々は,事前学習されたモデルの復号化状態が,世界的読解の前に予測情報を含むことを示す。
我々は,軽量なリコールヘッドを用いたローカルファースト復号法であるOn-Demand Attention (ODA)を導入する。
織田はリコールヘッドのみを運転し、事前の重量は変化せず、完全な歴史的なKVキャッシュを将来のリコール用に利用できる。
- 参考スコア(独自算出の注目度): 7.610359588704782
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reasoning and agentic workloads increasingly demand efficient long-context inference. Yet full-attention decoding reads the growing history at every step, regardless of its benefit to the next prediction. We show that a pretrained model's decoding states already contain information predictive of this benefit, before the global read. Building on this finding, we introduce On-Demand Attention (ODA), a local-first decoding method that uses a lightweight recall head to selectively invoke global attention as its predicted benefit changes during generation. ODA trains only the recall head, leaving pretrained weights unchanged and the complete historical KV cache available for future recall. We further implement GPU-side conditional execution in vLLM, translating reduced global reads into practical decoding speedups over full attention at long context lengths. Experiments across Qwen and Gemma models, including hybrid-attention backbones, show that selective recall recovers most of the performance lost under local attention while substantially reducing global reads. These findings support long-context inference in which pretrained models guide their own access to the information they retain.
- Abstract(参考訳): 推論やエージェントのワークロードでは,より効率的なロングコンテキスト推論が求められている。
しかし、フルアテンションデコーディングは、次の予測に対する利点にかかわらず、すべてのステップで成長する履歴を読み取る。
我々は,事前学習されたモデルの復号化状態が,この利点を予測できる情報を含むことを示す。
そこで本研究では,オン・デマンド・アテンション(ODA, On-Demand Attention, ODA)について紹介する。
織田はリコールヘッドのみを運転し、事前の重量は変化せず、完全なKVキャッシュを将来のリコール用に利用できる。
我々はさらに、vLLMでGPU側の条件付き実行を実装し、削減されたグローバル読み込みを、長いコンテキスト長で完全に注意を払って、実用的なデコードスピードアップに変換する。
ハイブリッドアテンションバックボーンを含むQwenモデルとGemmaモデルによる実験では、局所的な注意の下で失われたパフォーマンスの大部分を選択的リコールが回復し、グローバルな読み出しを大幅に削減することが示された。
これらの発見は、事前訓練されたモデルが保持する情報への自身のアクセスをガイドする長文推論をサポートする。
関連論文リスト
- When to Review: Spaced Repetition for Continual Pre-Training of Language Models [1.0262304700896199]
既存のリプレイ手法は、しばしばグローバルな古い/新しい混合物とサンプルを均一に選択する。
トレーニングループは、リプレイする履歴だけでなく、各ステップでどの例を返すかを決定する必要があります。
認知科学に触発された連続学習フレームワークである空間反復訓練(Spaced Repetition Training, SRT)を導入し, SuperMemo-2 (SM-2) アルゴリズムを用いてサンプルリハーサルをスケジュールする。
論文 参考訳(メタデータ) (2026-08-18T08:51:47Z) - Scaling Open-Ended Reasoning to Predict the Future [56.672065928345525]
我々は、オープンエンドの予測質問の予測を行うために言語モデルを訓練する。
トレーニングデータをスケールアップするために、毎日のニュースで報告されるグローバルイベントから新しい予測質問を合成する。
トレーニングの予測によるキャリブレーションの改善は、一般的なベンチマークで一般化されている。
論文 参考訳(メタデータ) (2025-12-31T18:59:51Z) - Learning to Focus: Prioritizing Informative Histories with Structured Attention Mechanisms in Partially Observable Reinforcement Learning [9.233407096706744]
本研究では, 動的ヘッドの自己保持機構に, 構造的インダクティブ先行を導入する。
Atari 100kベンチマークの実験では、ほとんどの効率向上がガウス以前の結果から生じることが示されている。
論文 参考訳(メタデータ) (2025-11-10T10:53:16Z) - Lost in the Middle: An Emergent Property from Information Retrieval Demands in LLMs [9.799025120435108]
大きな言語モデル(LLM)は、重要な情報が長いコンテキストの中間にあるときにしばしば劣化する。
我々は,この行動が情報損失の欠陥を示すだけでなく,事前学習中に異なる情報検索要求に適応することを提案する。
このU字型性能曲線は、LLMが長期記憶と短期記憶の要求をシミュレートする2つの単純な記憶パラダイムでスクラッチから訓練されるときに現れることを示す。
論文 参考訳(メタデータ) (2025-10-11T16:22:53Z) - Generalization v.s. Memorization: Tracing Language Models' Capabilities Back to Pretraining Data [76.90128359866462]
本稿では,出力確率と事前学習データ頻度の相関を計測する,記憶化,分布記憶化という拡張概念を導入する。
本研究は, より単純で知識集約的なタスクにおいて, 記憶がより大きな役割を担い, 一般化が, より困難で推論に基づくタスクの鍵であることを示す。
論文 参考訳(メタデータ) (2024-07-20T21:24:40Z) - An Analysis and Mitigation of the Reversal Curse [70.13419502543915]
最近の研究は、大型言語モデル(LLM)で注目すべき現象を観測している。
逆の呪文は、$a$と$b$の2つのエンティティを扱う場合、LLMは$aRb$,'という形式でシーケンスを処理するのに優れるが、$bR-1a$'を処理する場合の課題に直面することである。
論文 参考訳(メタデータ) (2023-11-13T17:01:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。