論文の概要: Written as a Record, Read as an Address: What a Forward Pass Leaves in an Operation's KV Cache
- arxiv url: http://arxiv.org/abs/2609.24635v1
- Date: Mon, 21 Sep 2026 14:16:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-22 20:29:01.318874
- Title: Written as a Record, Read as an Address: What a Forward Pass Leaves in an Operation's KV Cache
- Title(参考訳): レコードとして書き、アドレスとして読む:オペレーションのKVキャッシュにフォワードパスが残すもの
- Abstract要約: 言語モデルは、"Box F と Box B の内容をスワップする" ような操作を読み取る。
そのフォワードパスは、これらのトークンのキーと値をKVキャッシュに書き込む。
オペレーションスパンで何を書いているのか、どのようにアクセスされているのかを尋ねます。
- 参考スコア(独自算出の注目度): 0.08594140167290099
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: When a language model reads an operation such as "Swap the contents of Box F and Box B", its forward pass writes keys and values for those tokens into the KV cache. Prior work on entity tracking establishes what models use: bindings are resolved at query time rather than stored as explicit latent state. We ask what they write at the operation span and how it is accessed. We split a forward pass into a frozen writer and a reader: the writer's cache is recomputed without gradients, while the reader sees only the instruction and operation tokens, with all state descriptions hidden, and is trained in isolation. Anything the reader recovers was therefore already present in the unmodified cache. On a synthetic boxes task, a base reader recovers $\leq 0.06$ of queried bindings against $0.75$--$1.00$ after training, and recoverability tracks the operation's read/write footprint. We find two modes of access. Across Llama-3.1-8B and Mistral-7B, operation-span transplants causally redirect which visible state is read even when the two worlds hold identical values, revealing a routing record. Isolation training preserves routing and adds direct access to the payload, the value the operation read, from the single operand-name token in a narrow mid-depth band (layers 12--15 of 32 in Llama-3.1-8B, 14--17 in Mistral-7B) --- the same site that holds the routing record. The same recipe extends to further operations, ToMi and GSM8K, but is bounded by training coverage and costs open-book accuracy. Operation tokens thus leave localized, causally recoverable records that support both routing and direct payload access, though the model that writes them reads mainly the address they carry and not the value.
- Abstract(参考訳): 言語モデルが"Box FとBox Bの内容をスワップする"などの操作を読み込むと、そのフォワードはこれらのトークンのキーと値をKVキャッシュに書き込む。
バインディングは明示的な潜在状態として格納されるのではなく、クエリ時に解決される。
オペレーションスパンで何を書いているのか、どのようにアクセスされているのかを尋ねます。
フォワードパスをフリーズライターとリーダに分割します。ライターのキャッシュはグラデーションなしで再計算され、読み手は命令と操作トークンのみを見て、すべての状態記述を隠蔽し、独立してトレーニングされます。
従って、リーダがリカバリしたものはすべて、修正されていないキャッシュにすでに存在していました。
合成ボックスタスクでは、ベースリーダーがトレーニング後に$0.75$-1.00$に対して$\leq 0.06$のクエリドバインディングをリカバリし、リカバリ可能性は操作の読み取り/書き込みフットプリントを追跡する。
アクセスには2つのモードがあります。
Llama-3.1-8B と Mistral-7B にまたがって、2つの世界が同一の値を持つ場合でも、どの可視状態を読み取るかを因果的にリダイレクトし、ルーティング記録を明らかにする。
分離トレーニングは、ルーティングを保存し、ペイロードへの直接アクセス、オペレーションが読み取る値、狭い中深帯域(Llama-3.1-8Bのレイヤ12-15、Mistral-7Bの14-17、Mistral-7Bのレイヤ12-15)の単一のオペランド名トークンから、ルーティングレコードを保持する。
同じレシピは、ToMiとGSM8Kのさらなる操作にまで拡張されるが、トレーニングカバレッジによって制限され、オープンブックの精度が犠牲になる。
したがって、オペレーショントークンは、ルーティングと直接ペイロードアクセスの両方をサポートするローカルで因果的に復元可能なレコードを残している。
関連論文リスト
- KVShareArena: KV-Cache Reuse Across Contexts and Model Checkpoints [14.86076891340077]
KVShare-cacheは、取得したチャンクとエージェントレポートのプロンプトコンテキストとモデルチェックポイントをまたいだ再利用を行う。
再計算を必要としない修正位置は、質問が一度に複数の情報源を必要とするまで十分である。
KVArena-cacheはキャッシュなしと完全再計算の間のギャップを割ってすべてのメソッドをスコアする。
論文 参考訳(メタデータ) (2026-09-09T14:53:45Z) - SkillZip Pro: Execution-Aware Dynamic Compression of Progressively Loaded Skills for Self-Evolving Agents [48.36946103539268]
完全かつ段階的に装填されたスキルバンドルのための評価フリー圧縮機である。
メソッドはファイルを圧縮し、ルートや宣言された環境契約がすでに提供している場合、参照またはサブスキルからコンテンツを削除する。
ルーティングを保存するため、必要なファイルと直接呼び出し可能なエントリは書き直し後も到達可能である。
論文 参考訳(メタデータ) (2026-08-31T13:41:16Z) - KeyPooling: Measuring Where LLM API Relay Paths Collapse Prompt Cache Isolation [53.952294884822955]
大規模言語モデル(LLM)APIは、顧客の認証を別々に行うが、多くの場合、共有プロバイダ認証を通じて要求を転送する。
KeyPoolingは、キャッシュのルックアップと書き込みを通じて顧客のアイデンティティをトレースする測定方法である。
すべての顧客がプロバイダ強化されたドメインに入る必要があります。
論文 参考訳(メタデータ) (2026-08-18T08:12:34Z) - Back from the Future: Key-Value Cache Management by Counter-Causal Surprise [67.1056509495879]
近年,キーバリュー(KV)キャッシュ管理が重要な研究方向として注目されている。
より最近のトークンからよく予測できる過去のトークンは冗長である,という洞察に動機づけられた,単純かつ効果的なKV消去スキームを提案する。
我々は,他の最先端手法と比較して,競争力や性能向上を示す各種オープンソースLCMとベンチマークデータセットについて,我々の戦略を評価した。
論文 参考訳(メタデータ) (2026-07-30T02:42:51Z) - Models Take Notes at Prefill: KV Cache Can Be Editable and Composable [0.3951796994513004]
プリフィックスキャッシュは、正確に共有されたプレフィックスでのみプリフィルを再利用するので、1つの変更フィールドはダウンストリームキャッシュ全体を無効にする。
しかし、フィールド自身のキー/値ベクトルを上書きし、残りを再利用すると、モデルは古い値に作用する。
4つのモデルファミリに因果的に確立された理由は、プレフィル時にすでにフィールド条件の結論を下流のノートに書いていたからである。
健全なエラトゥムはメモを修正し、チェーン・オブ・シントでフィールドを編集するだけで決定を回復する(1.00 at 8B, 1% 計算)が、CoTがなければ無視される。
論文 参考訳(メタデータ) (2026-06-14T15:31:23Z) - Leyline: KV Cache Directives for Agentic Inference [0.11099872871193028]
レイラインはエージェント編集のためのサーブサイドプリミティブである。
宣言的ディレクティブ4タプルは、編集対象と位置正当性を維持する方法とを分離する。
同じインターフェースを介してルーティングされる10行のトランケーション規則は、デバッグジャムにおいてエージェントの解率+14.3 ppを上昇させる。
論文 参考訳(メタデータ) (2026-05-31T07:13:15Z) - HoReN: Normalized Hopfield Retrieval for Large-Scale Sequential Model Editing [12.303016850029683]
大規模言語モデルは、展開後に必然的に時代遅れになる膨大な事実知識を符号化する。
1行の作業は、ロケーション・then-edit手順を通じてベースウェイトを直接変更することで、新しい事実をインストールする。
補完ラインはベースウェイトをそのまま残し、外部メモリを通して編集をルーティングするが、ルーティングの課題に直面している。
提案するHoReNは,3つのアイデアに基づいたルーティング機能を備えたコードブックベースのエディタである。
論文 参考訳(メタデータ) (2026-05-02T15:51:31Z) - Judge Q: Trainable Queries for Optimized Information Retention in KV Cache Eviction [53.83828564664595]
大規模言語モデル(LLM)は、キー値(KV)キャッシュを使用して、シーケンス処理中に履歴情報を格納する。
KVキャッシュ消去の現在の方法は、通常、プレフィルフェーズからの最後のウィンドウをクエリとして利用し、消去のためのKV重要度スコアを計算する。
ソフトトークンリストを組み込んだ新しいトレーニング手法であるジャッジQを提案する。
論文 参考訳(メタデータ) (2025-09-13T03:34:12Z) - Command-V: Pasting LLM Behaviors via Activation Profiles [67.07238260037839]
Command-Vはバックプロパゲーションフリーな行動伝達法である。
既存の残留活性化アダプタをドナーモデルからコピーし、その効果を受信モデルに貼り付ける。
論文 参考訳(メタデータ) (2025-06-23T21:21:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。