論文の概要: Memory Inception: Latent-Space KV Cache Manipulation for Steering LLMs
- arxiv url: http://arxiv.org/abs/2605.06225v1
- Date: Thu, 07 May 2026 13:19:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-08 22:27:11.831977
- Title: Memory Inception: Latent-Space KV Cache Manipulation for Steering LLMs
- Title(参考訳): メモリインセプション:ステアリングLDMのための潜時空間KVキャッシュ操作
- Authors: Andy Zeyi Liu, Michael Zhang, Ilana Greenberg, Adam Alnasser, Lucas Baker, John Sous,
- Abstract要約: メモリインセプション(MI)は、テキスト由来のキーバリュー(KV)バンクを選択層のみに挿入することで、遅延注意空間におけるステアリングを行う。
MIはステアリングを選択的KVアロケーションとして扱い、モデルがそれに向かう場所のみ潜在スロットを注入する。
MIは可視文字を書き換えることなく、中間会話の振る舞いシフトをサポートし、Qwen3上で最も高いシフト後アライメントを実現している。
- 参考スコア(独自算出の注目度): 8.100686026470981
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Steering large language models (LLMs) is usually done by either instruction prompting or activation steering. Prompting often gives strong control, but caches guidance tokens at every layer and can clutter long interactions; activation steering is compact but typically weaker and does not support large structured reminders. We introduce memory inception (MI), a training-free method that steers in latent attention space by inserting text-derived key-value (KV) banks only at selected layers. Rather than materializing reminder content throughout the prompt cache, MI treats steering as selective KV allocation, injecting latent slots only where the model routes to them. On matched personality-steering tasks, MI gives the best overall control--drift trade-off, remaining competitive with prompting while consistently outperforming CAA. On updateable guidance, MI supports mid-conversation behavior shifts without rewriting the visible transcript, achieving the highest post-shift alignment on Qwen3. On structured reasoning, MI outperforms visible prompting on HARDMath and PHYSICS (10/12 subject$\times$mode cells), serving as proxies for structured reasoning in verifiable domains, while cutting content-matched KV storage by up to 118$\times$. These results position MI as a powerful steering method when guidance is persistent, structured, or expensive to keep in the visible transcript.
- Abstract(参考訳): 大規模言語モデル(LLM)のステアリングは通常、命令プロンプトまたはアクティベーションステアリングによって行われる。
プロンプティングはしばしば強力な制御を与えるが、キャッシュはすべての層でガイダンストークンをキャッシュし、長いインタラクションを妨害することができる。
本稿では,テキスト由来キーバリュー(KV)バンクを選択層にのみ挿入することで,遅延注意空間を操縦する学習自由度手法であるメモリインセプション(MI)を紹介する。
プロンプトキャッシュ全体を通してリマインダーコンテンツを実体化する代わりに、MIはステアリングを選択的なKVアロケーションとして扱い、モデルがルーティングする場所のみに遅延スロットを注入する。
マッチングされたパーソナリティ-ステアリングタスクでは、MIは最高のコントロール-ドリフトトレードオフを与え、CAAを継続的に上回りながら、プロンプトと競争し続ける。
更新可能なガイダンスでは、MIは可視的な書き起こしを書き換えることなく、会話中の振る舞いシフトをサポートし、Qwen3上で最も高いシフト後アライメントを実現している。
構造化推論では、MI は HARDMath と PHYSICS (10/12 subject$\times$mode cells) で可視性に優れ、検証可能なドメインにおける構造化推論のプロキシとして機能し、コンテンツマッチング KV ストレージを 118$\times$ までカットする。
これらの結果から、MIは、案内が持続的、構造的、あるいは高価な場合の強力な操舵方法として位置づけられ、可視的文字起こしを保たれる。
関連論文リスト
- Towards Joint Quantization and Token Pruning of Vision-Language Models [53.978753457744055]
トークンプルーニングと低ビット量子化は、推論コストの削減を補完する。
我々は、低ビット推論と決定論的視覚トーケンプルーニングを統一する協調量子化&プルーニングフレームワークを提案する。
標準VLMベンチマークの実験では、同じ低ビット状態下でのステージワイドベースラインよりもロバスト性が改善された。
論文 参考訳(メタデータ) (2026-04-19T08:18:29Z) - Beyond Attention Magnitude: Leveraging Inter-layer Rank Consistency for Efficient Vision-Language-Action Models [75.27089289058613]
textbfTIES(textbfTau-guided textbfInter-layer textbfEfficient textbfSelection)は、層間トークンランキングの整合性によって導かれる動的フレームワークである。
CogACT + SIMPLERベンチマークでは、TIESは平均成功率を6%改善し、トークン使用率を78%削減した。
論文 参考訳(メタデータ) (2026-03-26T02:13:03Z) - Spectral Attention Steering for Prompt Highlighting [37.585557690347905]
既存のアテンションステアリング法では、フルアテンションマトリックスの明示的な保存が必要である。
本稿では,この課題に対処するトレーニングフリーステアリング手法であるSEKA(Spectral Editing Key Amplification)を紹介する。
我々はこれを、プロンプトのセマンティックな意図に基づいて専門家のサブスペースを動的に結合するために、トレーニング不要なルーティング機構を使用するクエリ適応型であるAdaptive SEKA(AdaSEKA)に拡張する。
論文 参考訳(メタデータ) (2026-03-01T21:35:09Z) - KV-Embedding: Training-free Text Embedding via Internal KV Re-routing in Decoder-only LLMs [12.949322198287417]
凍結LDMの潜在表現力を活性化するフレームワークであるKV-Embeddingを提案する。
提案手法では, 各層における最終トークンのキー値(KV)状態が, シーケンスの圧縮されたビューを符号化する。
KV-Embeddingは,最大4,096個のトークンに対して堅牢な性能を維持しつつ,トレーニング不要のベースラインを最大10%向上させることを示す。
論文 参考訳(メタデータ) (2026-01-03T02:55:43Z) - Cache What Lasts: Token Retention for Memory-Bounded KV Cache in LLMs [26.951325519894525]
本稿では,軽量保持ゲートを介して各トークンの創出時の本質的な重要性を学習する手法を提案する。
我々は,特に低メモリ環境において,強い信念と学習可能な検索ベースラインを一貫して上回ることを示す。
一部の設定ではフルキャッシュモデルを超えており、選択的な保持が正規化の一形態として機能することを示している。
論文 参考訳(メタデータ) (2025-12-03T00:20:35Z) - Judge Q: Trainable Queries for Optimized Information Retention in KV Cache Eviction [53.83828564664595]
大規模言語モデル(LLM)は、キー値(KV)キャッシュを使用して、シーケンス処理中に履歴情報を格納する。
KVキャッシュ消去の現在の方法は、通常、プレフィルフェーズからの最後のウィンドウをクエリとして利用し、消去のためのKV重要度スコアを計算する。
ソフトトークンリストを組み込んだ新しいトレーニング手法であるジャッジQを提案する。
論文 参考訳(メタデータ) (2025-09-13T03:34:12Z) - Steering Information Utility in Key-Value Memory for Language Model Post-Training [16.655945393684373]
本稿では,ポストトレーニング中の言語モデル(LM)におけるパラメトリック情報利用を促進する軽量な手法であるInfoSteerを紹介する。
この単純なガイダンスは、分散内(ID)とアウト・オブ・ディストリビューション(OOD)の評価において、15のダウンストリームタスクで一貫したパフォーマンス改善をもたらす。
我々の研究は、バニラポストトレーニングが事前トレーニング中に得られる可能性を完全に活用していないこと、そして、潜在表現空間におけるLMの操舵は、性能と解釈可能性の両方を高めるための有望なアプローチであることを示している。
論文 参考訳(メタデータ) (2025-07-07T16:13:21Z) - Command-V: Pasting LLM Behaviors via Activation Profiles [67.07238260037839]
Command-Vはバックプロパゲーションフリーな行動伝達法である。
既存の残留活性化アダプタをドナーモデルからコピーし、その効果を受信モデルに貼り付ける。
論文 参考訳(メタデータ) (2025-06-23T21:21:49Z) - Activation-aware Probe-Query: Effective Key-Value Retrieval for Long-Context LLMs Inference [56.71209737306054]
我々は,プローブ-textbfQuery を動的に決定し,関連する textbfKV ペアを推論するために利用する,トレーニングフリーの textbfActivation-aware アプローチである textbfActQKV を提案する。
Long-Bench と $infty$ Benchmarks の実験では、競合する推論品質とリソース効率を備えた最先端のパフォーマンスが実証されている。
論文 参考訳(メタデータ) (2025-02-19T08:50:44Z) - Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity [24.118503938098307]
textscPoDはトークンの重要度に応じてメモリを割り当てる。
textscPoDは、パフォーマンスを損なうことなく、KVキャッシュメモリ使用量を最大35%削減する。
論文 参考訳(メタデータ) (2024-12-03T08:29:27Z) - Training-Free Exponential Context Extension via Cascading KV Cache [49.608367376911694]
カスケードサブキャッシュバッファを利用して,最も関連性の高いトークンを選択的に保持する機構を導入する。
本手法は,1Mトークンのフラッシュアテンションと比較して,プリフィルステージ遅延を6.8倍削減する。
論文 参考訳(メタデータ) (2024-06-24T03:59:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。