論文の概要: InduceKV: Fixed-Footprint Continual Adaptation of Multimodal LLMs via Inducing KV Memories
- arxiv url: http://arxiv.org/abs/2607.02010v1
- Date: Thu, 02 Jul 2026 10:45:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.794097
- Title: InduceKV: Fixed-Footprint Continual Adaptation of Multimodal LLMs via Inducing KV Memories
- Title(参考訳): インデューサKV:KV記憶の誘導による多モードLDMの固定食品型連続適応
- Abstract要約: InduceKVは、選択したトレーニングプレフィックスを注目に値するメモリエントリとして格納する検索ベースの方法である。
InduceKVはPEFT, MoE, replay, prompt-retrievalベースラインを一致したメモリ予算下で一貫して改善することを示す。
- 参考スコア(独自算出の注目度): 6.141047838371132
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multimodal large language models must adapt to evolving tasks and domains, yet continual improvement under bounded deployment footprint remains difficult because repeated parameter updates or growing replay stores can accumulate adaptation state over time. We study fixed-footprint continual adaptation: the deployed adaptation state is kept under a fixed memory budget, while the backbone model is left unchanged and task-specific updates are externalized. We propose InduceKV, a retrieval-based method that stores each selected training prefix as an attention-ready memory entry, consisting of a frozen retrieval key and compact layerwise key--value (KV) payloads that can be appended to the model's self-attention cache. Under a strict memory budget, InduceKV constructs a compact inducing set through bilevel selection: a lightweight calibration is fit for retrieval, while the selected memory balances current-task likelihood, anchor-based retention, and coverage in the frozen retrieval space. Across task-incremental instruction tuning, continual VQA, domain-incremental adaptation, and lifelong multimodal instruction tuning, InduceKV consistently improves over PEFT, MoE, replay, and prompt-retrieval baselines under matched memory budgets. We further report backbone-matched, stage-1 CoIN, compute-matched, and scalability diagnostics, showing that the gains are not due to a stronger backbone, replay alone, or an unbounded candidate pool.
- Abstract(参考訳): マルチモーダルな大規模言語モデルは、進化するタスクやドメインに適応する必要があるが、繰り返しパラメータの更新やリプレイストアの増加が時間の経過とともに適応状態を蓄積できるため、境界付きデプロイメントフットプリントでの継続的な改善は難しいままである。
配置された適応状態は固定メモリ予算の下で保持され、バックボーンモデルはそのまま残され、タスク固有の更新は外部化される。
InduceKVは、選択したトレーニングプレフィックスを、凍結した検索キーと、モデルの自己保持キャッシュに付加可能なコンパクトな階層的なキー-値(KV)ペイロードからなる、注目に値するメモリエントリとして格納する検索ベースの方法である。
軽量キャリブレーションは検索に適しており、選択されたメモリは、現在のタスク可能性、アンカーベース保持、凍結した検索空間におけるカバレッジのバランスをとる。
タスク・インクリメンタル・インストラクション・チューニング、連続VQA、ドメイン・インクリメンタル・アダプション、そして生涯にわたるマルチモーダル・インストラクション・チューニングを通じて、InduceKVは、一致したメモリ予算の下でPEFT、MoE、リプレイ、即時検索ベースラインを継続的に改善する。
さらに、バックボーンマッチング、ステージ-1 CoIN、計算マッチング、スケーラビリティ診断を報告し、その利得は、バックボーンの強化、リプレイ単独、無制限の候補プールによるものではないことを示した。
関連論文リスト
- GrowPage: On-Demand KV Budgeting for Efficient LLM Reasoning Serving [17.04616426989979]
長期出力推論により、キー値(KV)キャッシュは効率的なサービスのために重要なメモリボトルネックとなった。
既存のKV圧縮法は通常、要求毎の予算に依存し、どのKV状態が保持されているかだけを調整する。
我々は,KVのキャパシティをランタイムリソースとして扱うオンデマンドKV予算フレームワークであるGrowPageを紹介した。
論文 参考訳(メタデータ) (2026-09-03T07:53:05Z) - $μ$VLA: On Recurrent Memory for Partially Observable Manipulation in VLA Models [44.66763491853812]
本研究は,VLA背骨の再発の制御的分離について検討した。
我々の定式化は、タイムステップにまたがる学習可能なメモリトークンの小さなセットでトランスフォーマーを強化します。
我々はこれらの結果を,背骨内再発の最小限のエンベロープの校正と解釈する。
論文 参考訳(メタデータ) (2026-06-10T13:26:40Z) - MIITA: Memory-Induced Inference-Time Adaptation for Continual Learning with Small Language Models [64.2820121997882]
MIITAはメモリ駆動型推論時間適応フレームワークである。
教師付きエクスペリエンスをセマンティックアンカーを備えたコンパクトな修正指向プロトタイプとして格納し、セマンティックおよび不確実性ベースのキューを使用して推論時にそれらを検索する。
実験により、MIITAは最終性能を継続的に改善し、固定メモリの予算下での忘れを軽減している。
論文 参考訳(メタデータ) (2026-05-20T03:03:04Z) - GoTTA be Diverse: Rethinking Memory Policies for Test-Time Adaptation [54.70334474895361]
テスト時間適応(TTA)は、事前訓練されたモデルが、分散シフトの下でラベルのないテストストリームにオンラインで適応できるようにする。
ほとんどのTTA研究は適応の目的に焦点を当てているが、実用的なストリームはどのサンプルが適応を駆動するかを選択するのに使用されるメモリにも大きく依存している。
本稿では,クラスバランスアロケーションと特徴空間の多様性を組み合わせた多様性を考慮したメモリポリシーであるGOTTAについて紹介する。
論文 参考訳(メタデータ) (2026-05-19T14:18:46Z) - Improving the Performance and Learning Stability of Parallelizable RNNs Designed for Ultra-Low Power Applications [1.226598527858578]
Bistable Memory Recurrent Unit (BMRU) は、超低消費電力RNNのハードウェアとソフトウェアの共同設計を可能にするために導入された。
BMRUパフォーマンスは複雑なシーケンシャルタスクにおいて並列化可能なRNNよりも遅れている。
本稿では,永続記憶を保ちながらフローを復元し,時間経過とともにスキップ接続を生成する累積更新定式化を提案する。
論文 参考訳(メタデータ) (2026-05-12T09:39:33Z) - A Parametric Memory Head for Continual Generative Retrieval [52.66674234249913]
生成情報検索(GenIR)は、検索を単一のニューラルモデルに統合し、クエリから直接ドキュメント識別子(ドシデント)をデコードする。
逐次適応は、新たに追加された文書の検索を改善するが、以前のスライスの性能は著しく低下することを示す。
本稿では,モジュール型パラメトリックメモリヘッドで適応モデルを拡張するメモリのみの安定化ステージである,後適応メモリチューニング(PAMT)を提案する。
論文 参考訳(メタデータ) (2026-04-25T17:38:51Z) - MemDLM: Memory-Enhanced DLM Training [56.40248490616793]
Diffusion Language Models (DLM)は、Auto-Regressive (AR)モデルよりも優れた利点を提供する。
彼らは列車の干渉ミスマッチに悩まされている。
本稿では,模擬復調処理をトレーニングに組み込んだメモリ拡張DLMを提案する。
論文 参考訳(メタデータ) (2026-03-23T17:39:56Z) - TS-Memory: Plug-and-Play Memory for Time Series Foundation Models [63.21390142212087]
Time Series Foundation Models (TSFM) は大規模な事前訓練を通じて強力なゼロショット予測を実現する。
パラメトリック適応は破滅的な忘れを招き、非パラメトリック検索は予測を改善するが、データストア検索によってレイテンシが高くなる。
本稿では, TSFM を拡張した軽量メモリアダプタ TS-Memory としてParametric Memory Distillation を提案し,実装する。
論文 参考訳(メタデータ) (2026-02-12T04:16:19Z) - Training-free Context-adaptive Attention for Efficient Long Context Modeling [57.703159205740185]
トレーニングフリーコンテキスト適応注意(TCA-Attention)は、学習不要なスパースアテンション機構であり、効率的な長文推論のための情報トークンのみに選択的に参画する。
TCA-Attentionは2.8$times$のスピードアップを実現し、128Kのコンテキスト長でKVキャッシュを61%削減し、フルアテンションに匹敵するパフォーマンスを維持している。
論文 参考訳(メタデータ) (2025-12-10T01:54:57Z) - Lethe: Layer- and Time-Adaptive KV Cache Pruning for Reasoning-Intensive LLM Serving [11.750209684686707]
大きな言語モデル(LLM)による生成的推論は、しばしば長い復号シーケンスを含む。
本稿では,動的KVキャッシュ管理フレームワークLetheを提案する。
Letheは様々なモデルやタスク間で効率と生成品質のバランスを良好に保ち、スループットを最大2.56倍に向上させる。
論文 参考訳(メタデータ) (2025-11-08T14:52:43Z) - LoRC: Low-Rank Compression for LLMs KV Cache with a Progressive Compression Strategy [59.1298692559785]
キーバリュー(KV)キャッシュは、トランスフォーマーベースの自己回帰型大言語モデル(LLM)を提供する上で重要なコンポーネントである。
この問題を緩和するためのアプローチとしては、(1) アップサイクルステージに統合された効率的な注意変動、(2) テスト時のKVキャッシュ圧縮、(3) テスト時のKVキャッシュ圧縮がある。
そこで我々は,KV重み行列の低ランク近似を提案し,モデル再学習なしに既存のトランスフォーマーベースLCMとのプラグイン統合を実現する。
本手法は,テスト段階におけるアップサイクリング段階のモデルチューニングやタスク固有のプロファイリングを伴わずに機能するように設計されている。
論文 参考訳(メタデータ) (2024-10-04T03:10:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。