論文の概要: Multimodal Knowledge Edit-Scoped Generalization for Online Recursive MLLM Editing
- arxiv url: http://arxiv.org/abs/2607.01978v1
- Date: Thu, 02 Jul 2026 10:10:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.784201
- Title: Multimodal Knowledge Edit-Scoped Generalization for Online Recursive MLLM Editing
- Title(参考訳): オンライン再帰的MLLM編集のためのマルチモーダル知識編集型一般化
- Abstract要約: 既存のエディタは、編集の信頼性と長期安定性に重点を置いているが、編集のセマンティックバウンダリを制御することはめったにない。
そこで我々は,スコープ対応のオンラインエディタであるScopeEditを提案し,各更新をモダリティローカルな吸収ブランチとエビデンス付き共有一般化ブランチに分解する。
実験の結果,ScopeEditはスコープ内クロスモーダル転送とスコープ外ローカリティのトレードオフを一貫して改善することがわかった。
- 参考スコア(独自算出の注目度): 10.097690069767525
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Online multimodal knowledge editing requires injecting a continual stream of visual-textual corrections into multimodal large language models (MLLMs) with bounded overhead and minimal disruption to unrelated behaviors. Existing editors mainly emphasize edit reliability and long-horizon stability, but rarely control the semantic boundary of each edit. Our pilot analyses of post-edit behaviors and internal neuronal activities reveal a scope gap behind reliable edits: instance-level success neither guarantees transfer to valid cross-modal variants nor prevents leakage to unrelated inputs, while edit-related cross-modal responses concentrate in deeper semantic layers. Therefore, we formulate Edit-Scoped Generalization, reframing online MLLM editing from merely correcting an instance to controlling the propagation boundary of each edit. To this end, we propose ScopeEdit, a scope-aware online editor that decomposes each update into a modality-local absorption branch and an evidence-gated shared generalization branch. The local branch supports stable edit absorption, whereas the shared branch enables cross-modal propagation only when visual and textual evidence are sufficiently aligned. Both branches perform scope-separated write geometries in orthogonal low-rank spaces and maintain branch-wise preconditioners via Sherman--Morrison recursions, yielding constant per-edit overhead. Extensive experiments across diverse benchmarks, long-horizon edit streams, MLLM backbones, real-world VLKEB scenarios, and complex vision-language architectures show that ScopeEdit consistently improves the trade-off between in-scope cross-modal transfer and out-of-scope locality, while preserving edit reliability, stability and online efficiency. Our code is available at https://github.com/lab-klc/ScopeEdit.
- Abstract(参考訳): オンラインマルチモーダル知識編集では、視覚的・テクスチャ的修正の連続ストリームを、制約付きオーバーヘッドと無関係な振る舞いに対する最小限の破壊を伴うマルチモーダル大言語モデル(MLLM)に注入する必要がある。
既存のエディタは、編集の信頼性と長期安定性に重点を置いているが、編集のセマンティックバウンダリを制御することはめったにない。
編集後の行動と神経活動のパイロット分析では、信頼できる編集の背景にあるスコープギャップが明らかになっている: インスタンスレベルの成功は、有効なクロスモーダル変種への転送を保証せず、無関係な入力へのリークを防ぎ、編集に関連するクロスモーダル応答はより深いセマンティック層に集中する。
そこで我々は,オンラインMLLM編集を単にインスタンスを修正することから,各編集の伝播境界を制御することで,編集-スコープ一般化を定式化する。
この目的のために、スコープ対応のオンラインエディタであるScopeEditを提案し、各更新をモダリティローカル吸収ブランチとエビデンス付き共有一般化ブランチに分解する。
ローカルブランチは安定した編集吸収をサポートし、共有ブランチは、視覚的およびテキスト的証拠が十分に一致している場合にのみ、クロスモーダルな伝搬を可能にする。
両方のブランチは、直交低ランク空間でスコープ分離書き込みジオメトリを実行し、シャーマン-モリソン再帰を通じてブランチワイドプレコンディショナーを維持する。
多様なベンチマーク、長い水平編集ストリーム、MLLMバックボーン、現実世界のVLKEBシナリオ、複雑な視覚言語アーキテクチャの広範な実験により、ScopeEditは、編集の信頼性、安定性、オンライン効率を保ちながら、スコープ内のクロスモーダル転送とスコープ外のローカリティの間のトレードオフを一貫して改善している。
私たちのコードはhttps://github.com/lab-klc/ScopeEditで公開されています。
関連論文リスト
- Towards Localized and Disentangled Knowledge Editing for Multimodal Large Language Models [12.330598426331091]
局所的および遠方的知識編集は、ファクト固有のモデル層をローカライズし、無関係なものからターゲット関連インプットを無関係にすることで、正確で一般化された編集を実現する。
LDKEは、高い局所性を維持しながら、関連するコンテキストに編集を伝達する際の優れた性能を実証する。
論文 参考訳(メタデータ) (2026-05-28T12:06:39Z) - Reasoning to Align: Implicit Reasoning in Diffusion Transformers for Video Editing [55.211537893248675]
本稿では,2つの補完コンポーネントを中心に構築された暗黙の推論ビデオ編集用DiTフレームワークであるRVEDiTを提案する。
RVEDiTは最先端のベースラインを一貫して上回り、特にローカライズされた編集や構成的な編集において大きな利益を得ている。
論文 参考訳(メタデータ) (2026-05-23T17:22:14Z) - Beyond Binary Edits Robust Multimodal Knowledge Editing with Adversarial Subspace Alignment [17.054864006712318]
マルチモーダル大規模言語モデル(MLLM)は、既存の能力を劣化させることなく知識を更新するための効率的なメカニズムを必要とする。
内在的マルチモーダル知識編集では、しばしば限定的な一般性を示し、意味論的に等価な視覚的・言語的なバリエーションをまたいだ編集の伝播に失敗する。
この問題は、明示的な意味的監督の欠如、厳密な編集範囲、高次元マルチモーダル空間における個々のサンプルへの偏りによるアンカーの欠如から生じる。
我々は、意味論的に等価なマルチモーダル入力をグループ化する知識ユニットを形式化し、各ユニット内の一貫した予測として一般性を定義する。
論文 参考訳(メタデータ) (2026-05-22T15:46:10Z) - Modality-Decoupled Online Recursive Editing [21.86720581525853]
生涯MLLM適応のためのモダリティ分離オンラインエディタM-OREを提案する。
M-OREは、統一された近近射影の定式化から派生し、シャーマン・モリソン再帰を伴う閉形式のアップデートを認める。
テキストスタックとビジュアルプロジェクタのモジュール単位のローカリティ統計を保持し、視覚的に支配的な更新シェーピングを回避し、固定されたローランク編集サブスペースで連続的な更新を実行する。
論文 参考訳(メタデータ) (2026-05-19T03:11:54Z) - DSCA: Dynamic Subspace Concept Alignment for Lifelong VLM Editing [1.6830191160943109]
生涯の編集は難しい作業であり、これまで学んだ概念を乱す傾向がある。
現在の手法では、知識を構造的に分離するのではなく、最適化によって編集をアルゴリズムで制御している。
本稿では,この制限を緩和する動的部分空間概念アライメント(DSCA)を提案する。
本手法は,1回の編集で98%,1000回の編集後に95%以上,幻覚を3~5%,連続的なチューニングチューニングベンチマークで最高の後方転送(BWT)スコアが得られた。
論文 参考訳(メタデータ) (2026-04-09T08:25:54Z) - Shifting the Breaking Point of Flow Matching for Multi-Instance Editing [47.32746672482526]
本稿では,共同注意操作を分割し,インスタンス固有のテキスト命令と空間領域間の結合を強制する機構であるインスタンス・ディスタングル・アテンションを紹介する。
提案手法は,グローバルな出力コヒーレンスを保ちながら,編集のゆがみと局所性を促進し,単一パスのインスタンスレベルの編集を可能にする。
論文 参考訳(メタデータ) (2026-02-09T14:52:45Z) - O-DisCo-Edit: Object Distortion Control for Unified Realistic Video Editing [88.93410369258203]
O-DisCo-Editは、新しいオブジェクト歪み制御(O-DisCo)を組み込んだ統合フレームワークである
この信号はランダムノイズと適応ノイズに基づいて、単一の表現内に幅広い編集キューを柔軟にカプセル化する。
O-DisCo-Editは、効果的なトレーニングパラダイムによる効率的な高忠実な編集を可能にする。
論文 参考訳(メタデータ) (2025-09-01T16:29:39Z) - MEMOIR: Lifelong Model Editing with Minimal Overwrite and Informed Retention for LLMs [76.28901550926021]
寿命の長いモデル編集のための既存の方法は、妥協の一般化、過去の編集の妨害、長い編集シーケンスへのスケールの失敗である。
我々は,学習済みモデルのコア能力を保ちながら,残メモリを介して知識を注入する,新しいスケーラブルなフレームワークMEMOIRを提案する。
MeMOIRは信頼性、一般化、ローカリティのメトリクスにまたがる最先端のパフォーマンスを実現し、最小限の忘れ物で数千のシーケンシャルな編集にスケールする。
論文 参考訳(メタデータ) (2025-06-09T16:16:42Z) - Image Editing As Programs with Diffusion Models [69.05164729625052]
本稿では,Diffusion Transformer (DiT) アーキテクチャ上に構築された統合画像編集フレームワークである IEAP (Image Editing As Programs) を紹介する。
IEAPは、複雑な編集命令を原子操作のシーケンスに分解して、リダミストレンズによる命令編集にアプローチする。
我々のフレームワークは、特に複雑なマルチステップ命令に対して、より優れた精度とセマンティック忠実度を提供する。
論文 参考訳(メタデータ) (2025-06-04T16:57:24Z) - AnyEdit: Edit Any Knowledge Encoded in Language Models [76.28789588247659]
大規模言語モデル(LLM)のための新しい自動回帰編集パラダイムであるAnyEditを提案する。
長い形式の知識を逐次チャンクに分解し、各チャンク内のキートークンを反復的に編集し、一貫性と正確な出力を保証する。
UnKEBench、AKEW、そして我々の長文の多様な知識のための新しいEditEverythingデータセットを含むベンチマークでは、強いベースラインを21.5%上回っている。
論文 参考訳(メタデータ) (2025-02-08T16:18:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。