論文の概要: Do Text Edits Generalize to Visual Generation? Benchmarking Cross-Modal Knowledge Editing in UMMs
- arxiv url: http://arxiv.org/abs/2606.00477v1
- Date: Sat, 30 May 2026 02:09:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-02 21:34:28.483202
- Title: Do Text Edits Generalize to Visual Generation? Benchmarking Cross-Modal Knowledge Editing in UMMs
- Title(参考訳): テキスト編集はビジュアル生成に一般化するか? UMMにおけるクロスモーダル知識編集のベンチマーク
- Abstract要約: 統一マルチモーダルモデル(UMM)は汎用マルチモーダルインテリジェンスにとって有望なパラダイムである。
UMMにおけるクロスモーダルな知識編集のための最初のベンチマークであるUniKEを紹介する。
テキスト側の有効性は92%に達するが、直接画像生成時のVQAの精度は18.5%に留まる。
- 参考スコア(独自算出の注目度): 40.32260654663231
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Unified multimodal models (UMMs) have emerged as a promising paradigm for general-purpose multimodal intelligence. As they are deployed in real-world applications, effectively updating internal knowledge becomes critical. While knowledge editing has matured for text-only models, it remains unclear whether edits that successfully modify textual outputs also transfer to image generation in UMMs. To study this question, we introduce UniKE, the first benchmark for cross-modality knowledge editing in UMMs, comprising 2,971 edit subjects spanning attribute and relation edits. Using VQA-based visual verification, we reveal a striking modality gap: text-side efficacy can reach approximately 92%, whereas the best overall VQA accuracy under direct image generation is only 18.5%. We further propose Reasoning-augmented Parameter Editing, which explicitly activates edited knowledge before generation and improves overall VQA accuracy for all evaluated model-editor pairs, with gains up to 18.6 percentage points. Mechanistic analysis shows that this gap is associated with partial alignment between edited textual representations and the conditioning pathways for visual generation, where edits sufficient for text outputs may remain too weak or misaligned to steer image synthesis. These findings show that textual knowledge edits do not guarantee reliable cross-modality transfer and motivate modality-aware editing methods. Our code and data are available at https://github.com/gxx27/UniKE.
- Abstract(参考訳): 統一マルチモーダルモデル(UMM)は汎用マルチモーダルインテリジェンスにとって有望なパラダイムである。
それらは現実世界のアプリケーションにデプロイされるので、内部知識を効果的に更新することが重要になります。
知識編集はテキストのみのモデルでは成熟しているが、テキスト出力の修正に成功している編集が、UMMにおける画像生成にも移行するかどうかは不明だ。
そこで本研究では,属性と関係編集を対象とする2,971件の編集対象を含む,UMMにおけるクロスモーダル知識編集のための最初のベンチマークであるUniKEを紹介する。
テキスト側の有効性は約92%に達するが、直接画像生成時のVQAの精度は18.5%に過ぎない。
さらに、生成前の編集知識を明示的に活性化し、評価されたモデル・エディター対全体のVQA精度を最大18.6ポイント向上するReasoning-augmented Parameter Editingを提案する。
メカニスティック解析により、このギャップは、編集されたテキスト表現と、テキスト出力に十分な編集が弱すぎるか、ステア画像合成に不一致であるような視覚生成のための条件付け経路との間の部分的アライメントと関連していることが示された。
これらの結果から,テキスト知識編集は信頼性の高い相互モダリティ伝達を保証せず,モダリティ認識編集手法を動機付けることが示唆された。
私たちのコードとデータはhttps://github.com/gxx27/UniKE.comで公開されています。
関連論文リスト
- Model the Edit, Not the Image: Visual Autoregressive Editing from a Source-Centric Perspective [23.408232115772833]
次世代の視覚自己回帰モデル(VAR)は強力な生成パラダイムとして登場し、高画質の画像を生成する。
我々は、共有自己回帰文脈下で、ソース条件とターゲット条件の予測を比較したtextbfEditModを提案する。
実験の結果、EditModは強力なテキストアライメントを維持しながらソースイメージの忠実度を向上し、1つのA100 GPU上で1K画像のエンドツーエンド編集をわずか1.57秒で完了することが示された。
論文 参考訳(メタデータ) (2026-08-10T03:05:09Z) - CoEditor++: Instruction-based Visual Editing via Cognitive Reasoning [98.98349220451216]
CoEditor++は、編集を"編集する方法"と"編集方法"に分解する、トレーニング不要のフレームワークである。
我々は,CoEditor++が編集タスクと編集タスクの両方において,最先端のパフォーマンスを実現することを示す。
以上の結果から,認知中心型画像編集の可能性が示唆された。
論文 参考訳(メタデータ) (2026-01-31T12:20:46Z) - SAKE: Towards Editing Auditory Attribute Knowledge of Large Audio-Language Models [96.81401797908835]
SAKEは、大規模オーディオ言語モデルにおける聴覚属性知識の編集に特化して設計された最初のベンチマークである。
我々は,信頼性,汎用性,音声/テキストの局所性,可搬性という4次元の2つのLALMに対して,7つの編集手法をベンチマークした。
結果は、編集とは無関係な属性内知識の保存、マルチモーダル推論への編集の一般化、シーケンシャルな更新の下での編集の維持といった課題を浮き彫りにする。
論文 参考訳(メタデータ) (2025-10-19T16:22:09Z) - UniEdit-I: Training-free Image Editing for Unified VLM via Iterative Understanding, Editing and Verifying [64.5307229755533]
画像編集機能を備えた統合VLMを実現するために,UniEdit-Iという新しいトレーニングフリーフレームワークを導入する。
我々は最新のBLIP3-oに基づいて提案手法を実装し,GEdit-BenchベンチマークでSOTA(State-of-the-art)性能を達成した。
論文 参考訳(メタデータ) (2025-08-05T06:42:09Z) - DualEdit: Dual Editing for Knowledge Updating in Vision-Language Models [35.10531856612373]
テキストと視覚の両方を各キー層で修正するエディタであるDualEditを提案する。
複数のVLMバックボーンとベンチマークデータセットにまたがるDualEditを評価する。
論文 参考訳(メタデータ) (2025-06-16T16:04:16Z) - GIE-Bench: Towards Grounded Evaluation for Text-Guided Image Editing [60.66800567924348]
テキスト誘導画像編集モデルを評価するための新しいベンチマークを導入する。
このベンチマークには、20種類のコンテンツカテゴリにわたる高品質な編集例が1000以上含まれている。
我々は、GPT-Image-1をいくつかの最先端編集モデルと比較する大規模な研究を行っている。
論文 参考訳(メタデータ) (2025-05-16T17:55:54Z) - K-Edit: Language Model Editing with Contextual Knowledge Awareness [71.73747181407323]
知識に基づくモデル編集は、大きな言語モデルの重みを正確に修正することを可能にする。
我々は、文脈的に一貫した知識編集を生成するための効果的なアプローチであるK-Editを提案する。
論文 参考訳(メタデータ) (2025-02-15T01:35:13Z) - IE-Bench: Advancing the Measurement of Text-Driven Image Editing for Human Perception Alignment [6.627422081288281]
テキスト駆動画像編集ベンチマークスイート (IE-Bench) を導入し, テキスト駆動画像の評価を強化する。
IE-Benchには、さまざまなソースイメージ、さまざまな編集プロンプト、およびそれに対応する結果を含むデータベースが含まれている。
また,テキスト駆動画像編集のための品質評価手法であるIE-QAを導入する。
論文 参考訳(メタデータ) (2025-01-17T02:47:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。