論文の概要: Making Implicit Preservation Intent Explicit in Conversational Image Editing
- arxiv url: http://arxiv.org/abs/2607.07051v1
- Date: Wed, 08 Jul 2026 06:26:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 22:50:30.306093
- Title: Making Implicit Preservation Intent Explicit in Conversational Image Editing
- Title(参考訳): 会話画像編集における暗黙の保存意図の明示化
- Authors: Soomin Han, Jihyung Ahn, Bumsoo Kim, Buru Chang,
- Abstract要約: OCCUR-Benchは,対話画像編集における時間保存の診断ベンチマークである。
また、履歴的な視覚的参照をペアリングすることで、暗黙の保存を明示するトレーニング不要のフレームワークであるReSpecも提案する。
- 参考スコア(独自算出の注目度): 13.1235140124427
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Conversational image editing requires preserving not only visible content, but also content that temporarily disappears across turns. When newly added or modified content occludes a previously visible region, that region should reappear if it was never semantically changed. However, existing systems often fail to recover such occluded-but-unchanged content, producing inconsistent or hallucinated results. We introduce OCCUR-Bench, a diagnostic benchmark for temporal preservation in conversational image editing. OCCUR-Bench provides diverse occlusion-and-revelation scenarios with historical restoration references, enabling evaluation of faithful restoration rather than plausible regeneration. We also propose ReSpec, a training-free framework that makes implicit preservation explicit by pairing restoration-aware instructions with historical visual references. Given an editing history, ReSpec identifies what should persist, selects the historical image state that provides missing visual evidence, and conditions an in-context editor on the resulting instruction and reference image. Experiments show that ReSpec improves restoration fidelity and temporal consistency on OCCUR-Bench, highlighting the need to ground preservation in editing history rather than only the current image.
- Abstract(参考訳): 会話的な画像編集には、可視コンテンツだけでなく、ターン中に一時的に消えるコンテンツも保存する必要がある。
新たに追加されたコンテンツや修正されたコンテンツが、以前見えていた領域を排除した場合、その領域はセマンティックに変更されていなければ再び現れるべきである。
しかし、既存のシステムはそのような排他的内容の回復に失敗することが多く、矛盾や幻覚的な結果をもたらす。
OCCUR-Benchは,対話画像編集における時間保存の診断ベンチマークである。
OCCUR-Benchは、様々な隠蔽と再発見のシナリオを歴史的復元基準と共に提供し、信頼性の高い再生よりも忠実な回復を評価することができる。
また,リカバリ対応命令と過去の視覚的参照をペアリングすることで,暗黙の保存を明示する,トレーニング不要のフレームワークであるReSpecを提案する。
編集履歴が与えられた後、ReSpecは持続すべきものを識別し、視覚的証拠の欠如を提供する履歴画像状態を選択し、結果の命令と参照画像に対してコンテキスト内エディタを条件とする。
実験により、ReSpecはOCCUR-Benchの復元精度と時間的一貫性を改善し、現在の画像だけでなく、編集履歴の保存の必要性を強調した。
関連論文リスト
- Position Rebinding Cache Reuse: Replay-Free Visual Revisiting for Interleaved Multimodal Reasoning [51.563653495547335]
マルチモーダル推論は、マルチステップ生成中に視覚的証拠を再考することによって、視覚的接地を改善する。
再生不要な視覚的再考のためのキャッシュレベルフレームワークであるPlace Rebinding Cache Reuse (PRCR)を提案する。
PRCRはリプレイレベルまたはパフォーマンスの向上を実現し、平均精度を5%向上し、視覚的再考を最大数万倍削減する。
論文 参考訳(メタデータ) (2026-06-25T05:47:52Z) - PermaVid: Consistent Video Generation Across Edits via Disentangled Context Memory [80.58558679163197]
PermaVidは、空間コンテキストを意味的な外観と幾何学的構造に分解するマルチモーダルなコンテキストメモリ上に構築された新しいフレームワークである。
本手法は,編集後の長期的セマンティクスと構造的整合性を強く維持し,最先端の手法よりも優れていた。
論文 参考訳(メタデータ) (2026-06-15T09:20:32Z) - ResetEdit: Precise Text-guided Editing of Generated Image via Resettable Starting Latent [45.3757356193519]
近年の拡散モデルにより高品質の画像生成が可能となり, ポストジェネレーションの需要が高まっている。
再生可能な潜伏情報を直接生成プロセスに埋め込むプロアクティブな拡散編集フレームワークであるResetEditを提案する。
安定拡散に基づいて構築されたResetEditは、既存のチューニング不要な編集メソッドとシームレスに統合され、制御性と視覚的忠実性の両方において、最先端のベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2026-04-28T02:05:08Z) - DocRevive: A Unified Pipeline for Document Text Restoration [8.164723249655319]
本稿では,最先端の光学文字認識(OCR)と高度な画像解析を組み合わせた,新しい統合パイプラインを提案する。
各種文書劣化シナリオをシミュレートする,30,078個の文書画像の合成データセットを作成する。
拡散ベースのモジュールはテキスト、フォント、サイズ、アライメントをシームレスに再統合する。
論文 参考訳(メタデータ) (2026-04-11T07:50:20Z) - RefSTAR: Blind Facial Image Restoration with Reference Selection, Transfer, and Reconstruction [75.00967931348409]
本稿では,参照選択,移動,再構成を考慮した新しいブラインド顔画像復元手法を提案する。
種々のバックボーンモデルによる実験は優れた性能を示し、より優れたアイデンティティ保存能力と参照特徴伝達品質を示す。
論文 参考訳(メタデータ) (2025-07-14T16:50:29Z) - RestorerID: Towards Tuning-Free Face Restoration with ID Preservation [18.022455458259305]
本研究では,顔修復時のID保存を取り入れたRestorerIDというチューニング不要な手法を提案する。
そこで本研究では,ID注入とベースブラインド顔復元モデルを組み合わせた統合フレームワークを提案する。
Celeb-Refデータセットと実世界のシナリオの実験結果から、RestorerIDはID保存による高品質な顔復元を効果的に実現することが示された。
論文 参考訳(メタデータ) (2024-11-21T13:50:25Z) - SPIRE: Semantic Prompt-Driven Image Restoration [66.26165625929747]
セマンティック・復元型画像復元フレームワークであるSPIREを開発した。
本手法は,復元強度の量的仕様を言語ベースで記述することで,より詳細な指導を支援する最初のフレームワークである。
本実験は, SPIREの修復性能が, 現状と比較して優れていることを示すものである。
論文 参考訳(メタデータ) (2023-12-18T17:02:30Z) - RIGID: Recurrent GAN Inversion and Editing of Real Face Videos [73.97520691413006]
GANのインバージョンは、実画像に強力な編集可能性を適用するのに不可欠である。
既存のビデオフレームを個別に反転させる手法は、時間の経過とともに望ましくない一貫性のない結果をもたらすことが多い。
我々は、textbfRecurrent vtextbfIdeo textbfGAN textbfInversion and etextbfDiting (RIGID) という統合されたリカレントフレームワークを提案する。
本フレームワークは,入力フレーム間の固有コヒーレンスをエンドツーエンドで学習する。
論文 参考訳(メタデータ) (2023-08-11T12:17:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。