論文の概要: Making Implicit Preservation Intent Explicit in Conversational Image Editing
- arxiv url: http://arxiv.org/abs/2607.07051v1
- Date: Wed, 08 Jul 2026 06:26:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 22:50:30.306093
- Title: Making Implicit Preservation Intent Explicit in Conversational Image Editing
- Title(参考訳): 会話画像編集における暗黙の保存意図の明示化
- Abstract要約: OCCUR-Benchは,対話画像編集における時間保存の診断ベンチマークである。
また、履歴的な視覚的参照をペアリングすることで、暗黙の保存を明示するトレーニング不要のフレームワークであるReSpecも提案する。
- 参考スコア(独自算出の注目度): 13.1235140124427
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Conversational image editing requires preserving not only visible content, but also content that temporarily disappears across turns. When newly added or modified content occludes a previously visible region, that region should reappear if it was never semantically changed. However, existing systems often fail to recover such occluded-but-unchanged content, producing inconsistent or hallucinated results. We introduce OCCUR-Bench, a diagnostic benchmark for temporal preservation in conversational image editing. OCCUR-Bench provides diverse occlusion-and-revelation scenarios with historical restoration references, enabling evaluation of faithful restoration rather than plausible regeneration. We also propose ReSpec, a training-free framework that makes implicit preservation explicit by pairing restoration-aware instructions with historical visual references. Given an editing history, ReSpec identifies what should persist, selects the historical image state that provides missing visual evidence, and conditions an in-context editor on the resulting instruction and reference image. Experiments show that ReSpec improves restoration fidelity and temporal consistency on OCCUR-Bench, highlighting the need to ground preservation in editing history rather than only the current image.
- Abstract(参考訳): 会話的な画像編集には、可視コンテンツだけでなく、ターン中に一時的に消えるコンテンツも保存する必要がある。
新たに追加されたコンテンツや修正されたコンテンツが、以前見えていた領域を排除した場合、その領域はセマンティックに変更されていなければ再び現れるべきである。
しかし、既存のシステムはそのような排他的内容の回復に失敗することが多く、矛盾や幻覚的な結果をもたらす。
OCCUR-Benchは,対話画像編集における時間保存の診断ベンチマークである。
OCCUR-Benchは、様々な隠蔽と再発見のシナリオを歴史的復元基準と共に提供し、信頼性の高い再生よりも忠実な回復を評価することができる。
また,リカバリ対応命令と過去の視覚的参照をペアリングすることで,暗黙の保存を明示する,トレーニング不要のフレームワークであるReSpecを提案する。
編集履歴が与えられた後、ReSpecは持続すべきものを識別し、視覚的証拠の欠如を提供する履歴画像状態を選択し、結果の命令と参照画像に対してコンテキスト内エディタを条件とする。
実験により、ReSpecはOCCUR-Benchの復元精度と時間的一貫性を改善し、現在の画像だけでなく、編集履歴の保存の必要性を強調した。
関連論文リスト
- When the Edit Changes the Patient: Measuring Identity Preservation in Counterfactual Retinal Images [44.33915499111612]
テキスト条件付き編集手法の3つのグループ – ソースアンコール,構造化プロンプト,ペアトレーニング – に対して,ID保存を明示的に測定する。
編集に匹敵する高品質なOCT画像を生成する方法がすべてあるが,その同一性は著しく異なる。
医療対実生成における今後の研究は、イメージリアリズムと編集の成功と共に、アイデンティティの保存を明示的に測定し、報告する必要があると論じる。
論文 参考訳(メタデータ) (2026-08-24T09:29:40Z) - Revisiting the Current Frame: Physical-Trace-Guided Network Output Correction for Video Restoration [20.573571456618936]
本稿では,低品質の電流フレームをビデオ復元補正のための時間的整列アンカーとして再検討するモデルに依存しないフレームワークであるANCHORを提案する。
高ダイナミックレンジビデオ復元実験とビデオデラライニングバランス実験は、様々な最先端の復元モデルにおいて一貫した改善を示す。
論文 参考訳(メタデータ) (2026-08-10T09:20:51Z) - MDTD-ArtIR: Benchmarking Image Editing and Restoration Models for Art Image Restoration under Texture-Overlay Degradations [19.59428665923708]
セマンティックな半透明な画像メディア劣化のブラインド復元のためのベンチマークを導入する。
我々は、最先端のユニバーサル復元モデルを評価する新しいデータセットとベンチマークを提案する。
実験により、画像編集モデルは任意の劣化のために特別な復元アーキテクチャを一貫して上回っていることが示された。
論文 参考訳(メタデータ) (2026-08-01T16:14:46Z) - ReDesign: Recovering Editable Design Structures from Images via Agentic Decomposition [60.25038184390257]
ReDesignは、編集可能な階層階層を成長させるエージェントフレームワークで、特定のツールを選択して、モダリティにまたがって構成する。
大規模な編集性を評価するために、909個のFigmaファイルと14,796個の編集命令からなるFigma Edit Replay Benchmarkを導入する。
論文 参考訳(メタデータ) (2026-07-28T10:53:33Z) - A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions [20.3003920492096]
本研究では,キャプション評価のためのリコンストラクションに基づく原理について検討する。
キャプションはオリジナルの画像の復元を可能にする能力に匹敵する。
我々は、下流の視覚課題にまたがる元の画像と再構成が一致するかどうかを検証した。
論文 参考訳(メタデータ) (2026-07-25T14:41:34Z) - Causal-AgentIR: Self-Evolving Causal Memory for Adaptive Image Restoration Agents [54.85451496831771]
Causal-AgentIRは階層的なマルチエージェントフレームワークであり、画像復元インテリジェンスのための自己進化型因果記憶を持つ。
分解パターン、画像領域、復元ツール、アクション、品質変更、ユーザの好みを構造化された因果記憶グラフに整理する。
このグラフはグラフベースの検索とマルチホップ因果推論をサポートしており、エージェントは特定の復元操作やツールシーケンスが異なる劣化条件下での修復品質にどのように影響するかを推測することができる。
論文 参考訳(メタデータ) (2026-07-23T09:59:44Z) - Position Rebinding Cache Reuse: Replay-Free Visual Revisiting for Interleaved Multimodal Reasoning [51.563653495547335]
マルチモーダル推論は、マルチステップ生成中に視覚的証拠を再考することによって、視覚的接地を改善する。
再生不要な視覚的再考のためのキャッシュレベルフレームワークであるPlace Rebinding Cache Reuse (PRCR)を提案する。
PRCRはリプレイレベルまたはパフォーマンスの向上を実現し、平均精度を5%向上し、視覚的再考を最大数万倍削減する。
論文 参考訳(メタデータ) (2026-06-25T05:47:52Z) - PermaVid: Consistent Video Generation Across Edits via Disentangled Context Memory [80.58558679163197]
PermaVidは、空間コンテキストを意味的な外観と幾何学的構造に分解するマルチモーダルなコンテキストメモリ上に構築された新しいフレームワークである。
本手法は,編集後の長期的セマンティクスと構造的整合性を強く維持し,最先端の手法よりも優れていた。
論文 参考訳(メタデータ) (2026-06-15T09:20:32Z) - ResetEdit: Precise Text-guided Editing of Generated Image via Resettable Starting Latent [45.3757356193519]
近年の拡散モデルにより高品質の画像生成が可能となり, ポストジェネレーションの需要が高まっている。
再生可能な潜伏情報を直接生成プロセスに埋め込むプロアクティブな拡散編集フレームワークであるResetEditを提案する。
安定拡散に基づいて構築されたResetEditは、既存のチューニング不要な編集メソッドとシームレスに統合され、制御性と視覚的忠実性の両方において、最先端のベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2026-04-28T02:05:08Z) - DocRevive: A Unified Pipeline for Document Text Restoration [8.164723249655319]
本稿では,最先端の光学文字認識(OCR)と高度な画像解析を組み合わせた,新しい統合パイプラインを提案する。
各種文書劣化シナリオをシミュレートする,30,078個の文書画像の合成データセットを作成する。
拡散ベースのモジュールはテキスト、フォント、サイズ、アライメントをシームレスに再統合する。
論文 参考訳(メタデータ) (2026-04-11T07:50:20Z) - RefSTAR: Blind Facial Image Restoration with Reference Selection, Transfer, and Reconstruction [75.00967931348409]
本稿では,参照選択,移動,再構成を考慮した新しいブラインド顔画像復元手法を提案する。
種々のバックボーンモデルによる実験は優れた性能を示し、より優れたアイデンティティ保存能力と参照特徴伝達品質を示す。
論文 参考訳(メタデータ) (2025-07-14T16:50:29Z) - RestorerID: Towards Tuning-Free Face Restoration with ID Preservation [18.022455458259305]
本研究では,顔修復時のID保存を取り入れたRestorerIDというチューニング不要な手法を提案する。
そこで本研究では,ID注入とベースブラインド顔復元モデルを組み合わせた統合フレームワークを提案する。
Celeb-Refデータセットと実世界のシナリオの実験結果から、RestorerIDはID保存による高品質な顔復元を効果的に実現することが示された。
論文 参考訳(メタデータ) (2024-11-21T13:50:25Z) - SPIRE: Semantic Prompt-Driven Image Restoration [66.26165625929747]
セマンティック・復元型画像復元フレームワークであるSPIREを開発した。
本手法は,復元強度の量的仕様を言語ベースで記述することで,より詳細な指導を支援する最初のフレームワークである。
本実験は, SPIREの修復性能が, 現状と比較して優れていることを示すものである。
論文 参考訳(メタデータ) (2023-12-18T17:02:30Z) - RIGID: Recurrent GAN Inversion and Editing of Real Face Videos [73.97520691413006]
GANのインバージョンは、実画像に強力な編集可能性を適用するのに不可欠である。
既存のビデオフレームを個別に反転させる手法は、時間の経過とともに望ましくない一貫性のない結果をもたらすことが多い。
我々は、textbfRecurrent vtextbfIdeo textbfGAN textbfInversion and etextbfDiting (RIGID) という統合されたリカレントフレームワークを提案する。
本フレームワークは,入力フレーム間の固有コヒーレンスをエンドツーエンドで学習する。
論文 参考訳(メタデータ) (2023-08-11T12:17:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。