論文の概要: BeyondMasks: Evaluating Causal and Physical Consistency in Video Object Removal
- arxiv url: http://arxiv.org/abs/2608.20107v1
- Date: Thu, 20 Aug 2026 14:37:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-21 20:28:51.599994
- Title: BeyondMasks: Evaluating Causal and Physical Consistency in Video Object Removal
- Title(参考訳): BeyondMasks:ビデオオブジェクト削除における因果一貫性と物理的一貫性の評価
- Abstract要約: 因果一貫性のあるビデオオブジェクト除去のためのベンチマークであるBeyondMasksを紹介する。
データセットは、様々な測光、幾何学、体積、動的相互作用にまたがる。
構造化視覚言語モデルに基づく評価プロトコルであるCOREを提案する。
- 参考スコア(独自算出の注目度): 27.338971504674983
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent advances in generative video models have significantly improved visual realism in video object removal, yet evaluation protocols still focus on masked region fidelity, treating removal as local inpainting. In real scenes, object removal is a causal intervention: eliminating an object also requires removing its induced physical effects, such as shadows, reflections, illumination changes, translucency, and dynamic traces. Existing benchmarks lack aligned clean references or remain limited to simplified synthetic settings, preventing systematic evaluation of causal consistency. We introduce BeyondMasks, a paired benchmark for causally consistent video object removal, consisting of temporally aligned synthetic and real world video pairs with clean background references. The dataset spans diverse photometric, geometric, volumetric, and dynamic interactions, and supports both mask based and instruction driven editing. We further propose CORE, a structured vision language model based evaluation protocol that jointly measures object disappearance and after effect consistency, aligning more closely with human judgments than existing metrics. Benchmarking state of the art methods reveals systematic failures in removing secondary physical effects despite high masked region fidelity, exposing a gap between visual plausibility and causal correctness. BeyondMasks reframes video object removal as causal scene consistency rather than local reconstruction and provides a unified framework for its evaluation.
- Abstract(参考訳): 近年の映像生成モデルの進歩は映像オブジェクトの除去において視覚的リアリズムを著しく向上させたが、評価プロトコルは依然としてマスクされた領域の忠実さに焦点を合わせており、除去は局所的な塗布として扱われている。
物体を除去するためには、影、反射、照明の変化、透過性、ダイナミックトレースといった、引き起こされる物理的効果を除去する必要がある。
既存のベンチマークには、整列したクリーンな参照がなく、単純な合成設定に限られており、因果一貫性の体系的な評価を妨げている。
我々は、時間的に整合した合成ビデオと実世界のビデオのペアとクリーンな背景参照からなる、因果一貫性のあるビデオオブジェクト除去のためのペアベンチマークであるBeyondMasksを紹介した。
データセットはさまざまな測光、幾何学、体積、動的相互作用にまたがっており、マスクベースの編集と命令駆動編集の両方をサポートしている。
さらに,既存の指標よりも人間の判断と密接に一致し,対象の消失と効果の整合性を共同で測定する構造化視覚言語モデルに基づく評価プロトコルであるCOREを提案する。
最先端手法のベンチマークでは、マスキング領域の忠実度が高いにもかかわらず、二次的な物理的効果を除去する体系的な失敗を明らかにし、視覚的妥当性と因果的正しさのギャップを露呈する。
BeyondMasksは、ビデオオブジェクトの削除を局所的な再構成ではなく因果的なシーン一貫性として再設定し、その評価のための統一されたフレームワークを提供する。
関連論文リスト
- MemoBench: Benchmarking World Modeling in Dynamically Changing Environments [72.23517478870605]
MemoBenchは動的に変化する環境において、消失・再出現するパラダイムを中心に構築された診断ベンチマークである。
合成シーンと実世界のシーンにまたがる360度地上トラスクリップをキュレートし,VQAに基づく評価と自動メトリクスを組み合わせた評価スイートを設計する。
論文 参考訳(メタデータ) (2026-06-25T20:37:39Z) - Physics-Aware Video Instance Removal Benchmark [23.60215680694382]
ビデオインスタンス削除(VIR)では、バックグラウンドの整合性と物理的な整合性を維持しながら、対象オブジェクトを削除する必要がある。
現在のベンチマークでは、主に視覚的可視性を評価しており、しばしばリングリングシャドーのような物理的因果性を見下ろしている。
我々は、95の高品質なビデオに、高精度なマスクと削除プロンプトを付加した物理対応ビデオインスタンス除去ベンチマークを導入する。
論文 参考訳(メタデータ) (2026-04-07T14:02:53Z) - VOID: Video Object and Interaction Deletion [50.155301620235285]
既存のビデオオブジェクト除去手法は、オブジェクトの「裏」にペンキを塗ることに優れ、影や反射のような外観レベルのアーティファクトを補正する。
本稿では,複雑なシナリオにおいて物理的に表現可能な描画を実現するためのビデオオブジェクト除去フレームワークVOIDを提案する。
論文 参考訳(メタデータ) (2026-04-02T17:36:53Z) - From Understanding to Erasing: Towards Complete and Stable Video Object Removal [8.035439287403983]
ビデオオブジェクトの削除は、ビデオからターゲットオブジェクトを排除し、欠落した領域を確実に完了し、時間的一貫性を維持することを目的としている。
全体コヒーレンスを損なうことなく、物体によって引き起こされる副作用を取り除くことは依然として困難である。
本稿では,2つの相補的観点からの消去の理解を紹介する。
論文 参考訳(メタデータ) (2026-04-02T06:50:39Z) - EffectErase: Joint Video Object Removal and Insertion for High-Quality Effect Erasing [50.43992550991499]
ビデオオブジェクトの除去は、動的対象オブジェクトとその変形、影、反射などの視覚的効果をなくし、シームレスな背景を復元することを目的としている。
近年の拡散型ビデオ塗装法や物体除去法は、物体を除去するが、これらの効果を消し去ってコヒーレントな背景を合成するのに苦労することが多い。
多様なペアビデオを提供する大規模データセットであるVOR(Video Object removal)を紹介する。
本稿では,ビデオオブジェクト挿入を相互学習方式における逆補助タスクとして扱う効果を考慮したビデオオブジェクト削除手法であるEffectEraseを提案する。
論文 参考訳(メタデータ) (2026-03-19T17:59:22Z) - GeoRemover: Removing Objects and Their Causal Visual Artifacts [38.57204197752552]
オブジェクトの削除は、ターゲットオブジェクトとその因果的な視覚的アーティファクト(シャドーやリフレクションなど)を排除すべきである。
オブジェクトの除去を(1) 幾何学的除去と(2) 外観レンダリングに分離する幾何学的認識型2段階フレームワークを提案する。
本手法は,2つの一般的なベンチマークにおいて,オブジェクトとその関連アーティファクトを除去する際の最先端性能を実現する。
論文 参考訳(メタデータ) (2025-09-23T02:04:19Z) - ROSE: Remove Objects with Side Effects in Videos [47.196851721000655]
ROSEは、物体が環境に与える影響を研究するためのフレームワークであり、影、反射、光、透明度、鏡の5つの一般的なケースに分類される。
すべてのオブジェクト関連領域をローカライズするために、ビデオ全体を参照ベースの消去モデルに入力する。
副次的効果によって影響を受ける領域を明示的に予測するために、追加の監督が導入された。
論文 参考訳(メタデータ) (2025-08-26T03:18:31Z) - Discovering Objects that Can Move [55.743225595012966]
手動ラベルなしでオブジェクトを背景から分離する、オブジェクト発見の問題について検討する。
既存のアプローチでは、色、テクスチャ、位置などの外観の手がかりを使用して、ピクセルをオブジェクトのような領域に分類する。
私たちは、動的オブジェクト -- 世界で独立して動くエンティティ -- にフォーカスすることを選びます。
論文 参考訳(メタデータ) (2022-03-18T21:13:56Z) - Weakly-Supervised Video Object Grounding via Causal Intervention [82.68192973503119]
我々は、モデル学習中にのみビデオ文アノテーションが利用できる、弱教師付きビデオオブジェクトグラウンドディング(WSVOG)の課題をターゲットにしている。
文で記述されたオブジェクトをビデオの視覚領域にローカライズすることを目的としており、パターン分析や機械学習に必要な基本的な機能である。
論文 参考訳(メタデータ) (2021-12-01T13:13:03Z) - Occlusion-Aware Video Object Inpainting [72.38919601150175]
本稿では,映像における隠蔽物体の完全な形状と外観を復元する,隠蔽型映像オブジェクトの塗装について述べる。
我々の技術貢献であるVOINは、ビデオオブジェクト形状の完成と隠蔽テクスチャ生成を共同で行う。
より現実的な結果を得るために、VOINはT-PatchGANと新しい時間的YouTubeアテンションベースのマルチクラス識別器の両方を使用して最適化されている。
論文 参考訳(メタデータ) (2021-08-15T15:46:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。