論文の概要: PhyEditBench: A Real-World Multi-Stage Benchmark for Physics-Aware Image Editing
- arxiv url: http://arxiv.org/abs/2606.26551v2
- Date: Fri, 26 Jun 2026 07:00:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-29 13:57:07.332702
- Title: PhyEditBench: A Real-World Multi-Stage Benchmark for Physics-Aware Image Editing
- Title(参考訳): PhyEditBench:物理対応画像編集のための実世界のマルチステージベンチマーク
- Abstract要約: 編集モデルの物理的理解を評価するためのベンチマークであるPhyEditBenchを紹介する。
ビデオから細心の注意を払って抽出した高品質で高解像度の現実世界のインスタンスは238個ある。
現在のSOTA編集手法の実証分析は、物理に基づく推論においてかなりの制限を課している。
- 参考スコア(独自算出の注目度): 14.070238906847488
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: While instruction-based image editing, enabled by multi-modal generative models, has advanced significantly, existing benchmarks lack a comprehensive evaluation of physics-based reasoning, a critical capability for handling real-world scenarios. To address this, we introduce PhyEditBench, a benchmark designed to assess the physical understanding of editing models. Guided by a hierarchical taxonomy, we establish 4 primary classes and 12 subclasses. It comprises 238 high-quality, high-resolution, real-world instances meticulously extracted from videos to capture authentic physical dynamics, alongside 35 synthetic Anti-Physics instances. Our empirical analysis of current SOTA editing methods exposes substantial limitations in their physics-based reasoning. We further propose a training-free baseline named PhyWorld that uses test-time scaling and a latent reduction strategy. PhyWorld outperforms comparable models and suggests that the video generation process can effectively serve as a reasoning mechanism for image editing. The project page is available at https://github.com/Previsior/PhyEditBench.
- Abstract(参考訳): 命令ベースの画像編集は、マルチモーダル生成モデルによって実現されているが、既存のベンチマークでは、現実のシナリオを扱うための重要な能力である物理ベースの推論の包括的な評価が欠如している。
そこで本研究では,編集モデルの物理的理解を評価するためのベンチマークであるPhyEditBenchを紹介する。
階層的な分類によってガイドされ、私たちは4つの一次クラスと12の下位クラスを確立します。
238の高品質で高解像度の現実世界のインスタンスをビデオから細心の注意を払って抽出し、本物の物理力学を捉え、35の合成反物理のインスタンスを合成する。
現在のSOTA編集手法の実証分析は、物理に基づく推論においてかなりの制限を課している。
さらに,テスト時間スケーリングと遅延削減戦略を用いたPhyWorldというトレーニングフリーのベースラインを提案する。
PhyWorldは比較モデルよりも優れており、ビデオ生成プロセスが画像編集の推論メカニズムとして効果的に機能することを示唆している。
プロジェクトページはhttps://github.com/Previsior/PhyEditBench.comで公開されている。
関連論文リスト
- PhyCo: Learning Controllable Physical Priors for Generative Motion [55.59209981836171]
本稿では,ビデオ生成に連続的,解釈可能,物理的に接地された制御を導入するフレームワークであるPhyCoを紹介する。
i) 摩擦, 再構成, 変形, 力が様々なシナリオで体系的に変化する100K以上のフォトリアリスティック・シミュレーション・ビデオの大規模データセット, (ii) 物理制御された拡散モデルの微調整, (iii) VLM誘導報酬最適化, 微調整された視覚言語モデルにより、対象とする物理クエリを用いて生成されたビデオを評価し、異なるフィードバックを提供する。
論文 参考訳(メタデータ) (2026-04-30T17:53:03Z) - PhysRVG: Physics-Aware Unified Reinforcement Learning for Video Generative Models [100.65199317765608]
物理原理は現実的な視覚シミュレーションには基本的だが、トランスフォーマーベースのビデオ生成において重要な監視対象である。
本研究では,物理衝突ルールを高次元空間に直接適用した映像生成モデルのための物理認識強化学習パラダイムを提案する。
このパラダイムを、MDcycle(Mimicry-Discovery Cycle)と呼ばれる統合フレームワークに拡張することで、大幅な微調整を可能にします。
論文 参考訳(メタデータ) (2026-01-16T08:40:10Z) - PICABench: How Far Are We from Physically Realistic Image Editing? [71.82009431774311]
PICABenchを導入し、8つのサブ次元にわたる物理的リアリズムを体系的に評価する。
本稿では,VLM-as-a-judgeをケースごとの領域レベルの人間のアノテーションで利用する信頼性評価プロトコルであるPICAEvalを提案する。
また、ビデオから物理を学習し、トレーニングデータセットPICA-100Kを構築することで、効果的な解を探索する。
論文 参考訳(メタデータ) (2025-10-20T15:53:57Z) - LikePhys: Evaluating Intuitive Physics Understanding in Video Diffusion Models via Likelihood Preference [57.086932851733145]
ビデオ拡散モデルにおける直感的な物理を評価するトレーニング不要な方法であるLikePhysを紹介した。
現在のビデオ拡散モデルにおける直観的物理理解のベンチマークを行う。
経験的結果は、現在のモデルが複雑でカオス的な力学に苦しむにもかかわらず、モデルキャパシティと推論設定スケールとしての物理理解の改善傾向が明らかであることを示している。
論文 参考訳(メタデータ) (2025-10-13T15:19:07Z) - "PhyWorldBench": A Comprehensive Evaluation of Physical Realism in Text-to-Video Models [38.14213802594432]
PhyWorldBenchは、物理法則に準拠したビデオ生成モデルを評価するために設計されたベンチマークである。
我々は、現実世界の物理学に故意に違反する「反物理学」という新しいカテゴリーを紹介した。
5つのオープンソースモデルと5つのプロプライエタリモデルを含む12の最先端のテキスト・ビデオ生成モデルを評価する。
論文 参考訳(メタデータ) (2025-07-17T17:54:09Z) - Towards World Simulator: Crafting Physical Commonsense-Based Benchmark for Video Generation [51.750634349748736]
テキスト・ツー・ビデオ(T2V)モデルは複雑なプロンプトの可視化に大きく貢献している。
しかし、直感的な物理を正確に表現するこれらのモデルの能力はほとんど解明されていない。
本稿では,T2V生成における物理コモンセンスの正しさを評価するためにPhyGenBenchを導入する。
論文 参考訳(メタデータ) (2024-10-07T17:56:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。