論文の概要: PhysWeep: Does a Video Generator Realize the Physics You Ask For?
- arxiv url: http://arxiv.org/abs/2609.06207v1
- Date: Sat, 05 Sep 2026 17:52:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-12 06:35:14.46608
- Title: PhysWeep: Does a Video Generator Realize the Physics You Ask For?
- Title(参考訳): PhysWeep:ビデオ・ジェネレータは、あなたが求めている物理を実現できるか?
- Authors: Rasul Khanbayov, Hasan Kurban,
- Abstract要約: 各サンプルは確実に間違った定数にロックされ、正確には確率スコアが構造的に盲目である。
PhysWeepは、固定されたラベルのない監査でそれを閉じ、冷凍発電機をブラックボックスとして扱う。
- 参考スコア(独自算出の注目度): 0.8594140167290097
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Image-to-video generators are often credited with absorbing physical dynamics as implicit world models, a claim the community currently checks with plausibility scores that ask whether a clip looks consistent with real-world motion. Plausibility is the wrong test on its own, because a clip can look natural while encoding the wrong value of the governing physical parameter, and no existing benchmark measures this gap directly. PhysWeep closes it with a fixed, label-free audit, treating a frozen generator as a black box, recovering the realized parameter from generated pixels, and reporting how often generation is trackable at all, how far the realized value sits from the requested one, and which, if either, of the literature's two proposed failure mechanisms the data support. A deterministic-simulator positive control confirms every score is exactly checkable. Applied to three open generators across six sweep axes, PhysWeep finds a specific, reproducible, previously undocumented failure. Conditional on producing trackable motion, two of the three generate confident, well-fit dynamics that converge to one of a small number of fixed, wrong values selected by the sampling seed rather than by the request, reproducing across two independent model families, two physical systems, and an independent tracker. It matches neither the prior reversion nor the case-based clamping the literature anticipates, because the reversion target is seed-conditional rather than a single global default, and a leave-one-out selection rule rejects both; the in-range faithfulness slope is statistically indistinguishable from zero wherever a response is estimable at all. A benchmark averaging over seeds would never see this: each sample is confidently locked to a wrong constant, exactly the failure a plausibility score is structurally blind to. We release the protocol, suite, and analysis code.
- Abstract(参考訳): イメージ・トゥ・ビデオ・ジェネレータは、物理的なダイナミクスを暗黙の世界のモデルとして吸収したとしばしば言われており、コミュニティは現在、クリップが現実世界の動きと一致しているかどうかを問う可視性スコアをチェックしている。
なぜなら、クリップは管理する物理パラメータの間違った値をエンコードしながら自然に見え、既存のベンチマークでは直接このギャップを測定していません。
PhysWeepは、固定されたラベルのない監査でそれをクローズし、凍結したジェネレータをブラックボックスとして扱い、生成したピクセルから実現されたパラメータを回復し、生成がどれだけ頻繁に追跡可能か、要求された値から実現された値がどれくらい離れているかを報告します。
決定論的シミュレータの正の制御は、すべてのスコアが正確にチェック可能であることを確認します。
PhysWeepは6つのスイープ軸にまたがる3つのオープンジェネレータに適用し、再現性があり、以前は文書化されていなかった失敗を発見した。
追跡可能な運動を生成する条件として、3つのうちの2つは、要求によってではなくサンプリングシードによって選択された少数の固定された間違った値のうちの1つに収束し、2つの独立したモデルファミリ、2つの物理システム、および独立トラッカー間で再生する自信のある、適合したダイナミクスを生成する。
逆転ターゲットは単一の大域的なデフォルトではなくシード条件であり、一方の独立選択規則は両方を拒絶するので、文献の事前の逆転とケースベースのクランプは一致しない。
各サンプルは確実に間違った定数にロックされ、正確には確率スコアが構造的に盲目である。
プロトコル、スイート、分析コードをリリースします。
関連論文リスト
- One Perturbation Is Not Enough: Identifiability and Blind Baselines for Behavioral AI Evaluation [0.6999740786886536]
映像から物理量を報告する3つの視覚言語モデルに対して,3つの摂動の完全な識別を行う。
3つのスコアは、それぞれがラウンドキャリブレーション値の小さなセットの1つにデフォルトがあるため、その上ではなく、自分のブラインドバウンドよりもはるかに低い。
論文 参考訳(メタデータ) (2026-09-05T17:18:23Z) - VeriPhy: Agentic Physical Reasoning for World Model Evaluation and Refinement [57.86962208273888]
テキストのみのプランナが入力された物理義務にプロンプトをコンパイルする監査可能な物理検証システムを提案する。
それぞれのアクションは、ペイロードがタイプされた測定か、明示的にタグ付けされた学習状態である証明付きエビデンスレコードを返す。
我々は, 実発生障害を即時参照, 空間, 時間でローカライズする, 1500クリックの欠陥記録のコーパスにおいて, 評価をアンロックする。
論文 参考訳(メタデータ) (2026-09-02T20:36:45Z) - Replicable Conformal Prediction [0.3058685580689604]
2人のアナリストが毎回、独立したサンプルで同じ予測モデルを調整します。
2つのキャリブレーションが同じオブジェクトを生成することを確認できない。
一つのランダムなシードを共有し、キャリブレーションされた閾値を粗い共有グリッドまで丸めれば、緊張は解消される。
論文 参考訳(メタデータ) (2026-08-23T17:47:40Z) - The C-index illusion: discrimination without calibration in published survival models [0.0]
我々は3つの構造的に異なる領域にまたがって3つのサバイバル-MLモデルを再現する。
ホルム補正された家族的誤り率の下で,5つの事前登録仮説を検証した。
論文 参考訳(メタデータ) (2026-07-21T19:13:54Z) - Apple-$π$: Benchmarking Thinking with Video Towards Law-Grounded Physical Intelligence [54.58886283991723]
Apple-PIは、物理法則でビデオモデルの評価を明示的に固定する最初のベンチマークである。
Apple-PIは3つのコンポーネントから構成される。
ベンチマーク11モデルは、現在のビデオモデルが信頼性の高い地上のワールドシミュレータから遠く離れていることを示している。
論文 参考訳(メタデータ) (2026-07-17T18:00:05Z) - What Accuracy and Gradient Cosine Miss: Evaluating Feedback Alignment via Scale Stability, Reference Validity, and Depth Utility [48.10132234701036]
本稿では,3つのチェック(スケール安定性,参照妥当性,深度ユーティリティ)に基づく診断評価プロトコルを提案する。
複数のアーキテクチャや手法にまたがって、我々のプロトコルは広い校正マージンを持つ全ての障害を識別する。
論文 参考訳(メタデータ) (2026-06-19T06:04:17Z) - Physics from Video: Identifiability of Time-Invariant Second-Order ODEs under Minimal Trajectory Conditions [60.2784641643737]
ビジュアルリアリズムと物理的な理解のギャップを埋めることは、ビデオベースの世界モデルにとって重要な課題である。
原画素からの連続時間物理法則の構造識別可能性について検討した。
レベルセットの傾斜被覆条件は、学習された潜伏空間が真の物理的状態に局所的に親和的であることを証明する。
論文 参考訳(メタデータ) (2026-05-27T13:22:29Z) - A Universal Cliff and a Design Fingerprint: Cross-Section Defect Detection Under LLM Orchestration [0.0]
生産言語モデルシステムは、労働者エージェントの目に見えないオーケストレーションにまたがってそれを拡大する要求に答える。
これは、単一のワーカーが見ることができない欠陥のクラスに何をもたらすか尋ねる。
1人の開発者から5世代にわたる10のシステムと、異なるアライメントパラダイムからの5つのプロバイダのみです。
論文 参考訳(メタデータ) (2026-05-25T05:09:48Z) - Accelerating Quantum Materials Characterization: Hybrid Active Learning for Autonomous Spin Wave Spectroscopy [0.0]
自律三軸スピン波分光のためのハイブリッド-物理インフォームドフレームワークTAS-AIを提案する。
ブラインドリコンストラクションベンチマークでは、ランダムサンプリング、粗いグリッド、ガウス過程マッパーといったモデルに依存しない手法が、物理情報プランニングよりも信頼性が高く、測定の少ないグローバルエラーしきい値に達する。
TAS-AIは10測定未満で決定的なAIC由来のエビデンス比(>100)に達する一方、モーションアウェアのスケジューリングは固定された測定予算でウォールタイム時間を32%削減する。
論文 参考訳(メタデータ) (2026-04-26T17:54:40Z) - Sequential Predictive Two-Sample and Independence Testing [114.4130718687858]
逐次的非パラメトリック2サンプルテストと独立テストの問題点について検討する。
私たちは賭けによる(非パラメトリックな)テストの原則に基づいています。
論文 参考訳(メタデータ) (2023-04-29T01:30:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。