論文の概要: Tracking Is Not Permanence: What Video World Models Keep of a Hidden Object
- arxiv url: http://arxiv.org/abs/2610.07355v1
- Date: Mon, 05 Oct 2026 20:22:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.651432
- Title: Tracking Is Not Permanence: What Video World Models Keep of a Hidden Object
- Title(参考訳): 追跡は永続性ではない:ビデオワールドモデルが隠された物体を保存しているもの
- Abstract要約: 凍結したV-JEPA 2予測器から物体を隠蔽し、その隠れた領域の予測とエンコーダの2つの世界の表現を比較する。
予測器の決定は、静止物体を部分的に保持し、容器内を全く持たず、0.3秒以内に動く物体を失う。
VideoMAEはほとんど何も保たず、コスモスの次なる予測では、静止した隠された物体は保持するが、動く容器の中では運ばれない。
- 参考スコア(独自算出の注目度): 3.732244093761483
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Video world models track objects they can see; we ask what they keep of objects they cannot. We hide an object from a frozen V-JEPA 2 predictor and compare its prediction for the hidden region with the encoder's representation of two worlds that differ only inside that region. The predictor's decision keeps a stationary object in part and one carried inside a container not at all, and loses a moving one within 0.3 s (0.5 s under V-JEPA's own tube mask; ViT-H keeps it to 1.1 s at pretraining's 90% masking ratio); in projection a trace remains, below the midpoint, at 14-60% of what a baseline copying the last view retains. The information is there: the encoder reads the object's presence at 1.00 and keeps a closed container's contents decodable for 3.5 s, while the predictor's output, read with the encoder's own probe, contains the ball in 2% of scenes once the box has been closed for half a second. On rendered scenes, permanence is missing on the predictor's side, and training installs it cheaply as a prior: three thousand predictor-only steps on synthetic containers take this belief from 0.05 to 1.00 against two matched controls. They also raise IntPhys-2019 from 84.2% to 93.3%, but so does a curriculum without containers, and which training habit the benchmark credits changes with its scoring rule. Continued training with tube masks produces 1.1-1.6 s of moving-object carry-over on manipulation and internet-style video, so the deficit is not intrinsic to latent prediction. VideoMAE keeps almost nothing, and Cosmos's next-token prediction keeps a stationary hidden object but not one carried inside a moving container.
- Abstract(参考訳): ビデオワールドモデルは、彼らが見ることのできるオブジェクトを追跡します。
我々は、凍結したV-JEPA 2予測器から物体を隠蔽し、その隠れた領域の予測と、その領域内でのみ異なる2つの世界のエンコーダの表現を比較する。
予測器の判定は、静止物体を部分的に保持し、容器内では持たず、0.3秒以内に移動物体を失う(V-JEPA自身の管マスクの下で0.5秒、ViT-Hはプレトレーニング前の90%のマスク比で1.1秒)。
エンコーダは1.00でオブジェクトの存在を読み取り、3.5秒間クローズドコンテナの内容をデコッドし、一方、予測器の出力はエンコーダ自身のプローブで読み上げられ、ボックスが半秒間クローズされた後、そのボールは2%のシーンに含まれる。
レンダリングされたシーンでは、予測器側で永続性が欠落しており、トレーニングはより安価にインストールされる: 合成コンテナ上での予測器のみの3万のステップは、2つの整合した制御に対して0.05から1.00までこの信念を取る。
また、IntPhys-2019を84.2%から93.3%に引き上げているが、コンテナなしのカリキュラムもあり、ベンチマークがスコアリングルールに従って変更する習慣がある。
チューブマスクを用いた継続的なトレーニングは、操作やインターネットスタイルのビデオで1.1-1.6秒の移動物体を搬送する。
VideoMAEはほとんど何も保たず、コスモスの次なる予測では、静止した隠された物体は保持するが、動く容器の中では運ばれない。
関連論文リスト
- iSEE: Object Permanence Through Self-Supervision [59.28457331222791]
iSEEはラベルなしでオブジェクトを永続化するためのフレームワークです。
オブジェクトが閉じこもったときを検出し、オブジェクトが再び現れたときに再識別し、オブジェクトの隠れた位置を連続的に保持する。
LA-CATERの静的な場合、iSEEは86%のオクルージョンの後に再出現するオブジェクトを自身のスロットに返却し、SlotContrastは32%でローカライズし、ラベルでトレーニングされたSoTA RAMの4.1 mAP内に隠されたままローカライズする。
論文 参考訳(メタデータ) (2026-10-01T07:12:08Z) - CALIPER: Clean Scenes Cannot Rank Physical Inference in Pretrained Visual Representations [0.0]
物体がどれだけスライドするかは、その質量と摩擦に依存します。
物理学を推論するエンコーダと、そうでないエンコーダを区別できないことを示す。
論文 参考訳(メタデータ) (2026-09-08T04:49:42Z) - Disparity Has a Sign: Stereo Matching Beyond the Zero-Disparity Plane [52.210414985125816]
立体視内容が、負の相違に対応するゼロの相違面の背後にある物体をどう含んでいるかを示す。
撮影者が作成した7本の公開映画から21,495ドルのステレオペアのベンチマークである textitZDPShift を提案する。
同じシーンコンテンツでは、ファンデーションは25.24ドルEPEから75.33ドルpxに上昇し、すべてのバックボーンが3ピクセルの差分誤差を超えるピクセルの約半分を残している。
論文 参考訳(メタデータ) (2026-09-06T19:58:35Z) - AcrossVAM1.0: Particle World Modeling for Text-Assisted Robot Video Prediction [14.556446786016787]
AcrossVAM1.0は、将来の予測をオブジェクト中心の動きと高密度な外観に分解する軽量なテキスト支援ビデオアクションモデルである。
因果的デュアルストリームデコーダは、最後のフレームからのみ符号化された外観とパーティクルレンダリングされた動きを結合する。
多様な実ロボット軌道から構築したVRSベンチマークでは、粒子動力学は持続性よりも誤差を21.0%削減する。
論文 参考訳(メタデータ) (2026-08-28T16:19:24Z) - What Can Latent World Models Know? Physical Parameter Identifiability in Multimodal Predictive Representations [18.546826658944806]
POKEWORLDは、視覚的に同一の物体が質量、抗力、接触硬さを隠す対話型環境である。
認証付きプロトコルは、まず、生の観測から回復可能な各パラメータを認証し、潜伏状態に入るかどうかを測定する。
RH20Tでは、2つのロボットと4,258エピソードにまたがって両方のメカニズムを再現する。
論文 参考訳(メタデータ) (2026-07-29T15:15:30Z) - MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction [12.549249041637976]
我々は、通常のモノクラービデオから人間と物体の相互作用の予測を学習する方法を研究する。
MotionForesightは、操作されたオブジェクトのポイントに対する将来の3Dトラジェクトリを予測する。
まず、事前訓練されたビデオモデル上に構築された高密度な3Dトラッカーから始まり、全クリップから擬似地下トラックを生成し、観測されたフレームのみを用いて予測者を訓練する。
論文 参考訳(メタデータ) (2026-07-17T17:59:38Z) - The 1st Winner for 5th PVUW MeViS-Text Challenge: Strong MLLMs Meet SAM3 for Referring Video Object Segmentation [65.24213788883016]
本報告では,第5回PVUW MeViS-Text Challengeの優勝ソリューションについて述べる。
私たちは、強力なマルチモーダルな大規模言語モデルとSAM3を組み合わせた、完全にトレーニング不要なパイプラインを構築しています。
我々の手法はPVUW 2026 MeViS-Textテストセットで第1位であり、最終スコアは0.909064、J&Fスコアは0.7897026である。
論文 参考訳(メタデータ) (2026-04-01T02:42:30Z) - FIction: 4D Future Interaction Prediction from Video [63.37136159797888]
ビデオからの4次元未来のインタラクション予測のためのFIctionを紹介する。
人間の活動のインプットビデオが与えられたら、その人が次に対話する3D位置のオブジェクトを予測することが目的だ。
論文 参考訳(メタデータ) (2024-12-01T18:44:17Z) - Detecting Invisible People [58.49425715635312]
我々は,追跡ベンチマークを再利用し,目立たない物体を検出するための新しい指標を提案する。
私たちは、現在の検出および追跡システムがこのタスクで劇的に悪化することを実証します。
第2に,最先端の単眼深度推定ネットワークによる観測結果を用いて,3次元で明示的に推論する動的モデルを構築した。
論文 参考訳(メタデータ) (2020-12-15T16:54:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。