論文の概要: Can 4D Foundation Models Remember?
- arxiv url: http://arxiv.org/abs/2609.20819v2
- Date: Mon, 21 Sep 2026 04:15:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-22 20:29:00.16691
- Title: Can 4D Foundation Models Remember?
- Title(参考訳): 4Dファウンデーションモデルは思い出せるか?
- Abstract要約: 既存のベンチマークは、主にピクセルレベルのメトリクスに依存しており、視野を離れてからオブジェクトに対して基礎的な真実を欠いている。
PersistBenchは、360度ビデオを利用したデータセットとメトリクスのスイートです。
この結果は,現在のモデル機能と堅牢な視覚記憶とのギャップを浮き彫りにしている。
- 参考スコア(独自算出の注目度): 29.096640358070445
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Perceiving and remembering the visual world is fundamental to navigating and interacting with our environment. Current 4D foundation models, such as camera-controllable video models or 4D reconstruction models, can perceive and reconstruct dynamic environments, but how well they remember what they have perceived remains an open question. Existing benchmarks largely rely on pixel-level metrics and lack ground truth for objects once they leave the field of view, making them unable to evaluate visual memory in an object-centric manner against references. To fill this gap, we introduce PersistBench, a dataset and metric suite that leverages 360° videos as omniscient ground truth and proposes three evaluation aspects: object permanence, motion continuity, and appearance preservation. Evaluating various models across diverse categories reveals that current models can only maintain short-term consistency that degrades significantly once objects leave the field of view. Our findings highlight the gap between current model capabilities and robust visual memory ("seeing is not remembering"), providing guidance for future development of 4D foundation models. Dataset and code are available on the project page: https://guangzhaohe.com/persistbench.
- Abstract(参考訳): 視覚世界を知覚し、記憶することは、私たちの環境をナビゲートし、相互作用するのに不可欠です。
カメラ制御可能なビデオモデルや4D再構成モデルといった現在の4Dファンデーションモデルは、動的環境を知覚し、再構築することができるが、どのようにして彼らが認識したことを記憶するかは、未解決の問題のままである。
既存のベンチマークは、主にピクセルレベルのメトリクスに依存しており、視野を離れるとオブジェクトに対して基礎的な真実を欠くため、参照に対してオブジェクト中心の方法で視覚記憶を評価することができない。
このギャップを埋めるために,360度ビデオを利用したデータセットとメートル法スイートPersistBenchを導入し,オブジェクトの永続性,動きの連続性,外観保存の3つの評価側面を提案する。
様々なカテゴリで様々なモデルを評価することで、現在のモデルでは、オブジェクトが視野を離れると著しく劣化する短期的な一貫性しか維持できないことが分かる。
本研究は,現在のモデル機能と堅牢な視覚記憶とのギャップを浮き彫りにし,将来的な4次元基礎モデル開発のためのガイダンスを提供する。
データセットとコードはプロジェクトページで公開されている。
関連論文リスト
- 4DGS-WAM: Bridging Past and Future with an Object-Centric World Action Model based on 4D Gaussian Splatting [72.02343855552051]
現在の世界アクションモデル(WAM)は2次元の視覚データを扱うのが一般的である。
動的オブジェクトとシーンの静的背景を別々にモデル化した,明示的な4Dガウススティング(4DGS)表現を利用する。
4DGS-WAMは2次元観察を永続的な4次元表現に上げ、将来の予測で観測済みの静的コンテンツを再利用できるようにする。
論文 参考訳(メタデータ) (2026-08-26T16:16:57Z) - MemoBench: Benchmarking World Modeling in Dynamically Changing Environments [72.23517478870605]
MemoBenchは動的に変化する環境において、消失・再出現するパラダイムを中心に構築された診断ベンチマークである。
合成シーンと実世界のシーンにまたがる360度地上トラスクリップをキュレートし,VQAに基づく評価と自動メトリクスを組み合わせた評価スイートを設計する。
論文 参考訳(メタデータ) (2026-06-25T20:37:39Z) - ObjectForesight: Predicting Future 3D Object Trajectories from Human Videos [48.24897274501108]
本研究では,3次元オブジェクト中心のダイナミックスモデルを導入し,短い自我中心の映像シーケンスから剛体物体の将来の6-DoFのポーズと軌跡を予測する。
ピクセルまたは潜在空間で動作する従来の世界やダイナミクスモデルとは異なり、ObjectForesightはオブジェクトレベルで3Dで明示的に世界を表現する。
我々は、ObjectForesightが、未確認のオブジェクトやシーンへの精度、幾何整合性、一般化において、大幅に向上することを示す。
論文 参考訳(メタデータ) (2026-01-08T18:58:08Z) - Articulated Object Estimation in the Wild [25.616481887384708]
ArtiPointは、動的カメラモーションと部分観測可能性の下で、明瞭なオブジェクトモデルを推論できる新しい推定フレームワークである。
ディープポイントトラッキングと因子グラフ最適化フレームワークを組み合わせることで、ArtiPointは生のRGB-Dビデオから直接、調音部分軌跡と調音軸を強く推定する。
ArtiPointを古典的および学習ベースのベースラインに対してベンチマークし、Arti4Dで優れたパフォーマンスを示す。
論文 参考訳(メタデータ) (2025-09-01T18:34:17Z) - E3D-Bench: A Benchmark for End-to-End 3D Geometric Foundation Models [78.1674905950243]
3次元幾何学基礎モデル(GFM)の総合ベンチマークを初めて提示する。
GFMは、単一のフィードフォワードパスで密度の高い3D表現を直接予測し、スローまたは未使用のカメラパラメータを不要にする。
我々は16の最先端GFMを評価し、タスクやドメイン間の長所と短所を明らかにした。
すべてのコード、評価スクリプト、処理されたデータは公開され、3D空間インテリジェンスの研究が加速される。
論文 参考訳(メタデータ) (2025-06-02T17:53:09Z) - Probing the 3D Awareness of Visual Foundation Models [56.68380136809413]
視覚基礎モデルの3次元認識を解析する。
凍結した特徴に対するタスク固有プローブとゼロショット推論手法を用いて実験を行う。
論文 参考訳(メタデータ) (2024-04-12T17:58:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。