論文の概要: DSI-Bench: A Benchmark for Dynamic Spatial Intelligence
- arxiv url: http://arxiv.org/abs/2510.18873v1
- Date: Tue, 21 Oct 2025 17:59:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-10-25 03:08:14.127002
- Title: DSI-Bench: A Benchmark for Dynamic Spatial Intelligence
- Title(参考訳): DSI-Bench: 動的空間知能のベンチマーク
- Abstract要約: 動的空間関係に関する推論は、オブザーバーとオブジェクトが同時に移動することが多いため、不可欠である。
ダイナミック・スペース・インテリジェンスを導入し,1000近いダイナミックビデオと1,700以上の手作業による注釈付き質問を用いたベンチマークであるDSI-Benchを提案する。
- 参考スコア(独自算出の注目度): 41.83862115769156
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reasoning about dynamic spatial relationships is essential, as both observers and objects often move simultaneously. Although vision-language models (VLMs) and visual expertise models excel in 2D tasks and static scenarios, their ability to fully understand dynamic 3D scenarios remains limited. We introduce Dynamic Spatial Intelligence and propose DSI-Bench, a benchmark with nearly 1,000 dynamic videos and over 1,700 manually annotated questions covering nine decoupled motion patterns of observers and objects. Spatially and temporally symmetric designs reduce biases and enable systematic evaluation of models' reasoning about self-motion and object motion. Our evaluation of 14 VLMs and expert models reveals key limitations: models often conflate observer and object motion, exhibit semantic biases, and fail to accurately infer relative relationships in dynamic scenarios. Our DSI-Bench provides valuable findings and insights about the future development of general and expertise models with dynamic spatial intelligence.
- Abstract(参考訳): 動的空間関係に関する推論は、オブザーバーとオブジェクトが同時に移動することが多いため、不可欠である。
視覚言語モデル(VLM)と視覚専門モデル(VLM)は2Dタスクや静的シナリオに優れるが、動的3Dシナリオを完全に理解する能力は依然として限られている。
我々はDynamic Spatial Intelligenceを導入し、DSI-Benchを提案する。DSI-Benchは1000近いダイナミックビデオと1,700以上の手動の注釈付き質問で、観察者やオブジェクトの9つの分離された動きパターンをカバーしている。
空間的・時間的に対称なデザインはバイアスを低減し、自己運動や物体の動きに関するモデル推論の体系的な評価を可能にする。
モデルはしばしばオブザーバとオブジェクトの動きを分割し、意味バイアスを示し、動的シナリオにおける相対関係を正確に推測することができない。
我々のDSI-Benchは、動的空間知能を持つ一般および専門モデルの将来的な開発に関する貴重な知見と洞察を提供する。
関連論文リスト
- Analytic Dynamics: Learning Physics-Grounded Representation for Fast Intrinsic Dynamics Inference from Monocular Videos [2.5608298830470013]
視覚的観察から物体力学を推定することは、知的エージェントが物理的世界について推論し、相互作用することが不可欠である。
本稿では,中間物理基底の動的表現を導入したフィードフォワード動的推論フレームワークであるAnalytic Dynamicsを提案する。
論文 参考訳(メタデータ) (2026-08-31T16:08:04Z) - Self-Supervised Learning of Structured Dynamics from Videos [76.23834498074805]
予め訓練した画像ビジョン変換器の凍結した特徴から、構造化された動き表現を復元できるかどうかを検討する。
本研究では、時間変化の主源を残留力学から明確に分離する構造ダイナミクスモデル(SDM)を提案する。
ProbeMotionのSDMは、カメラモーション、オブジェクトモーション、複合ダイナミクスを備えた合成ビデオと実ビデオにまたがる新しい評価スイートである。
論文 参考訳(メタデータ) (2026-07-23T17:55:07Z) - ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? [43.007245223642606]
ViSTR-Benchは、MLLMが動的シーンにおける連続的な視覚的手がかりから質的推論を行うことができるかどうかを体系的に評価するために設計された評価スイートである。
ベンチマークは15の異なるサブタスクと、さまざまなテーブルトップ、屋内、屋外のシナリオにまたがる高品質のビデオ質問応答ペアで構成されている。
論文 参考訳(メタデータ) (2026-07-23T02:49:24Z) - SUMO: Segment and Track Any Motion with Nonlinear State Space Models [20.136630716718383]
Visual Object Tracking (VOT) とMotion Object (MOS) はコンピュータビジョンにおける2つの基本的なタスクである。
我々は、非線形ダイナミクスと視覚に基づくセグメンテーションを統合した、ゼロショット、トレーニング不要、統一的なフレームワークSUMOを提案する。
具体的には,ロボットの原理にインスパイアされた非線形状態空間モデル(SSM)を開発し,複雑な物体のダイナミクスを捉える。
論文 参考訳(メタデータ) (2026-06-29T06:55:13Z) - Thinking in Dynamics: How Multimodal Large Language Models Perceive, Track, and Reason Dynamics in Physical 4D World [49.80040477190479]
人間は物理的4Dの世界に住み、幾何学的構造と意味的内容は時間とともに進化する。
さまざまな実世界および合成ビデオデータセットから構築された大規模ベンチマークであるDyn-Benchを紹介した。
既存のモデルでは,時間的推論と動的オブジェクトグラウンドの両面において,高い性能を同時に維持できないことがわかった。
論文 参考訳(メタデータ) (2026-03-13T07:42:16Z) - RISE-Video: Can Video Generators Decode Implicit World Rules? [71.92434352963427]
テキスト画像合成(TI2V)の先駆的推論指向ベンチマークであるRISE-Videoを提案する。
RISE-Videoは、8つの厳格なカテゴリにまたがる、細心の注意深い人手によるサンプル467種からなる。
本研究では,LMM(Large Multimodal Models)を利用して人中心評価をエミュレートする自動パイプラインを提案する。
論文 参考訳(メタデータ) (2026-02-05T18:36:10Z) - EscherVerse: An Open World Benchmark and Dataset for Teleo-Spatial Intelligence with Physical-Dynamic and Intent-Driven Understanding [56.89359230139883]
本稿では,Teleo-Spatial Intelligence(TSI)について紹介する。
本稿では、大規模なオープンワールドベンチマーク(Escher-Bench)、データセット(Escher-35k)、モデル(Escherシリーズ)からなるEscherVerseを紹介する。
これはIntent-Driven Reasoningを体系的に評価する最初のベンチマークである。
論文 参考訳(メタデータ) (2026-01-04T14:42:39Z) - VLM4D: Towards Spatiotemporal Awareness in Vision Language Models [66.833085504228]
V4DLMは視覚言語モデル(VLM)を評価するために設計された最初のベンチマークである。
本ベンチマークは,質問応答対を慎重にキュレートした,多様な実世界および合成ビデオで構成されている。
我々は,既存のモデルにおける基本的欠陥を浮き彫りにして,人間のベースラインと比較して重要なパフォーマンスギャップを識別する。
論文 参考訳(メタデータ) (2025-08-04T06:06:06Z) - SlotPi: Physics-informed Object-centric Reasoning Models [37.32107835829927]
物理インフォームドオブジェクト中心推論モデルであるSlotPiを紹介する。
我々の実験は、ベンチマークや流体データセット上での予測や視覚質問応答(VQA)といったタスクにおけるモデルの強みを強調した。
我々は、オブジェクトの相互作用、流体力学、流体オブジェクトの相互作用を含む実世界のデータセットを作成し、モデルの性能を検証した。
論文 参考訳(メタデータ) (2025-06-12T14:53:36Z) - SITE: towards Spatial Intelligence Thorough Evaluation [121.1493852562597]
空間知能 (Spatial Intelligence, SI) は、空間的関係の可視化、操作、推論を含む認知能力を表す。
SI Thorough Evaluationに向けたベンチマークデータセットであるSITEを紹介する。
ベンチマークの計算には、31の既存のデータセットに関するボトムアップ調査と、認知科学の3つの分類システムに基づくトップダウン戦略を組み合わせる。
論文 参考訳(メタデータ) (2025-05-08T17:45:44Z) - PartRM: Modeling Part-Level Dynamics with Large Cross-State Reconstruction Model [23.768571323272152]
PartRMは、静的オブジェクトの多視点画像から外観、幾何学、部分レベルの動きを同時にモデル化する新しい4D再構成フレームワークである。
我々はPartDrag-4Dデータセットを導入し、20,000以上の状態にまたがる部分レベルのダイナミクスを多視点で観察する。
実験結果から,PartRMはロボット工学の操作作業に応用できる部分レベルの動作学習において,新たな最先端技術を確立していることがわかった。
論文 参考訳(メタデータ) (2025-03-25T17:59:58Z) - On the Benefits of Instance Decomposition in Video Prediction Models [5.653106385738823]
最先端のビデオ予測手法は、通常、別個のオブジェクトに明示的に分解することなく、共同で暗黙的にシーンのダイナミクスをモデル化する。
ダイナミックなシーンのすべてのオブジェクトは独自の動きパターンを持ち、通常は他とは独立しているため、これは挑戦的であり、潜在的に準最適である。
本稿では,動的シーンにおけるオブジェクトを,潜在変換器による映像予測モデルの範囲内で明示的にモデル化する利点について検討する。
論文 参考訳(メタデータ) (2025-01-17T21:36:06Z) - InterDyn: Controllable Interactive Dynamics with Video Diffusion Models [50.38647583839384]
我々は、初期フレームと駆動対象またはアクターの動作を符号化する制御信号が与えられたインタラクティブな動画像を生成するフレームワークであるInterDynを提案する。
我々の重要な洞察は、大規模なビデオ生成モデルは、大規模ビデオデータからインタラクティブなダイナミクスを学習し、ニューラルと暗黙の物理シミュレーターの両方として機能できるということです。
論文 参考訳(メタデータ) (2024-12-16T13:57:02Z) - EgoGaussian: Dynamic Scene Understanding from Egocentric Video with 3D Gaussian Splatting [95.44545809256473]
エゴガウスアン(EgoGaussian)は、3Dシーンを同時に再構築し、RGBエゴセントリックな入力のみから3Dオブジェクトの動きを動的に追跡する手法である。
動的オブジェクトと背景再構築の品質の両面で,最先端技術と比較して大きな改善が見られた。
論文 参考訳(メタデータ) (2024-06-28T10:39:36Z) - OCK: Unsupervised Dynamic Video Prediction with Object-Centric Kinematics [22.119612406160073]
我々は,オブジェクト中心キネマティクスとオブジェクトスロットを利用した動的ビデオ予測モデルOCKを提案する。
本稿では,対象運動を明示する新しいコンポーネントであるObject Kinematicsを紹介する。
複雑なオブジェクト属性と動きを持つ複雑なシーンにおいて,本モデルは優れた性能を示す。
論文 参考訳(メタデータ) (2024-04-29T04:47:23Z) - SlotFormer: Unsupervised Visual Dynamics Simulation with Object-Centric
Models [30.313085784715575]
学習対象時間表現に基づくトランスフォーマーに基づく自己回帰モデルであるSlotFormerを紹介する。
本稿では,複雑なオブジェクト相互作用を持つデータセットの予測にSlotFormerをうまく適用する。
また,このようなタスクに特化して設計された手法と競合する,モデルベース計画の世界モデルとして機能する能力を示す。
論文 参考訳(メタデータ) (2022-10-12T01:53:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。