論文の概要: SpaceDG: Benchmarking Spatial Intelligence under Visual Degradation
- arxiv url: http://arxiv.org/abs/2605.22536v1
- Date: Thu, 21 May 2026 14:25:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-22 16:35:42.295714
- Title: SpaceDG: Benchmarking Spatial Intelligence under Visual Degradation
- Title(参考訳): SpaceDG:視覚的劣化下での空間知能のベンチマーク
- Authors: Xiaolong Zhou, Yifei Liu, Ziyang Gong, Jiarui Li, Qiyue Zhao, Muyao Niu, Yuanyuan Gao, Le Ma, Xue Yang, Hongjie Zhang, Zhihang Zhong,
- Abstract要約: 劣化認識型空間理解のための最初の大規模データセットであるSpaceDGを紹介する。
SpaceDG-Benchは、11の推論カテゴリと9の視覚的劣化タイプにまたがる1,102の質問で、10KのVQAインスタンスを出力するベンチマークである。
本研究では,SpaceDGの微調整により,劣化強度が著しく向上し,劣化条件下での人体性能を上回り得ることを示す。
- 参考スコア(独自算出の注目度): 33.562616828808736
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal Large Language Models (MLLMs) have made rapid progress in spatial intelligence, yet existing spatial reasoning benchmarks largely assume pristine visual inputs and overlook the degradations that commonly occur in real-world deployment, such as motion blur, low light, adverse weather, lens distortion, and compression artifacts. This raises a fundamental question: how robust is the spatial intelligence of current MLLMs when visual observations are imperfect? To answer this question, we introduce SpaceDG, the first large-scale dataset for degradation-aware spatial understanding. It is constructed with a physically grounded degradation synthesis engine that embeds degradation formation process into 3D Gaussian Splatting (3DGS) rendering, enabling realistic simulation of nine degradation types. The resulting dataset contains approximately 1M QA pairs from nearly 1,000 indoor scenes. We further introduce SpaceDG-Bench, an human-verified benchmark with 1,102 questions spanning 11 reasoning categories and 9 visual degradation types, yielding over 10K VQA instances. Evaluating 25 open- and closed-source MLLMs reveals that visual degradations consistently and substantially impair spatial reasoning, exposing a critical robustness gap. Finally, we show that finetuning on SpaceDG markedly improves degradation robustness and can even surpass human performance under degraded conditions without any performance drop on clean images, highlighting the promise of degradation-aware training for robust spatial intelligence.
- Abstract(参考訳): MLLM(Multimodal Large Language Models)は、空間知能において急速に進歩しているが、既存の空間推論ベンチマークでは、視覚的なインプットを概ね前提としており、動きのぼやけ、低照度、悪天候、レンズ歪み、圧縮アーチファクトなど、現実世界の展開で一般的に発生する劣化を見落としている。
これは、視覚的な観察が不十分な場合、現在のMLLMの空間的知能はどれほど堅牢かという根本的な疑問を引き起こす。
この問いに答えるために、分解認識空間理解のための最初の大規模データセットであるSpaceDGを紹介する。
分解過程を3次元ガウススプラッティング(3DGS)レンダリングに埋め込んだ物理接地分解合成エンジンを用いて構築され、9種類の分解の現実的なシミュレーションを可能にする。
得られたデータセットには、約1000の屋内シーンから約100万のQAペアが含まれている。
さらに、SpaceDG-Benchを紹介します。11の推論カテゴリと9の視覚的劣化タイプにまたがる1,102の質問があり、10KのVQAインスタンスが生成される。
25個のオープンおよびクローズドソースMLLMを評価すると、視覚的劣化が連続的に、実質的に空間的推論を損なうことが示され、重要なロバスト性ギャップが露呈する。
最後に,SpaceDGの微調整により,劣化の堅牢性が著しく向上し,クリーンな画像に性能低下を伴わずに,劣化条件下での人的パフォーマンスを上回り,堅牢な空間知能のための劣化認識トレーニングの可能性を強調できることを示す。
関連論文リスト
- SpatialForge: Bootstrapping 3D-Aware Spatial Reasoning from Open-World 2D Images [16.243887520581925]
本研究では,2次元画像から空間的推論制御へ変換するスケーラブルなデータ合成パイプラインを提案する。
本研究では,空間的推論を知覚と関係に分解し,深度,レイアウト,視点に依存した推論を網羅した構造化された監視信号を構築する。
論文 参考訳(メタデータ) (2026-05-12T03:20:41Z) - Spatial Causal Prediction in Video [56.22332198384257]
我々は,空間因果的結果の予測と観察以上の推論をモデルに挑戦する新しい課題パラダイムを導入する。
我々は、様々な視点、シーン、因果方向にまたがる1,181本の動画に2500対のQAペアからなるベンチマークを構築した。
23種類の最先端モデルに関する総合的な実験を通して、人間とモデルの性能の差は時間外挿に制限され、因果的接地は弱かった。
論文 参考訳(メタデータ) (2026-03-04T11:09:39Z) - Understanding Degradation with Vision Language Model [56.09241449206817]
視覚的劣化を理解することは、コンピュータビジョンにおいて重要な問題であるが、難しい問題である。
本稿では,教師付き微調整と強化学習を併用したマルチモーダル・チェーン・オブ・ソート・モデルであるDU-VLMを紹介する。
また,110,000個のクリーン劣化ペアと接地された物理アノテーションからなる大規模データセットである textbfDU-110k も導入した。
論文 参考訳(メタデータ) (2026-02-04T13:51:15Z) - From Indoor to Open World: Revealing the Spatial Reasoning Gap in MLLMs [65.04549036809557]
我々は、ステレオカメラ、LiDAR、IMU/GPSセンサーで撮影された歩行者の視線映像から構築したベンチマークを紹介する。
このデータセットは、計量的に正確な3D情報を提供し、空間的推論質問の自動生成を可能にする。
評価の結果、構造化屋内ベンチマークで観測された性能向上は、オープンワールド環境では消滅することが明らかとなった。
論文 参考訳(メタデータ) (2025-12-22T18:58:12Z) - SpaceVista: All-Scale Visual Spatial Reasoning from mm to km [43.506658643163405]
本稿は,2つの課題に対処することで,多様なシナリオをまたいだ空間的推論を促進することを目的とする。
屋内の3Dスキャンと、データセットのキュレーションのための労働集約的な手作業アノテーションに大きく依存する。
本稿では,構造化空間推論システム,スケール・アウェア・モデリング,プログレッシブ・トレーニング・パラダイムを統合した総合的なソリューションを提案する。
論文 参考訳(メタデータ) (2025-10-10T17:59:46Z) - MMSI-Bench: A Benchmark for Multi-Image Spatial Intelligence [74.51213082084428]
MMSI-Benchは、マルチイメージ空間インテリジェンスに特化したVQAベンチマークである。
我々は、大規模な実験を行い、34のオープンソースおよびプロプライエタリMLLMを徹底的に評価する。
最も強力なオープンソースモデルはおよそ30%の精度に達し、OpenAIのo3推論モデルは40%に達し、人間は97%である。
論文 参考訳(メタデータ) (2025-05-29T17:59:52Z) - Mind the Gap: Benchmarking Spatial Reasoning in Vision-Language Models [14.442394137843923]
本稿では,まず空間的推論のコア要素を記述した詳細な分析を行う。
次に、これらのモデルの性能を、合成画像と実画像の両方で評価する。
論文 参考訳(メタデータ) (2025-03-25T14:34:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。