論文の概要: SceneBench: A Hierarchical Benchmark for Vision-Language Understanding of 3D Scenes
- arxiv url: http://arxiv.org/abs/2609.16233v1
- Date: Mon, 14 Sep 2026 18:59:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 14:56:08.184496
- Title: SceneBench: A Hierarchical Benchmark for Vision-Language Understanding of 3D Scenes
- Title(参考訳): SceneBench: 3Dシーンの視覚言語理解のための階層的ベンチマーク
- Abstract要約: 視覚言語モデルは2次元画像理解において優れるが、3次元空間推論においては限定的である。
ガウススプラッティングで再構成した966枚のフォトリアリスティックな3DシーンのベンチマークであるSceneBenchを紹介する。
SceneBenchは、きめ細かい空間推論が可能なモデルの開発と評価のための現実的なテストベッドを提供する。
- 参考スコア(独自算出の注目度): 12.672496253081258
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Vision-language models excel at 2D image understanding but remain limited in 3D spatial reasoning. Progress is hindered by limitations in current benchmarks. First, 3D datasets often rely on point clouds that capture geometry but discard rich visual features like texture, text, and materials. Second, annotations treat objects in isolation while ignoring real-world hierarchical organization (scenes, rooms, functional areas, object groups). Third, evaluation tasks focus narrowly on basic recognition rather than multi-step spatial reasoning. In this context, we introduce SceneBench, a benchmark of 966 photorealistic 3D scenes reconstructed with Gaussian Splatting and densely annotated with hierarchical semantics spanning scenes, rooms, functional areas, object groups, and individual objects. These annotations are produced through a human-in-the-loop pipeline combining vision-language models with roughly 1,500 human-hours of iterative refinement and verification, producing over 183K annotated nodes with textual descriptions and 3D bounding boxes. Building on this representation, we define three evaluation tasks: Existence-Based Questions probing object attributes, Spatial Intelligence Questions covering counting, size comparison, distance, and directional relations, and Grounded Question-Reasoning-Answer (QRA) triplets requiring multi-step reasoning across semantic levels. Experiments with state-of-the-art vision-language models show that while models perform well on basic recognition tasks (e.g., up to 85% accuracy for detection), performance drops substantially on hierarchical and compositional reasoning (e.g., down to 60% for counting), revealing limitations not captured by existing benchmarks. SceneBench provides a realistic testbed for developing and evaluating models capable of fine-grained spatial reasoning in photorealistic 3D environments.
- Abstract(参考訳): 視覚言語モデルは2次元画像理解において優れるが、3次元空間推論においては限定的である。
進捗は現在のベンチマークの制限によって妨げられています。
第一に、3Dデータセットは、しばしば幾何学を捉える点雲に依存するが、テクスチャ、テキスト、材料といったリッチな視覚的特徴を捨てる。
第二に、アノテーションは、現実の階層的な組織(シーン、部屋、機能領域、オブジェクトグループ)を無視しながら、オブジェクトを分離して扱う。
第3に、評価タスクは多段階空間推論よりも基本認識に焦点を絞る。
この文脈では、966枚のフォトリアリスティックな3DシーンのベンチマークであるSceneBenchを紹介します。
これらのアノテーションは、視覚言語モデルと約1,500時間の反復的洗練と検証を組み合わせ、テキスト記述と3Dバウンディングボックスを備えた183K以上の注釈付きノードを生成する。
この表現に基づいて、オブジェクト属性を探索する存在ベース質問、カウント、サイズ比較、距離、方向関係に関する空間知能質問、セマンティックレベルの多段階推論を必要とするグラウンドド質問-推論-回答(QRA)三つ組の3つの評価タスクを定義した。
最先端のビジョン言語モデルによる実験では、モデルが基本的な認識タスク(例えば、検出の精度が最大85%)でうまく機能する一方で、パフォーマンスは階層的および構成的推論(例えば、カウントの60%まで)で著しく低下し、既存のベンチマークでは捉えられていない制限を明らかにしている。
SceneBenchは、フォトリアリスティックな3D環境において、きめ細かい空間推論が可能なモデルの開発と評価のための現実的なテストベッドを提供する。
関連論文リスト
- Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM [71.01178857331969]
Chat-Scene++は3Dシーンをコンテキストリッチなオブジェクトシーケンスとして表現するMLLMフレームワークである。
Chat-Scene++は、シーンをコンテキスト意味を持ったオブジェクトのシーケンスとして構成することにより、オブジェクト中心の表現とインタラクションを可能にする。
Chat-Scene++は5つの主要な3Dビジョン言語ベンチマークで最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2026-03-29T04:16:04Z) - RoamScene3D: Immersive Text-to-3D Scene Generation via Adaptive Object-aware Roaming [79.81527946524098]
RoamScene3Dはセマンティックガイダンスと空間生成のギャップを埋める新しいフレームワークである。
我々は、オブジェクト関係を符号化するシーングラフを構築するために、視覚言語モデル(VLM)を用いる。
静的な2Dプリミティブの制約を軽減するため、合成パノラマデータセットに微調整されたモーションインジェクトインペインティングモデルを導入する。
論文 参考訳(メタデータ) (2026-01-27T10:10:55Z) - TUN3D: Towards Real-World Scene Understanding from Unposed Images [11.23080017635425]
TUN3Dは、実際のスキャンにおいて、関節配置推定と3次元物体検出に対処する新しい手法である。
地上カメラのポーズや深度監視は必要ない。
3つの挑戦的なシーン理解ベンチマークで最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2025-09-23T20:24:07Z) - Descrip3D: Enhancing Large Language Model-based 3D Scene Understanding with Object-Level Text Descriptions [28.185661905201222]
Descrip3Dは自然言語を使ってオブジェクト間の関係を明示的にエンコードする新しいフレームワークである。
グラウンド、キャプション、質問応答など、さまざまなタスクを統一した推論を可能にする。
論文 参考訳(メタデータ) (2025-07-19T09:19:16Z) - SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes [105.8644620467576]
Stextscurprise3Dは複雑な3次元シーンにおける言語誘導空間推論のセグメンテーションを評価するために設計された新しいデータセットである。
Stextscurprise3Dは、ScanNet++ v2から900以上の詳細な屋内シーンにわたる200k以上の視覚言語ペアで構成されている。
データセットには、オブジェクト名なしで意図的に作成される89k以上の人間アノテーション付き空間クエリが含まれている。
論文 参考訳(メタデータ) (2025-07-10T14:01:24Z) - From Objects to Anywhere: A Holistic Benchmark for Multi-level Visual Grounding in 3D Scenes [30.015378490907988]
Anywhere3D-Benchは2,886個の表現3D境界ボックスペアからなる総合的な3D視覚的グラウンドベンチマークである。
我々は,大規模言語モデルとともに,最先端の3次元視覚的グラウンドディング手法の評価を行った。
論文 参考訳(メタデータ) (2025-06-05T11:28:02Z) - Mind the Gap: Benchmarking Spatial Reasoning in Vision-Language Models [14.442394137843923]
本稿では,まず空間的推論のコア要素を記述した詳細な分析を行う。
次に、これらのモデルの性能を、合成画像と実画像の両方で評価する。
論文 参考訳(メタデータ) (2025-03-25T14:34:06Z) - MMScan: A Multi-Modal 3D Scene Dataset with Hierarchical Grounded Language Annotations [55.022519020409405]
本稿では,マルチモーダルな3Dシーンデータセットと階層型言語アノテーションを用いたベンチマーク,MMScanを構築した。
結果として得られたマルチモーダルな3Dデータセットは、109kオブジェクトと7.7kリージョン上の1.4Mメタアノテーション付きキャプションと、3Dビジュアルグラウンドと質問応答ベンチマークのための3.04M以上の多様なサンプルを含んでいる。
論文 参考訳(メタデータ) (2024-06-13T17:59:30Z) - Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers [65.51132104404051]
オブジェクトレベルのシーンと対話するために、オブジェクト識別子とオブジェクト中心表現を導入する。
我々のモデルは、ScanRefer、Multi3DRefer、Scan2Cap、ScanQA、SQA3Dなど、既存のベンチマーク手法よりも大幅に優れています。
論文 参考訳(メタデータ) (2023-12-13T14:27:45Z) - 3D Concept Grounding on Neural Fields [99.33215488324238]
既存の視覚的推論手法は、典型的には、2Dセグメンテーションマスクを抽出するために教師付き手法を用いる。
人間は、画像の3D表現の基盤となる概念を基盤にすることができる。
我々は,ニューラルネットワークの連続的,微分可能な性質を利用して概念をセグメント化し,学習することを提案する。
論文 参考訳(メタデータ) (2022-07-13T17:59:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。