論文の概要: Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text
- arxiv url: http://arxiv.org/abs/2607.21072v1
- Date: Thu, 23 Jul 2026 09:04:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-24 18:26:25.341208
- Title: Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text
- Title(参考訳): LLMテキストではなく、ジェネレーティブ・ピクセルにおける空間認知の評価
- Abstract要約: 空間知能は エージェントが 静的な意味理解から 物理的世界との 相互作用へと移行する上で 不可欠です
既存の空間推論ベンチマークでは座標、オプション、テキストが必要であり、画像生成モデルに対する応答とインタフェースのミスマッチを作成する。
提案するProVisEは,画像生成モデルからプロトコル制約付き視覚応答を抽出する,ベンチマークに依存しないフレームワークである。
- 参考スコア(独自算出の注目度): 19.512871070260477
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Spatial intelligence is essential for agents to move from static semantic understanding toward interacting with the physical world. Many spatial tasks are grounded in continuous visual scenes, where locations, regions, and paths are more naturally expressed by pointing, marking, or drawing than by reporting precise coordinates or discrete textual symbols. Yet existing spatial reasoning benchmarks usually require coordinates, options, or text, creating an answer-interface mismatch for image-generation models. This makes it difficult to evaluate image-generation models under the same task semantics as text-output VLMs, despite their ability to externalize spatial judgments directly in pixel space. We propose ProVisE (Protocolized Visual Evaluation), a benchmark-agnostic framework that elicits protocol-constrained visual answers from image-generation models and parses them into structured predictions compatible with original metrics. ProVisE also includes an Agentic builder that constructs and validates task-specific protocols for new benchmarks. We further introduce SpatialGen-Bench, a curated diagnostic benchmark of 470 samples across 14 spatial subtasks, four capability levels, and diverse answer forms. We evaluate representative text-output VLMs and image-generation models in a unified setting and validate Agentic protocol construction on six external spatial benchmarks. Results show that image-generation models are competitive when spatial answers can be externalized directly in pixel space, while text-output VLMs retain a clear advantage in compositional spatial reasoning. These findings reveal complementary strengths of pixel-space expression and text-based reasoning and establish a metric-compatible testbed for studying spatial cognition in image-generation models.
- Abstract(参考訳): エージェントが静的な意味理解から物理的世界との相互作用に移行するためには、空間知能が不可欠である。
多くの空間的タスクは、正確な座標や離散的なテキストシンボルを報告するよりも、位置、地域、経路をより自然に表現し、指差し、マーキングし、描画することで、連続的な視覚的なシーンに基礎を置いている。
しかし、既存の空間推論ベンチマークは通常座標、オプション、テキストを必要とし、画像生成モデルに対する応答とインタフェースのミスマッチを作成する。
これにより、空間的判断を直接ピクセル空間で外部化する能力にもかかわらず、テキスト出力VLMと同じタスクセマンティクスの下で画像生成モデルを評価することは困難になる。
ProVisE(Protocolized Visual Evaluation, ProVisE)は、画像生成モデルからプロトコル制約付き視覚応答を抽出し、元のメトリクスと互換性のある構造化された予測に解析する、ベンチマークに依存しないフレームワークである。
ProVisEには、新しいベンチマークのためのタスク固有のプロトコルの構築と検証を行うAgentic Builderも含まれている。
さらに、14の空間サブタスク、4つの能力レベル、多様な回答フォームにわたる470のサンプルをキュレートした診断ベンチマークであるSpatialGen-Benchを紹介する。
テキスト出力VLMと画像生成モデルを統一した設定で評価し、6つの外部空間ベンチマーク上でのエージェントプロトコル構築を検証する。
テキスト出力VLMは合成空間推論において明らかな優位性を維持しつつ,空間回答を直接画素空間で外部化できる場合,画像生成モデルは競合的であることを示す。
これらの結果は,画像生成モデルにおいて,ピクセル空間表現とテキストベースの推論の相補的な強みを明らかにし,空間認知を研究するための計量互換テストベッドを確立する。
関連論文リスト
- Vision as Unified Multimodal Generation [73.31482353559736]
SenseNova-Visionは、テキスト、画像、混合ターゲットにまたがるコンピュータビジョンの命令応答コーパスである。
このモデルは、検出、OCR、キーポイント推定、セグメンテーション、深さ推定、表面正規予測、ポイントマップ、カメラポーズ推定を含む幅広い視覚タスクをカバーする。
実験により、単一の統一モデルが、構造化された視覚的理解、密集した幾何学的予測、セグメンテーション、多視点視覚幾何学にわたる主要なタスク特殊化システムと一致できることが示されている。
論文 参考訳(メタデータ) (2026-07-07T17:58:33Z) - Probing Geospatial SSL Representations with Environmental Signals [51.908606610432194]
自己教師付き学習(SSL)は、単一のタスクに最適化された表現ではなく、汎用的で転送可能な表現を学ぶように設計されている。
SSL表現は、イメージングプロセスと共変する環境変数との統計的関連を保存しているか?
この問題に対処するために、我々は、物理的に一貫した環境変数のグローバルデータセットである共配置ERA5再解析変数を用いてSSL表現を探索する。
論文 参考訳(メタデータ) (2026-07-06T15:24:25Z) - OmniGF: A Dual-Branch Vision-Language Framework for Unified Gaze Following [59.53720386342017]
拡張性のある多対人視線推論に基礎的な視覚言語モデルを適用する統合視覚言語フレームワークを提案する。
すべての個人をモデル化することにより、OmniGFは正確な空間的視線目標推定、意味的視線予測、複雑な社会的視線推定をシームレスに統合する。
論文 参考訳(メタデータ) (2026-05-26T00:08:06Z) - SpatialReward: Verifiable Spatial Reward Modeling for Fine-Grained Spatial Consistency in Text-to-Image Generation [62.55421542903781]
生成された画像の空間的レイアウトを評価するために明示的に設計された検証可能な報酬モデルである textbfSpatialReward を提案する。
安定拡散とFLUXの実験により、空間的リワードをRLトレーニングに組み込むことで、空間的一貫性と全体的な生成品質が一貫して向上することが示された。
論文 参考訳(メタデータ) (2026-03-23T17:26:35Z) - Uni-RS: A Spatially Faithful Unified Understanding and Generation Model for Remote Sensing [9.357861053928898]
統一されたリモートセンシングマルチモーダルモデルは、明らかに空間的逆転の呪いを示す。
リモートセンシングに適した最初の統一モデルUni-RSを提案する。
本研究では,テキスト・画像生成における空間忠実度を大幅に向上させる手法を提案する。
論文 参考訳(メタデータ) (2026-01-25T03:22:26Z) - CoPatch: Zero-Shot Referring Image Segmentation by Leveraging Untapped Spatial Knowledge in CLIP [26.827036116024914]
textscCoPatchはゼロショットRISフレームワークで、テキストと画像の両方の空間表現を強化する。
また,textscCoPatchは, RefCOCO, RefCOCO+, RefCOCOg, PhraseCut (+ 2--7 mIoU) のゼロショットRISにおける空間接地を,追加の訓練を必要とせずに大幅に改善することを示した。
論文 参考訳(メタデータ) (2025-09-27T04:12:10Z) - Mind-the-Glitch: Visual Correspondence for Detecting Inconsistencies in Subject-Driven Generation [120.23172120151821]
本稿では,事前学習した拡散モデルのバックボーンから視覚的特徴と意味的特徴を分離するための新しいアプローチを提案する。
注釈付きセマンティックと視覚対応を備えた画像ペアを構築する自動パイプラインを導入する。
被験者駆動画像生成における視覚的不整合を定量化する新しい指標であるビジュアルセマンティックマッチングを提案する。
論文 参考訳(メタデータ) (2025-09-26T07:11:55Z) - Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models [3.5999252362400993]
構成生成における主要な問題は、空間的関係の不整合である。
本研究では,テキストと画像間の2次元空間関係と3次元空間関係のアライメントを評価するための新しい評価指標を提案する。
また,T2Iモデルにおける2次元空間関係と3次元空間関係のアライメントを微調整を必要とせずに改善する推定時間であるPoSベースの生成を提案する。
論文 参考訳(メタデータ) (2025-06-29T22:41:27Z) - MPDrive: Improving Spatial Understanding with Marker-Based Prompt Learning for Autonomous Driving [23.012850820921592]
マーカベースのPmpt Learning framework (MPDrive) は、簡潔な視覚マーカーによる空間座標を表す。
MPDriveは、特に高度な空間的理解を必要とする場合に、最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2025-04-01T02:49:39Z) - Mind the Gap: Benchmarking Spatial Reasoning in Vision-Language Models [14.442394137843923]
本稿では,まず空間的推論のコア要素を記述した詳細な分析を行う。
次に、これらのモデルの性能を、合成画像と実画像の両方で評価する。
論文 参考訳(メタデータ) (2025-03-25T14:34:06Z) - REVISION: Rendering Tools Enable Spatial Fidelity in Vision-Language Models [67.55362046790512]
視覚言語モデルには、空間的関係を正しく推論する能力がない。
視覚言語モデルにおける空間忠実度を改善するREVISIONフレームワークを開発した。
本研究の結果から,レンダリングベースのフレームワークは空間認識モデルの開発に有効な手法であることが示唆された。
論文 参考訳(メタデータ) (2024-08-05T04:51:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。