論文の概要: Thinking with Novel Views: A Systematic Analysis of Generative-Augmented Spatial Intelligence
- arxiv url: http://arxiv.org/abs/2605.10588v1
- Date: Mon, 11 May 2026 13:59:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:50.868992
- Title: Thinking with Novel Views: A Systematic Analysis of Generative-Augmented Spatial Intelligence
- Title(参考訳): 新たな視点で考える:創造的空間知能の体系的分析
- Authors: Yanbing Zhang, Bo Wang, Jianhui Liu, Nan Jiang, Jiaxiu Jiang, Haoze Sun, Yijun Yang, Shenghe Zheng, Lin Song, Haoyang Huang, Nan Duan, Wenbo Li,
- Abstract要約: ノベルビューによる思考(TwNV)は、生成的なノベルビュー合成を推論ループに統合するパラダイムである。
TwNV は +1.3 から +3.9 pp の精度を常に向上し、視点感性サブタスクにおいて最大のゲインを持つことを示す。
- 参考スコア(独自算出の注目度): 60.11188590947511
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Current Large Multimodal Models (LMMs) struggle with spatial reasoning tasks requiring viewpoint-dependent understanding, largely because they are confined to a single, static observation. We propose Thinking with Novel Views (TwNV), a paradigm that integrates generative novel-view synthesis into the reasoning loop: a Reasoner LMM identifies spatial ambiguity, instructs a Painter to synthesize an alternative viewpoint, and re-examines the scene with the additional evidence. Through systematic experiments we address three research questions. (1) Instruction format: numerical camera-pose specifications yield more reliable view control than free-form language. (2) Generation fidelity: synthesized view quality is tightly coupled with downstream spatial accuracy. (3) Inference-time visual scaling: iterative multi-turn view refinement further improves performance, echoing recent scaling trends in language reasoning. Across four spatial subtask categories and four LMM architectures (both closed- and open-source), TwNV consistently improves accuracy by +1.3 to +3.9 pp, with the largest gains on viewpoint-sensitive subtasks. These results establish novel-view generation as a practical lever for advancing spatial intelligence of LMMs.
- Abstract(参考訳): 現在のLMM(Large Multimodal Models)は、視点に依存した理解を必要とする空間的推論タスクに苦慮している。
本稿では,創生的ノベルビュー合成を推論ループに統合するパラダイムであるThinking with Novel Views(TwNV)を提案する。
系統的な実験を通して、3つの研究課題に対処する。
1) 指示形式: 数値カメラ目的仕様は, 自由形言語よりも信頼性の高いビューコントロールを提供する。
2) 生成忠実度: 合成ビュークオリティは下流空間精度と密結合する。
(3) 推論時の視覚的スケーリング: 反復的マルチターンビュー改善は、言語推論における最近のスケーリングトレンドを反映して、パフォーマンスをさらに向上する。
4つの空間サブタスクカテゴリと4つのLMMアーキテクチャ(クローズドおよびオープンソースの両方)にわたって、TwNVは、常に+1.3から+3.9 ppの精度を向上し、視点に敏感なサブタスクに対して最大の利益をもたらす。
これらの結果は,LMMの空間知能向上のための実用的なレバーとして,新規ビュー生成を確立した。
関連論文リスト
- DiffThinker: Towards Generative Multimodal Reasoning with Diffusion Models [40.38351627330629]
生成的マルチモーダル推論フレームワークであるDiffThinkerを紹介する。
視覚中心のタスクにおいて、より優れた論理的一貫性と空間的精度が得られることを示す。
論文 参考訳(メタデータ) (2025-12-30T11:51:18Z) - Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations [61.235500325327585]
既存のAIベンチマークは、主に言語推論を評価し、非言語的で多段階の視覚シミュレーションの複雑さを無視している。
STAREは,マルチモーダルな大規模言語モデルを視覚シミュレーションによりよりよく解いたタスクで厳格に評価するためのベンチマークである。
評価の結果,より単純な2次元変換よりもモデルの方が優れているが,より複雑なタスクにおいてランダムに近い確率で実行可能であることがわかった。
論文 参考訳(メタデータ) (2025-06-05T05:09:46Z) - MMPerspective: Do MLLMs Understand Perspective? A Comprehensive Benchmark for Perspective Perception, Reasoning, and Robustness [50.33343842822694]
MMPerspectiveはマルチモーダルな大言語モデルの視点理解を評価するために設計された最初のベンチマークである。
このベンチマークでは,実世界の2,711の合成画像と5,083の問合せ対でキー機能を調べている。
43の最先端MLLMの総合評価により,重要な限界が明らかになった。
論文 参考訳(メタデータ) (2025-05-26T18:20:22Z) - VOILA: Evaluation of MLLMs For Perceptual Understanding and Analogical Reasoning [63.0285363282581]
MLLM(Multimodal Large Language Models)は、視覚情報とテキスト情報を統合するための強力なツールとなっている。
本稿では,MLLMの知覚的理解と抽象的関係推論を評価するためのベンチマークVOILAを紹介する。
我々は,現在のMLLMが画像間関係の理解に苦慮し,高レベルの関係推論において限られた能力を示すことを明らかにした。
論文 参考訳(メタデータ) (2025-02-25T23:36:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。