論文の概要: Is Visual Prompting All You Need? Studying VLM Spatial Reasoning under Progressive Visual Scaffolds
- arxiv url: http://arxiv.org/abs/2608.21170v2
- Date: Mon, 24 Aug 2026 22:09:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-26 14:09:33.883613
- Title: Is Visual Prompting All You Need? Studying VLM Spatial Reasoning under Progressive Visual Scaffolds
- Title(参考訳): ビジュアル・プロンプトは必要か? : プログレッシブ・ビジュアル・スキャフォールド下でのVLM空間推論の研究
- Abstract要約: 本研究では,タスクの視覚的提示がモデル性能と障害モードを,基礎となる推論問題が変化しない場合にどのように形成するかを検討する。
空間構造をより使いやすくしながら、視覚的モダリティを保ちつつ、軽量な入力側足場を導入する。
視覚提示は,VLMベンチマークが基底認識,下流推論,あるいは両者の混合を計測するかどうかを決定する中心的な要因であることがわかった。
- 参考スコア(独自算出の注目度): 12.841957617988148
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Vision-language models (VLMs) have advanced rapidly in multimodal reasoning, yet recent work shows that their failures often reflect an interaction between visual grounding and downstream reasoning. What remains less clear is how the visual presentation of a task shapes model performance and failure modes when the underlying reasoning problem is unchanged. We study this question in SPaRC, a benchmark for grid-based visual spatial planning, by introducing lightweight input-side scaffolds that preserve the visual modality while making spatial structure more accessible. Across multiple VLMs, these scaffolds improve task accuracy over the original visual setting by up to 34.0 percentage points and further complement GRPO-based training, yielding up to 4.6 additional accuracy points compared with near-zero gains on the original visual input. Analyses on both end-to-end task solving and object detection show that these gains are closely tied to reductions in grounding-related errors, while rule reasoning remains comparatively challenging. We find that visual presentation is a central factor that determines whether VLM benchmarks measure grounded perception, downstream reasoning, or a mixture of both.
- Abstract(参考訳): 視覚言語モデル(VLM)は、マルチモーダル推論において急速に進歩しているが、最近の研究は、その失敗が視覚的接地と下流推論の相互作用を反映していることがしばしば示されている。
まだ明確でないのは、タスクの視覚的な表示が、根底にある推論問題が変化しない場合に、モデルのパフォーマンスと失敗モードをどのように形作るかである。
本研究では,グリッド型視覚空間計画のベンチマークであるSPaRCにおいて,空間構造をよりアクセスしやすいものにしつつ,視覚的モダリティを保った軽量な入力側足場を導入することにより,この問題を考察する。
複数のVLM全体で、これらの足場は元の視覚設定よりも最大34.0ポイントのタスク精度を改善し、GRPOベースのトレーニングを補完する。
エンドツーエンドのタスク解決とオブジェクト検出の両方の分析は、これらのゲインがグラウンドング関連エラーの削減と密接に結びついていることを示し、ルール推論は比較的難しいままである。
視覚提示は,VLMベンチマークが基底認識,下流推論,あるいは両者の混合を計測するかどうかを決定する中心的な要因であることがわかった。
関連論文リスト
- The Ebb and Flow of Multimodal Focus: Scheduling Visual Relay Windows for Grounded VLM Reasoning [82.58503785830632]
視覚言語モデルはマルチモーダル推論ベンチマークでますます成功するが、言語スタックに入ると視覚的証拠が不安定になることが多い。
本稿では,軽量な学習モジュールを用いたタスク適応型推論時間制御フレームワークTRACEを提案する。
4つのオープンウェイトなVLMバックボーンと7つのベンチマークで、TRACEはグラウンドに敏感な設定で大きく向上している。
論文 参考訳(メタデータ) (2026-07-13T11:44:23Z) - Imaginative Perception Tokens Enhance Spatial Reasoning in Multimodal Language Models [61.89854422423702]
視覚言語モデル(VLM)は多くのタスクで優れるが、重要な情報が直接観測できない場合、空間的推論に苦慮する。
Inaginative Perception Tokens (IPT) は、VLMが知覚する空間構成を外部化する中間的知覚表現である。
IPTの監督は、空間的推論を一貫して改善し、しばしば思考訓練のテキスト連鎖よりも優れる。
論文 参考訳(メタデータ) (2026-06-02T17:59:17Z) - Counting to Four is still a Chore for VLMs [3.017198998175514]
視覚言語モデル(VLM)は、複雑なマルチモーダル推論タスクにおいて印象的な性能を達成した。
それらは依然として、オブジェクトカウントのような単純な接地スキルで失敗します。
本稿では, 挙動解析と力学解析の両方を通して, VLM計数行動の実証的研究を行った。
論文 参考訳(メタデータ) (2026-04-11T05:23:19Z) - ReViP: Reducing False Completion in Vision-Language-Action Models with Vision-Proprioception Rebalance [50.05984919728878]
本稿では、視覚的接地と摂動下での堅牢性を高めるために、視覚-受容器リバランスを備えた新しいVLAフレームワークReViPを提案する。
具体的には、タスクステージオブザーバとして外部VLMを使用して、視覚的な観察からリアルタイムなタスク中心の視覚的手がかりを抽出する。
本稿では,オブジェクトドロップのような制御された設定を持つLIBERO上に構築された最初のFalse-Completion Benchmark Suiteを提案する。
論文 参考訳(メタデータ) (2026-01-23T11:31:07Z) - Unbiased Visual Reasoning with Controlled Visual Inputs [28.155426761798022]
VISTAは、明示的な情報のボトルネックを通じて、推論から認識を分離するフレームワークである。
凍結したVLMセンサは、短い客観的な知覚クエリに制限される。
テキストのみのLLM推論器は、各質問を分解し、クエリを計画し、自然言語で視覚的な事実を集約する。
論文 参考訳(メタデータ) (2025-12-19T18:52:06Z) - [De|Re]constructing VLMs' Reasoning in Counting [2.1856941852799134]
制御された実験条件下での計数作業における7つの最先端ビジョンランゲージモデル(VLM)の推論技術について検討した。
レイヤワイズ解析により、エラーは最終層表現の出力空間への誤ったマッピングによるものであることが明らかになった。
対象とするトレーニングでは,出力層のみの微調整により,最大21%の精度が向上した。
論文 参考訳(メタデータ) (2025-10-22T13:08:47Z) - Visual Structures Helps Visual Reasoning: Addressing the Binding Problem in VLMs [9.406760867809124]
本稿では,視覚入力構造を用いた拡張推論(VISER)を提案する。
VISERは、低レベルの空間構造を持つ視覚入力を増強する、シンプルで効果的な方法である。
私たちは、コアの視覚的推論タスクに対して、実質的なパフォーマンス改善を実証的に示します。
論文 参考訳(メタデータ) (2025-06-27T11:44:40Z) - ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs [98.27348724529257]
ViCrit (Visual Caption Hallucination Critic) は、VLMを訓練し、人間の手書き画像キャプションの段落に挿入された微妙で合成的な視覚幻覚をローカライズするRLプロキシタスクである。
ViCrit Taskでトレーニングされたモデルは、さまざまなビジョン言語モデルベンチマークで大幅に向上している。
論文 参考訳(メタデータ) (2025-06-11T19:16:54Z) - Can MLLMs Guide Me Home? A Benchmark Study on Fine-Grained Visual Reasoning from Transit Maps [56.76175383189738]
MLLMの詳細な視覚的理解と空間的推論能力を評価するためのベンチマークであるReasonMapを紹介する。
ReasonMapには、13か国30都市からの高解像度のトランジットマップが含まれており、2つの質問タイプと3つのテンプレートにまたがる1008の質問応答ペアが含まれている。
基本および推論変種を含む15種類のMLLMの包括的評価は、直感的パターンを示す。
論文 参考訳(メタデータ) (2025-05-24T12:33:52Z) - Open Eyes, Then Reason: Fine-grained Visual Mathematical Understanding in MLLMs [62.875934732547435]
現在の大言語モデル(MLLM)は、細かな視覚的理解を必要とする数学的問題解決のタスクでは性能が劣ることが多い。
本稿では,最先端MLLMの視覚的接地能力を評価し,視覚的接地精度と問題解決性能との間に有意な負の相関関係を示す。
本稿では,幾何学的地上視覚エンコーダと,階層型視覚特徴マップの寄与度を動的に調整する機能ルータを備えた新しいアプローチであるSVE-Mathを提案する。
論文 参考訳(メタデータ) (2025-01-11T04:08:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。