論文の概要: WM-VLM: Probing Internal World Models for Interleaved Visual-Textual Reasoning
- arxiv url: http://arxiv.org/abs/2609.34826v1
- Date: Mon, 28 Sep 2026 10:23:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 02:29:29.39561
- Title: WM-VLM: Probing Internal World Models for Interleaved Visual-Textual Reasoning
- Title(参考訳): WM-VLM:Interleaved Visual-Textual Reasoningのための内部世界モデルの提案
- Abstract要約: WMVLMは、トレーニング済みの視覚モデルと、中間的な視覚状態を生成するための軽量な世界モデルブランチを具備する。
2Dと3Dのメンタルローテーションタスクでは、WMVLMは監督された微調整されたバックボーンを常に上回り、39.25ポイントまで上昇する。
これらの結果は、内的世界モデルが言語と視覚空間の両方で意味を持つ視覚モデルへの有望な道をもたらすことを示唆している。
- 参考スコア(独自算出の注目度): 41.144735967012465
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Humans often solve spatial problems by mentally simulating visual transformations. In contrast, conventional vision-language models (VLMs) reason primarily through language. We investigate whether VLMs can solve spatial problems by reasoning with both text and generated visual states. To this end, we introduce WM-VLM, which equips a pretrained VLM with a lightweight world model branch for generating intermediate visual states. Our two-stage training first teaches the model to generate the next visual state and then to use that state for reasoning. We programmatically construct spatial reasoning tasks with verifiable intermediate visual states. These tasks allow us to evaluate how well the model generates visual states and how much it relies on them to answer the question. On 2D and 3D mental rotation tasks, WM-VLM consistently outperforms the supervised fine-tuned backbone, with gains of up to 39.25 percentage points. Ablations suggest that these gains depend on the generated visual states, as removing or corrupting them sharply reduces performance. Together, these results suggest that internal world models offer a promising path toward VLMs that reason in both language and visual space.
- Abstract(参考訳): 人間は、視覚的変換を精神的にシミュレートすることで、しばしば空間的な問題を解決する。
対照的に、従来の視覚言語モデル(VLM)は主に言語によるものである。
我々はVLMがテキストと生成した視覚状態の両方で推論することで空間問題を解くことができるかどうかを検討する。
この目的のために、WM-VLMを導入し、トレーニング済みのVLMに中間的な視覚状態を生成するための軽量な世界モデルブランチを装備する。
2段階のトレーニングは、まずモデルに次の視覚状態を生成し、その状態を推論に使用するように教えます。
検証可能な中間的視覚状態を用いて空間推論タスクをプログラム的に構築する。
これらのタスクにより、モデルがいかに視覚的状態を生成するか、そしてその疑問に答えるのにどれだけ依存するかを評価することができる。
2Dと3Dのメンタルローテーションタスクでは、WM-VLMは監督された微調整のバックボーンを常に上回り、39.25ポイントまで上昇する。
アブレーションは、これらのゲインが生成した視覚状態に依存していることを示唆している。
これらの結果は、内部世界モデルが言語と視覚空間の両方において、VLMへの有望な道をもたらすことを示唆している。
関連論文リスト
- Is Visual Prompting All You Need? Studying VLM Spatial Reasoning under Progressive Visual Scaffolds [12.841957617988148]
本研究では,タスクの視覚的提示がモデル性能と障害モードを,基礎となる推論問題が変化しない場合にどのように形成するかを検討する。
空間構造をより使いやすくしながら、視覚的モダリティを保ちつつ、軽量な入力側足場を導入する。
視覚提示は,VLMベンチマークが基底認識,下流推論,あるいは両者の混合を計測するかどうかを決定する中心的な要因であることがわかった。
論文 参考訳(メタデータ) (2026-08-21T14:40:26Z) - World2VLM: Distilling World Model Imagination into VLMs for Dynamic Spatial Reasoning [18.658825757342544]
視覚言語モデル (VLM) は静的視覚理解において高い性能を示した。
彼らは今でも、エゴセントリックな動きの下でのシーンの進化を想像する必要がある、ダイナミックな空間的推論に苦慮している。
生成世界モデルから視覚言語モデルに空間的想像力を蒸留するトレーニングフレームワーク World2VLM を提案する。
論文 参考訳(メタデータ) (2026-04-29T17:48:01Z) - Self-Rewarding Vision-Language Model via Reasoning Decomposition [49.784411666601905]
VLM(Vision-Language Models)はしばしば視覚幻覚に悩まされ、実際に画像にないものや言語ショートカットが語られる。
本稿では,外部視覚監督に頼らずに視覚推論を改善する自己回帰手法であるVision-SR1を紹介する。
我々の実験は、Vision-SR1が視覚的推論を改善し、視覚幻覚を緩和し、言語ショートカットへの依存を減らすことを示した。
論文 参考訳(メタデータ) (2025-08-27T08:01:03Z) - MindJourney: Test-Time Scaling with World Models for Spatial Reasoning [97.61985090279961]
視覚言語モデルのためのテスト時間スケーリングフレームワークであるMindJourneyを提案する。
我々は,代表的空間推論ベンチマークSATにおいて,MindJourneyが平均7.7%以上の性能向上を達成したことを示す。
また,本手法は,強化学習により訓練した試験時間推定VLMも改善する。
論文 参考訳(メタデータ) (2025-07-16T17:59:36Z) - Hidden in plain sight: VLMs overlook their visual representations [48.83628674170634]
視覚言語モデル(VLM)と視覚エンコーダを比較し、これらのモダリティをまたいで統合する能力を理解する。
VLMは視覚エンコーダよりも著しく性能が悪く、近距離性能に低下することがわかった。
論文 参考訳(メタデータ) (2025-06-09T17:59:54Z) - Prismatic VLMs: Investigating the Design Space of Visually-Conditioned Language Models [73.40350756742231]
視覚条件付き言語モデル(VLM)は、視覚対話、シーン理解、ロボットタスク計画などのアプリケーションに採用されている。
新しいリリースの量は多いが、イメージ前処理、アーキテクチャ、最適化に関する重要な設計決定は未調査である。
論文 参考訳(メタデータ) (2024-02-12T18:21:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。