論文の概要: Reason Through the Latent! Making Latent Visual Reasoning Necessary
- arxiv url: http://arxiv.org/abs/2609.06746v2
- Date: Thu, 10 Sep 2026 16:07:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-11 14:47:34.248294
- Title: Reason Through the Latent! Making Latent Visual Reasoning Necessary
- Title(参考訳): Reason through the Latent! 潜入型ビジュアル推論の必要性
- Abstract要約: CVRR(Causal Visual Recurrent Reasoning)について紹介する。
CVRRは事前訓練された視覚能力を保持し、反復計算を予測に必要な経路とする。
本研究は,疑問が定まると再帰的内容に敏感な予測が残っており,持続的な視覚的証拠が再帰的軌跡を因果的に修正していることを示す。
- 参考スコア(独自算出の注目度): 15.899417214884243
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Latent visual reasoning aims to perform multimodal reasoning through hidden-state computation rather than explicit textual chains of thought. However, visual information being present in a latent state does not imply that the model actually relies on that state when producing its answer, especially when alternative image-conditioned paths remain available. We introduce Causal Visual Recurrent Reasoning (CVRR), which preserves pretrained visual competence while making recurrent computation the required image-conditioned path to prediction. CVRR initializes recurrence from the question hidden state after the pretrained vision-language model has incorporated the image, then repeatedly updates this state while re-reading the same fixed visual evidence. Before decoding, visual states and the original multimodal KV cache are removed so that only the final recurrent state carries image-conditioned information to the answer. Across the $V^*$, MMVP, BLINK, and MME-RealWorld-Lite benchmarks, CVRR retains strong performance under this strict interface, while compatible latent reasoners fail to recover comparable visual competence even when retrained under the same constraint. Causal interventions further show that predictions remain sensitive to recurrent content when the question is held fixed, and that persistent visual evidence causally revises the recurrent trajectory. These results distinguish latent informativeness from latent computation that is actually used for prediction.
- Abstract(参考訳): 潜在視覚推論は、明示的なテキスト・チェーン・オブ・シンクではなく、隠れ状態の計算によってマルチモーダル推論を行うことを目的としている。
しかしながら、潜伏状態にある視覚情報は、そのモデルがその答えを生成する際に実際にその状態に依存しているという意味ではなく、特に別の画像条件のパスが利用可能である場合である。
本稿では,予測に必要となる画像条件の経路を再帰的に計算しながら,事前学習した視覚能力を維持するCausal Visual Recurrent Reasoning(CVRR)を提案する。
CVRRは、事前訓練された視覚言語モデルがイメージを組み込んだ後、質問隠蔽状態から再帰を初期化し、同じ固定された視覚的証拠を読み取りながら、この状態を繰り返し更新する。
復号前は、視覚状態と元のマルチモーダルKVキャッシュを除去し、最終再帰状態のみが、画像条件の情報を答えに伝達する。
CVRRは、$V^*$, MMVP, BLINK, MME-RealWorld-Liteベンチマーク全体にわたって、この厳密なインターフェースの下では強力なパフォーマンスを維持している。
因果的介入は、質問が固定された場合、予測が繰り返しの内容に敏感であり、永続的な視覚的証拠は繰り返しの軌跡を因果的に修正することを示している。
これらの結果は、予測に実際に使用される潜時計算と潜時情報度を区別する。
関連論文リスト
- MNIST-PRO: MNIST is Back as a Partially Observable World for AI Agents [74.83535434786145]
MNIST-PRO (MNIST-PRO) は、MNISTの桁認識を、ルックバック制約付きシーケンシャルな視線に基づく検索タスクに変換することで、エージェント認識を分離するベンチマークである。
生の視覚履歴、テキスト状態、構造化されたメートル法グリッドマップ、統合された視覚キャンバスを含む4つの記憶表現の10つのマルチモーダルモデルを評価する。
論文 参考訳(メタデータ) (2026-08-31T16:05:39Z) - GLaQ: Grounding Latent Queries in Visual Evidence for Multimodal Reasoning [27.232897918541067]
連鎖推論は多モーダルな大言語モデルの問題解決能力を大幅に改善した。
しかし、微細な視覚的証拠は、テキストベースの推論ステップをまたいだ保存と再利用が難しいままである。
GLaQは、逐次ラテントロールアウトをコンテキスト条件付きクエリの固定セットに置き換える、接地型ラテントクエリフレームワークである。
論文 参考訳(メタデータ) (2026-08-16T04:01:08Z) - Recompute or Reuse? Diagnosing and Mitigating Textual Shortcuts in VLM Self-Reflection [21.066813947519723]
先行する思考の連鎖におけるエビデンスを含む推論は、視覚的再計算と行動的に競合するテキストのショートカットを形成することができることを示す。
我々は、事前のCoTから新鮮な計算を分離するトレーニング不要の介入である Fresh-State Attention Firewall (FSAF) を紹介する。
論文 参考訳(メタデータ) (2026-08-03T09:02:45Z) - Remember-R1: Mitigating Long-Context Visual Forgetting through Reinforcement Learning [50.56518447675037]
MLLM(Multimodal large language model)は、複雑なタスクに対する長い連鎖推論に依存している。
推論シーケンスが長引くにつれて、モデルは徐々に視覚的証拠に頼らず、蓄積されたテキストの文脈に頼り、視覚的忘れを招きかねない。
本稿では,元来の推論軌道に直接プロセスレベルの監督を適用することで,長いコンテキストの視覚的忘れを緩和する強化学習フレームワークであるResert-R1を提案する。
論文 参考訳(メタデータ) (2026-08-02T15:31:31Z) - Look Clearly Before Answering: Mitigating Hallucinations in LVLMs via Saliency-Driven Perceptual Realignment [45.92240827409312]
Saliency-Driven Perceptual Realignment (SDPR) は、推論全体を通して視覚的認知の低下を緩和するトレーニング不要のフレームワークである。
提案するSDPRは,全発生経路における視覚的認知の全体的アライメントのため,幻覚に対して頑健である。
論文 参考訳(メタデータ) (2026-07-18T14:39:16Z) - Diagnosing Visual Ignorance in Vision-Language Models [29.2851901986069]
VLM(Vision-Language Models)は、しばしば言語先行に頼り、視覚的証拠に弱く根ざした自信ある答えを生み出す。
本研究では,機械的視点と行動的視点の両方から言語優先性について検討する。
言語優先の信頼性は、モデル内部とベンチマークの妥当性の両方に影響を及ぼす体系的なルーティング障害であることがわかった。
論文 参考訳(メタデータ) (2026-06-05T04:16:01Z) - A Progressive Training Strategy for Vision-Language Models to Counteract Spatio-Temporal Hallucinations in Embodied Reasoning [49.61652671596548]
「多像幻覚推論」では、前頭と時頭クエリ間の大規模なパフォーマンス低下は、真に理解するのではなく、表面的なショートカットへの依存を示す。
これを軽減するために、我々は、チェーンステップへの詳細な推論と決定的な判断に基づく、時間的連鎖構築という新しいデータセットを開発する。
実験により,本手法は精度を向上するだけでなく,70%以上から6.53%まで,前向きのパフォーマンスギャップも改善することが示された。
論文 参考訳(メタデータ) (2026-04-12T07:48:44Z) - MedLVR: Latent Visual Reasoning for Reliable Medical Visual Question Answering [8.481971263315854]
textscMedLVRは、自動テキストデコーディングに明示的な視覚的エビデンス状態を導入する。
潜在的な視覚的推論は、診断に関連のある視覚的証拠を保存するための効果的なメカニズムを提供する。
論文 参考訳(メタデータ) (2026-04-10T16:03:03Z) - Understanding Degradation with Vision Language Model [56.09241449206817]
視覚的劣化を理解することは、コンピュータビジョンにおいて重要な問題であるが、難しい問題である。
本稿では,教師付き微調整と強化学習を併用したマルチモーダル・チェーン・オブ・ソート・モデルであるDU-VLMを紹介する。
また,110,000個のクリーン劣化ペアと接地された物理アノテーションからなる大規模データセットである textbfDU-110k も導入した。
論文 参考訳(メタデータ) (2026-02-04T13:51:15Z) - ReGuLaR: Variational Latent Reasoning Guided by Rendered Chain-of-Thought [49.203970812338916]
明示的な推論連鎖は、かなりの計算冗長性をもたらす。
近年の潜時推論法は、推理過程を潜時空間に圧縮することによりこれを緩和しようとする。
我々はRendered CoT-Guided Variational Latent Reasoning (ReGuLaR)を提案する。
論文 参考訳(メタデータ) (2026-01-30T17:08:06Z) - Thinking with Deltas: Incentivizing Reinforcement Learning via Differential Visual Reasoning Policy [75.66913260900726]
検証可能なリワードによる強化学習は、大規模言語モデルにおいてかなり高度な推論能力を持っている。
既存のパラダイムは、テキスト中心の成果報酬によって推進され、モデルが視覚的知覚をバイパスすることを奨励します。
我々はtextbfDifferential Visual Reasoning Policy によって駆動されるフレームワーク Deltas を用いた textbfThinking を提案する。
論文 参考訳(メタデータ) (2026-01-11T08:25:34Z) - BLINK-Twice: You see, but do you observe? A Reasoning Benchmark on Visual Perception [67.89135437537179]
我々は視覚中心の推論ベンチマークであるBLINK-Twiceを紹介した。
外部の知識に頼るのではなく、私たちのタスクは視覚的コンテンツのみから推論するモデルを必要とします。
事前の知覚ベンチマークと比較すると、浅い知覚を超越し、きめ細かい観察と分析的推論を必要とする。
論文 参考訳(メタデータ) (2025-10-10T13:14:13Z) - Loss re-scaling VQA: Revisiting the LanguagePrior Problem from a
Class-imbalance View [129.392671317356]
本稿では,クラス不均衡の観点から,VQAにおける言語先行問題を理解することを提案する。
これは、なぜVQAモデルが頻繁に、そして明らかに間違った答えをもたらすのかを明確に示している。
また,顔認識や画像分類などの他のコンピュータビジョンタスクに対して,クラス不均衡解釈方式の有効性を正当化する。
論文 参考訳(メタデータ) (2020-10-30T00:57:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。