論文の概要: Be Consistent! Enhancing Robust Visual Reasoning in LVLMs with Consistency Constraints
- arxiv url: http://arxiv.org/abs/2607.21722v1
- Date: Thu, 23 Jul 2026 18:04:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 20:58:56.967364
- Title: Be Consistent! Enhancing Robust Visual Reasoning in LVLMs with Consistency Constraints
- Title(参考訳): 一貫性! 一貫性制約を持つLVLMにおけるロバスト視覚推論の強化
- Authors: Liqiang Jing, Xiong Zhou, Siddharth Varia, Neha Anna John, Xinya Du, Vassilis N. Ioannidis,
- Abstract要約: LVLM(Large Vision-Language Models)は強力な知覚能力を示すが、視覚的推論タスクには弱い。
ConVBenchは、視覚中心の推論ベンチマークで、各画像に2つの論理的に等価な質問をペアリングする。
また,グループ相対政策最適化(GRPO)に基づく強化学習を通じてLVLM推論を改善するConVLMを提案する。
- 参考スコア(独自算出の注目度): 31.911378374313376
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: While Large Vision-Language Models (LVLMs) exhibit strong perceptual capabilities, they remain vulnerable in visual reasoning tasks. Existing benchmarks largely focus on symbolic mathematical or scientific problems and simple vision-centric tasks, offering limited assessment of complex visual reasoning and logical consistency, a critical requirement for reliable reasoning systems. We introduce ConVBench, a complex vision-centric reasoning benchmark in which each image is paired with two logically equivalent questions across six categories: action and state, complex counting, spatial reasoning, causal and intent understanding, commonsense reasoning, and temporal perception. To complement this benchmark, we define two evaluation metrics, logical consistency and robust accuracy, that jointly assess both the correctness and consistency of model responses. We further present ConVLM, which improves LVLM reasoning through Group Relative Policy Optimization (GRPO)-based reinforcement learning with a novel consistency reward. This method leverages automatically generated logically equivalent question-answer pairs and a dual-reward design combining accuracy- and consistency-based signals, encouraging agreement between paired responses. The framework functions effectively with or without strict answer supervision.
- Abstract(参考訳): LVLM(Large Vision-Language Models)は知覚能力が高いが、視覚的推論タスクには弱い。
既存のベンチマークは主に記号的な数学的または科学的な問題と単純な視覚中心のタスクに焦点を合わせ、複雑な視覚的推論と論理的整合性の限定的な評価を提供し、信頼できる推論システムにとって重要な要件である。
ConVBenchは複雑な視覚中心の推論ベンチマークで、各画像はアクションと状態、複雑なカウント、空間的推論、因果的および意図的理解、常識的推論、時間的知覚の6つのカテゴリで、論理的に等価な2つの質問とペアリングされる。
このベンチマークを補完するために、モデル応答の正しさと整合性の両方を共同で評価する2つの評価指標、論理的整合性とロバストな精度を定義した。
さらに,グループ相対政策最適化(GRPO)に基づく強化学習を通じてLVLM推論を改善するConVLMを提案する。
この方法は、論理的に等価な問合せ対と、精度と一貫性に基づく信号を組み合わせた双対逆設計を利用して、ペア応答の一致を奨励する。
このフレームワークは、厳格な回答監督によって効果的に機能する。
関連論文リスト
- A Survey of Reasoning in Autonomous Driving Systems: Open Challenges and Emerging Paradigms [49.66022971508878]
私たちは、推論はモジュラーコンポーネントからシステムの認知コアに高めるべきだと論じています。
応答性推論のトレードオフやソーシャルゲーム推論など,7つの中核的推論課題を導出し,体系化する。
我々は,LLMに基づく推論と,ミリ秒スケールで安全クリティカルな車両制御の要求との間の,高レイテンシ,熟考的特性の根本的かつ未解決な緊張関係を同定する。
論文 参考訳(メタデータ) (2026-03-11T07:40:53Z) - GeoReason: Aligning Thinking And Answering In Remote Sensing Vision-Language Models Via Logical Consistency Reinforcement Learning [12.987952829880363]
GeoReasonは、内部思考と最終的な決定を同期させるように設計されたフレームワークである。
まず、4000の推論軌道を含む論理駆動型データセットGeoReason-Benchを構築した。
次に,(1)推論の構文とドメインの専門知識をモデルに組み込むための知識初期化の促進,(2)推論の信頼性を向上するための一貫性を考慮した強化学習,という2段階の学習戦略を定式化する。
論文 参考訳(メタデータ) (2026-01-07T17:26:41Z) - Stepwise Think-Critique: A Unified Framework for Robust and Interpretable LLM Reasoning [47.867294403474176]
一つのモデル内の各ステップで推論と自己批判をインターリーブする統合フレームワークであるStepwise Think-Critiqueを提案する。
STCは、推論品質と自己評価を共同で最適化するために、推論報酬と批判一貫性報酬を組み合わせたハイブリッド強化学習目標を用いて訓練される。
論文 参考訳(メタデータ) (2025-12-17T18:15:17Z) - STaR: Towards Cognitive Table Reasoning via Slow-Thinking Large Language Models [12.745473719032026]
本稿では、認知テーブル推論を実現するための新しいフレームワークSTaR(slow-thinking for table reasoning)を提案する。
STaRはステップバイステップ思考と不確実性認識推論を明示的にモデル化する。
ベンチマーク実験により、STaRは優れた性能を示し、推論安定性が向上した。
論文 参考訳(メタデータ) (2025-11-14T12:34:17Z) - Uni-MMMU: A Massive Multi-discipline Multimodal Unified Benchmark [69.8473923357969]
統一マルチモーダルモデルは、視覚的理解と生成を共同で行うことを目的としているが、現在のベンチマークでは、その真の統合を検査することはめったにない。
提案するUni-MMMUは、8つの推論中心領域にまたがる生成と理解の双方向の相乗効果を拡大する総合的なベンチマークである。
論文 参考訳(メタデータ) (2025-10-15T17:10:35Z) - Perception-Consistency Multimodal Large Language Models Reasoning via Caption-Regularized Policy Optimization [72.30168853571216]
マルチモーダルな言語モデルは、視覚知覚と象徴的推論を統合するタスクに優れています。
CapPO は,(1) 原画像上の条件付き応答とキャプション上の条件付き応答のばらつきを最小限に抑えるキャプションベース整合性正規化,(2) KL 重み付き優位性推定スキームを適応的に拡張して知覚整合性トラジェクトリを強化するキャプションベース整合性正規化という2つの重要なメカニズムを統合した。
論文 参考訳(メタデータ) (2025-09-26T04:32:26Z) - A Cognitive Paradigm Approach to Probe the Perception-Reasoning Interface in VLMs [3.2228025627337864]
本稿では,視覚言語モデル(VLM)における知覚推論インタフェースを識別するための構造化評価フレームワークを提案する。
本稿では,人間の問題解決戦略を反映した3つの評価パラダイムを提案する。
このフレームワークを適用したCAは、リッチで独立に生成された記述を推論するために強力な言語モデルを活用し、新しい最先端(SOTA)パフォーマンスを実現することを実証する。
論文 参考訳(メタデータ) (2025-01-23T12:42:42Z) - Measuring and Improving Chain-of-Thought Reasoning in Vision-Language Models [61.28463542324576]
視覚言語モデル(VLM)は近年,人間のような出力を生成できる視覚アシスタントとして,強力な有効性を示している。
我々は、既存の最先端のVLMを評価し、最高の性能モデルでさえ、強力な視覚的推論能力と一貫性を示すことができないことを発見した。
本稿では,VLMの推論性能と一貫性の向上を目的とした2段階トレーニングフレームワークを提案する。
論文 参考訳(メタデータ) (2023-09-08T17:49:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。