論文の概要: When to Rethink: Learning Multi-Perspective Self-Verification for Vision-Language Models
- arxiv url: http://arxiv.org/abs/2610.07018v1
- Date: Sun, 04 Oct 2026 15:08:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.509116
- Title: When to Rethink: Learning Multi-Perspective Self-Verification for Vision-Language Models
- Title(参考訳): ビジョンランゲージモデルのための多視点自己検証の学習
- Abstract要約: 自己検証は、外部の判断に頼ることなく、回答の信頼性を向上させる実践的な方法を提供する。
既存の方法は通常、単一の検証基準または固定プロンプトに依存し、不完全で不安定な信頼性推定をもたらす。
textbfMulti-View Self-VerificatitextbfOn witextbfTh ReltextbfIability-Guided SelectitextbfVE Rethinking framework for reliable multimodal reasoning。
- 参考スコア(独自算出の注目度): 44.09070184181025
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-language models (VLMs) have achieved strong performance in multimodal reasoning, yet they remain prone to generating plausible but incorrect answers. Self-verification offers a practical way to improve answer reliability without relying on external judges, but existing methods typically depend on a single verification criterion or fixed prompt, resulting in incomplete and unstable reliability estimates. We first systematically analyze how verifier capability and prompt design affect verification performance. Our findings show that stronger verifiers provide more reliable judgments, while verification performance is highly sensitive to prompt choice, with no single prompt consistently dominating across tasks. Guided by these findings, we propose \texttt{MOTIVE}, a \textbf{M}ulti-View Self-Verificati\textbf{O}n wi\textbf{T}h Rel\textbf{I}ability-Guided Selecti\textbf{VE} Rethinking framework for reliable multimodal reasoning. \texttt{MOTIVE} evaluates each candidate answer from complementary verification perspectives and learns a correctness-aligned reliability score through correctness-grounded multi-view verification learning. During inference, this score governs an accept-or-rethink decision, allowing reliable answers to be returned directly while uncertain ones trigger history-guided rethinking. Extensive experiments across diverse multimodal benchmarks and VLM backbones demonstrate that \texttt{MOTIVE} consistently outperforms strong self-verification and self-correction baselines. Further results show that reliable verification improves accept-or-rethink decisions and reduces unnecessary reasoning turns, enabling more reliable and efficient self-verification without an external judge.
- Abstract(参考訳): 視覚言語モデル (VLM) は多モーダル推論において高い性能を保っているが、妥当だが不正確な解を生成する傾向にある。
自己検証は、外部の判断に頼ることなく、答えの信頼性を改善するための実践的な方法を提供するが、既存の手法は通常、単一の検証基準または固定プロンプトに依存し、不完全で不安定な信頼性推定をもたらす。
まず,検証能力と迅速な設計が検証性能に与える影響を系統的に分析する。
以上の結果から,より強力な検証器はより信頼性の高い判断を提供する一方,検証性能は選択の迅速化に極めて敏感であり,各タスクに対して一貫した優位性は得られなかった。
これらの知見に導かれて、我々は、信頼性のあるマルチモーダル推論のためのフレームワークを再考するフレームワーク、 \texttt{MOTIVE}, a \textbf{M}ulti-View Self-Verificati\textbf{O}n wi\textbf{T}h Rel\textbf{I}ability-Guided Selecti\textbf{VE}を提案する。
テキストt{MOTIVE} は相補的な検証の観点から各候補回答を評価し,正当性に基づく多視点検証学習を通じて正当性に整合した信頼性スコアを学習する。
推論中、このスコアは受け入れまたは再考の決定を統制し、信頼性の高い回答を直接返却し、不確実なものが履歴誘導の再考をトリガーする。
多様なマルチモーダルベンチマークとVLMバックボーンの広範な実験により、‘texttt{MOTIVE} は強い自己検証と自己補正ベースラインを一貫して上回ることを示した。
さらに、信頼性の高い検証は、受理または再考の判断を改善し、不要な推論のターンを減らし、外部の判断なしにより信頼性が高く効率的な自己検証を可能にすることを示す。
関連論文リスト
- Mitigating Perceptual Judgment Bias in Multimodal LLM-as-a-Judge via Perceptual Perturbation and Reward Modeling [35.945096782147864]
MLLMの裁判官は、視覚的証拠がテキストの手がかりと矛盾する場合、知覚的に正しい答えに対して、もっともらしい物語に報いる傾向がある。
本稿では,最小限に編集された反事実応答を構成するPerceptually Perturbed Judgmentデータセットを提案する。
我々は、構造化GRPOベースの報酬とバッチレベルの目標を組み合わせた統一的なトレーニングフレームワークを開発し、明示的なペアワイドラベルを使わずにコヒーレントなグローバルオーダを実現する。
論文 参考訳(メタデータ) (2026-06-01T17:59:46Z) - ORCE: Order-Aware Alignment of Verbalized Confidence in Large Language Models [17.761630515662947]
本稿では,言語的信頼度校正のための疎結合・秩序対応フレームワークを提案する。
提案手法は,まず回答を生成し,固定された質問対に条件付き信頼度を推定する。
実験により,本手法は解答精度を大きく保ちながらキャリブレーションと故障予測性能を向上させることが示された。
論文 参考訳(メタデータ) (2026-05-12T17:39:43Z) - FACT-E: Causality-Inspired Evaluation for Trustworthy Chain-of-Thought Reasoning [49.65751420291115]
CoT(Chain-of-Thought)プロンプトはLSM推論を改善したが、モデルはしばしば不誠実な中間ステップを含むコヒーレントな説明を生成する。
我々は、CoTの品質を評価するための因果性に着想を得たフレームワークであるFACT-Eを提案する。
FACT-Eは推論・軌道選択を改善し、文脈内学習を強くすることを示す。
論文 参考訳(メタデータ) (2026-04-12T15:35:08Z) - Towards Real-Time Fake News Detection under Evidence Scarcity [66.58597356379907]
本稿では,リアルタイムフェイクニュース検出のための新しいフレームワークである評価アウェア・セレクション・オブ・エキスパートズ(EASE)を提案する。
EASEは、利用可能な証拠の十分性を評価した意思決定プロセスに適合する。
本稿では,新興ニュースのモデル一般化を限られた証拠で評価するための新しいベンチマークであるRealTimeNews-25を紹介する。
論文 参考訳(メタデータ) (2025-10-13T11:11:46Z) - VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains [19.579511315215424]
大規模な言語モデルは、フィードバックを通じて推論能力を高めるために強化学習に依存している。
既存の研究では、より良い検証器の構築に焦点が当てられているが、異なる種類の検証器の性能の体系的な評価は依然として不十分である。
我々は、数学、物理学、化学、生物学に関する4000のエキスパートレベルの質問を構築した。
各質問には基準回答と多様な応答が備わっている。
論文 参考訳(メタデータ) (2025-07-14T03:45:24Z) - Trust, But Verify: A Self-Verification Approach to Reinforcement Learning with Verifiable Rewards [67.86091419220816]
大規模言語モデル(LLM)は複雑な推論において非常に有望である。
一般的な問題は表面的な自己回帰であり、モデルが自身の出力をしっかりと検証できない。
本稿では、RISE(Reinforce Reasoning with Self-Verification)という新しいオンラインRLフレームワークについて紹介する。
論文 参考訳(メタデータ) (2025-05-19T17:59:31Z) - When to Trust LLMs: Aligning Confidence with Response Quality [49.371218210305656]
我々はconfidence-Quality-ORDer保存アライメントアプローチ(CONQORD)を提案する。
品質報酬と秩序保存アライメント報酬機能を統合する。
実験により,CONQORDは信頼性と応答精度のアライメント性能を著しく向上することが示された。
論文 参考訳(メタデータ) (2024-04-26T09:42:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。