論文の概要: Eliciting Self-Verification in Multimodal Reasoning Agents with Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2609.08025v1
- Date: Mon, 07 Sep 2026 22:15:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.527598
- Title: Eliciting Self-Verification in Multimodal Reasoning Agents with Reinforcement Learning
- Title(参考訳): 強化学習によるマルチモーダル推論エージェントの自己検証の回避
- Authors: Vishwas Sathish, Viresh Ranjan, Xinliang Zhu, Arnab Dhua, Douglas Gray,
- Abstract要約: Reinforcement Learning (SVRL)による自己検証 (Self-Verification) は、検索された証拠を自身の推論トレース内で検証およびフィルタリングするために、マルチモーダルエージェントを訓練する。
SVRLはまた、不要なツールコールを回避できる検索対応ペナルティと、多種多様な、十分に整った検索クエリを促進するクエリ多様性報酬も導入している。
全体として、SVRLは、訓練と推論のコストを大幅に削減しながら、コンパクトエージェントとはるかに大きなプロプライエタリモデルの間のギャップを狭める。
- 参考スコア(独自算出の注目度): 9.939107031203838
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reasoning agents increasingly rely on external tools such as web search to answer complex queries. Reinforcement learning (RL) finetuning algorithms such as GRPO have improved long-form reasoning in text-only language models, particularly for coding and mathematics. Reliable tool use in multimodal agents, however, remains challenging because models must interpret text and images while integrating noisy retrieved evidence, often under sparse outcome-level supervision without explicit verification signals. We present Self-Verification via Reinforcement Learning (SVRL), an RL-only finetuning framework that trains multimodal agents to verify and filter retrieved evidence within their own reasoning traces, reducing reliance on external verifiers at inference time. SVRL also introduces a search-aware penalty that discourages unnecessary tool calls and a query-diversity reward that encourages diverse, well-formed search queries, providing fine-grained feedback on when and what to search. Finetuning Qwen-2.5-VL-7B with SVRL on only 5{,}000 visual question answering examples yields consistent gains in multi-hop VQA generalization and tool efficiency across benchmarks. Overall, SVRL narrows the gap between compact agents and much larger proprietary models while requiring substantially lower training and inference cost.
- Abstract(参考訳): 推論エージェントは、複雑なクエリに答えるために、Web検索のような外部ツールにますます依存している。
GRPOのような強化学習(RL)ファインタニングアルゴリズムは、特にコーディングや数学において、テキストのみの言語モデルにおける長文推論を改善した。
しかし、マルチモーダルエージェントにおける信頼性の高いツールの使用は、しばしば明示的な検証信号なしで少ない結果レベルの監督の下で、ノイズの多い証拠を統合しながら、モデルがテキストや画像を解釈しなければならないため、依然として困難である。
RLのみの微調整フレームワークである自己検証(Self-Verification via Reinforcement Learning, SVRL)を提案する。
SVRLはまた、不要なツールコールを回避できる検索対応ペナルティを導入し、クエリ多様性の報酬を導入し、多種多様な検索クエリを奨励し、いつ何を検索すべきかに関するきめ細かいフィードバックを提供する。
SVRLでQwen-2.5-VL-7Bを5{,}000の視覚的質問応答例で微調整すると、マルチホップVQAの一般化とベンチマーク間のツール効率が一貫した利得が得られる。
全体として、SVRLは、訓練と推論のコストを大幅に削減しながら、コンパクトエージェントとはるかに大きなプロプライエタリモデルの間のギャップを狭める。
関連論文リスト
- ARISE-RL: Agentic Rubric-Grounded Iterative Self-Evolution with Reinforcement Learning [74.19730275669227]
ARISE-RLは、オープンエンドエージェントをトレーニングするための新しいフルサイクルの自己進化フレームワークである。
Reward-Gated Self-Evolution Distillation (RG-SED)を提案する。
ECR-Benchは,シングルツールディープリサーチとマルチツールトラベルプランニングを対象とする,専門家校正型ルーリックベンチマークスイートである。
論文 参考訳(メタデータ) (2026-09-01T10:54:13Z) - OpenSearch-VL: An Open Recipe for Frontier Multimodal Search Agents [50.79529228477821]
エージェント強化学習を用いたフロンティアマルチモーダルディープサーチエージェントの完全オープンソースレシピであるOpenSearch-VLを紹介した。
まず、ウィキペディアパスのサンプリング、ファジィエンティティの書き換え、ソース・アンカーの視覚的グラウンドリングを通じて、高品質なトレーニングデータを構築するための専用パイプラインをキュレートした。
さらに,テキスト検索,画像検索,OCR,収穫,研削,超解像,視点補正を統一する多様なツール環境を設計する。
論文 参考訳(メタデータ) (2026-05-06T17:50:38Z) - AgentV-RL: Scaling Reward Modeling with Agentic Verifier [63.55502685076245]
試験時間スケーリング(TTS)によるLCM推論を強化する検証器が実証されている。
本稿では,報酬モデリングを多ターンツール拡張型検討プロセスに変換するフレームワークであるエージェント検証を提案する。
Agentic Verifier は並列およびシーケンシャルTS の両方で一貫した性能向上が得られることを示す。
論文 参考訳(メタデータ) (2026-04-17T12:27:36Z) - SubSearch: Intermediate Rewards for Unsupervised Guided Reasoning in Complex Retrieval [61.73547199231695]
SubSearchは、結果のみの監視から中間報酬信号に移行する特殊なフレームワークである。
実験により、本質的な報酬を伴う中間的推論ステップの報酬はより堅牢な推論トレースをもたらすことが示された。
SubSearchは、複雑なクエリ応答のための検索エンジンをよりよく統合できる推論トレースを構築するのに役立つ。
論文 参考訳(メタデータ) (2026-04-08T13:09:47Z) - SIGHT: Reinforcement Learning with Self-Evidence and Information-Gain Diverse Branching for Search Agent [39.43590030917357]
SIGHTは、セルフエビデンスサポートと情報ゲイン駆動のディバースブランチを通じて、検索ベースの推論を強化するフレームワークである。
SIGHTは、検索結果をSESを介して高忠実性証拠に蒸留し、インフォメーションゲインスコアを算出して、重要な状態を特定する。
シングルホップとマルチホップのQAベンチマークの実験では、SIGHTが既存のアプローチを大幅に上回っていることが示されている。
論文 参考訳(メタデータ) (2026-02-12T04:16:55Z) - V-Retrver: Evidence-Driven Agentic Reasoning for Universal Multimodal Retrieval [32.5242219186118]
本稿では,視覚検査に基づくエージェント推論プロセスとしてマルチモーダル検索を再構成するエビデンス駆動検索フレームワークであるV-Retrverを提案する。
V-Retrverは、MLLMが外部視覚ツールを介して推論中に視覚的エビデンスを選択的に取得し、仮説生成と対象の視覚的検証を交互に行うマルチモーダル・インターリーブド推論プロセスを実行することを可能にする。
論文 参考訳(メタデータ) (2026-02-05T18:59:21Z) - VAR: Visual Attention Reasoning via Structured Search and Backtracking [49.427842994857635]
構造化された検索としてグラウンドド推論をリキャストするフレームワークであるVisual Attention Reasoningを紹介する。
VARは、推論プロセスを2つの重要な段階に分解する。
我々は、我々の7BモデルであるVAR-7Bが、幻覚と安全性のベンチマークの包括的なスイートに新しい最先端を設定していることを示します。
論文 参考訳(メタデータ) (2025-10-21T13:18:44Z) - ReVeal: Self-Evolving Code Agents via Reliable Self-Verification [11.875519107421312]
自己検証とツールベースの評価を通じてコード生成を進化させる強化学習フレームワークであるReVealを紹介する。
推論において、この強化された自己検証により、3つしかトレーニングされていないLiveCodeBenchでは、自己構築されたテストとツールフィードバックを使用して、20ターン以上のコードを継続的に進化させることができる。
これらの調査結果は、RLトレーニングとテストタイムスケーリングのためのスケーラブルなパラダイムとしてのReVealの約束を強調し、より堅牢で自律的なAIエージェントへの道を開いた。
論文 参考訳(メタデータ) (2025-06-13T03:41:04Z) - Self-RAG: Learning to Retrieve, Generate, and Critique through
Self-Reflection [74.51523859064802]
我々は、自己回帰検索拡張生成(Self-RAG)と呼ばれる新しいフレームワークを導入する。
自己RAGは、検索と自己回帰によってLMの品質と事実性を高める。
様々なタスクセットにおいて、最先端のLCMや検索強化モデルよりも大幅に優れています。
論文 参考訳(メタデータ) (2023-10-17T18:18:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。