論文の概要: SVR-R1: Bootstrapping Multi-modal Reasoning with Self-verification in Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2607.10966v1
- Date: Mon, 13 Jul 2026 00:21:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.28928
- Title: SVR-R1: Bootstrapping Multi-modal Reasoning with Self-verification in Reinforcement Learning
- Title(参考訳): SVR-R1:強化学習における自己検証によるマルチモーダル推論のブートストラップ化
- Authors: Mingyuan Wu, Jingcheng Yang, Shengyi Qian, Xudong Wang, Jize Jiang, Qifan Wang, Aashu Singh, Khoi Pham, Fei Liu, Zhaolun Su, Zhuokai Zhao, Klara Nahrstedt, Jianyu Wang, Hanchao Yu,
- Abstract要約: 本稿では、モデル自身の検証をマルチモーダル推論のための学習信号に変換するマルチターンRLフレームワークであるSelf-Verified Reasoner(SVR-R1)を紹介する。
各クエリに対して、同じ重みを使って回答を提案し、バイナリの自己予測(Yes/No)を発行する。
No'は第2のチャンスを再考し、"Yes"(ターンキャップ)は結果ベースの報酬を計算するためのアウトプットを確定する。
- 参考スコア(独自算出の注目度): 47.4480595602701
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: We introduce Self-Verified Reasoner (SVR-R1), a multi-turn RL framework that turns a model's own verification into a learning signal for multimodal reasoning. For each query, the model proposes an answer using the same weights, and issues a binary self-verdict (Yes/No). A 'No' triggers a second-chance rethink; a 'Yes,' or a turn cap, finalizes the output for computing the outcome-based reward. SVR-R1 is implemented with GRPO and an asynchronous multi-turn rollout framework and needs no external supervision or auxiliary critics. We evaluate SVR-R1 on vision-language reasoning benchmarks and show that it improves accuracy by a large margin over strong standard GRPO baselines. Training dynamics show decreasing reliance on verification-fewer verification turns, yet higher test accuracy-indicating that the gap between verification and generation narrows as the policy internalizes self-correction and chooses the most confident answer via our framework. SVR-R1 bridges the less explored intersection of inference-time self-refinement and RL training for VLMs, offering a simple yet effective recipe for bootstrapping multimodal reasoning. We will open-source \textbf{SVR-R1} to facilitate future research in VLMs.
- Abstract(参考訳): 本稿では、モデル自身の検証をマルチモーダル推論のための学習信号に変換するマルチターンRLフレームワークであるSelf-Verified Reasoner(SVR-R1)を紹介する。
各クエリに対して、同じ重みを使って回答を提案し、バイナリの自己予測(Yes/No)を発行する。
No'は第2のチャンスを再考し、"Yes"(ターンキャップ)は結果ベースの報酬を計算するためのアウトプットを確定する。
SVR-R1はGRPOと非同期マルチターンロールアウトフレームワークで実装されており、外部の監視や補助的な批評家は必要ない。
我々は,SVR-R1を視覚言語推論ベンチマークで評価し,強力な標準GRPOベースラインよりも高いマージンで精度を向上させることを示す。
トレーニングのダイナミクスは,検証結果の検証ターンへの依存度を低下させるが,検証と生成のギャップが狭くなり,自己訂正が内部化され,我々のフレームワークを通じて最も自信のある回答が選択されることを示す。
SVR-R1は、VLMの推論時自己再定義とRLトレーニングの交差を解明せず橋渡しし、マルチモーダル推論をブートストラップするためのシンプルで効果的なレシピを提供する。
VLM における今後の研究を促進するために,我々は \textbf{SVR-R1} をオープンソース化する。
関連論文リスト
- Reasoning Portability: Guiding Continual Learning for MLLMs in the RLVR Era [44.08086834976093]
VLM-CL(Vision-Language Models in Continual Learning)は,従来の知識を維持しつつ,新たなマルチモーダルタスクに継続的に適応することを目的としている。
Reasoning Portability(RP)に基づき,RLVRにおけるサンプルごとのKullback-Leibler正規化を形式化するReasoning-based Dynamic Balance Continual Learning(RDB-CL)を提案する。
実験の結果、RDB-CLはベースラインを一貫して上回り、ラスト精度はバニラRLVRベースラインよりも+12.0%向上した。
論文 参考訳(メタデータ) (2026-05-17T13:26:09Z) - SAGE: Shaping Anchors for Guided Exploration in RLVR of LLMs [55.46289074417954]
検証可能な報酬(RLVR)による強化学習は、推論タスクのpass@1を確実に改善するが、pass@kでは同等の利得を得られないことが多い。
中心的な構造的制約は、トレーニングを安定させるが、本質的には基準分布にポリシーを固定する逆-KL正規化から生じる。
我々は,逆KLアンカー分布自体を再構成することで,制御可能な経験的サポート拡張を可能にする,原則化されたフレームワークであるSAGEを提案する。
論文 参考訳(メタデータ) (2026-05-15T07:42:21Z) - Outcome Rewards Do Not Guarantee Verifiable or Causally Important Reasoning [42.998601712623525]
RLVRは、一般的に考えられているように、モデルが推論に依存しているとは限らないことを示す。
この問題は、訓練後の手順に簡単な修正を加えて修正することができる。
論文 参考訳(メタデータ) (2026-04-23T21:01:34Z) - Recursive Think-Answer Process for LLMs and VLMs [54.52289112197118]
R-TAP(Recursive Think-Answer Process)を提案する。
R-TAPにより、モデルは反復的推論サイクルに参加し、より正確な答えを生成することができる。
R-TAP強化モデルが従来のシングルパス法より一貫して優れていることを示す。
論文 参考訳(メタデータ) (2026-03-02T17:20:10Z) - Contextual Rollout Bandits for Reinforcement Learning with Verifiable Rewards [69.74686029941881]
RLVR(Reinforcement Learning with Verifiable Rewards)は、大規模言語モデルの推論能力を改善するための効果的なパラダイムである。
トレーニングを通して高価値ロールアウトを適応的に選択する統合型ニューラルネットワークスケジューリングフレームワークを提案する。
6つの数学的推論ベンチマークの実験では、複数のRLVR最適化手法で性能と訓練効率が一貫した向上を示した。
論文 参考訳(メタデータ) (2026-02-09T10:51:58Z) - AutoRubric-R1V: Rubric-Based Generative Rewards for Faithful Multimodal Reasoning [25.984031524564188]
AutoRubric-R1Vは、RLVRとプロセスレベルの監視を統合するフレームワークである。
ルーブリックベースと結果の報酬を併用することにより、AutoRubric-R1Vは6つのマルチモーダル推論ベンチマークで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2025-10-16T14:40:02Z) - CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models [85.315711639214]
モデル固有の好奇心を利用して探索をガイドするフレームワークであるCuriosity-Driven Exploration (CDE)を紹介した。
アクターに対しては、生成された応答に対してパープレキシティを使用し、批判に対しては、マルチヘッドアーキテクチャからの値推定のばらつきを利用する。
理論的分析により,アクターのボーナスは本質的に過度に信頼された誤りを罰し,正しい反応の多様性を促進することが示唆された。
論文 参考訳(メタデータ) (2025-09-11T17:59:17Z) - Trust, But Verify: A Self-Verification Approach to Reinforcement Learning with Verifiable Rewards [67.86091419220816]
大規模言語モデル(LLM)は複雑な推論において非常に有望である。
一般的な問題は表面的な自己回帰であり、モデルが自身の出力をしっかりと検証できない。
本稿では、RISE(Reinforce Reasoning with Self-Verification)という新しいオンラインRLフレームワークについて紹介する。
論文 参考訳(メタデータ) (2025-05-19T17:59:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。