論文の概要: SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute
- arxiv url: http://arxiv.org/abs/2607.28457v1
- Date: Thu, 30 Jul 2026 16:20:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.657455
- Title: SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute
- Title(参考訳): SVR: 適応テスト時間計算のための共同検証信頼強化学習による自己検証リファインメント
- Authors: Hongyu Chen, Liang Lin, Guangrun Wang,
- Abstract要約: 自己検証リファインメント(Self-Verifying Refinement)は、オラクルフリーのマルチターン強化学習フレームワークである。
自己検証を計算制御ポリシとして使用することを学ぶ。
マクロ平均精度は0.563で、平均で2.99回しか推測できない。
- 参考スコア(独自算出の注目度): 62.3458279176813
- License: http://creativecommons.org/publicdomain/zero/1.0/
- Abstract: Scaling test-time computation can improve language-model reasoning, but uniform budgets waste computation on easy inputs, while verifier-guided refinement relies on external feedback. We introduce Self-Verifying Refinement (SVR), an oracle-free multi-turn reinforcement learning framework that learns to use self-verification as a compute-control policy. At each turn, the model produces a solution together with a discrete correctness verdict and a confidence score; it retains the current answer only when the verdict is Correct and confidence exceeds a threshold, and otherwise continues refinement using its own self-verification. Ground-truth correctness is used only to construct training rewards and is never exposed to the policy through refinement prompts or required at inference. SVR is trained with GRPO on fixed-horizon trajectories using rewards that promote solution correctness, calibration-aware self-verification, and stop-ready correct states; adaptive stopping is activated only at inference. On seven mathematical reasoning benchmarks with Qwen3.5-2B, SVR achieves a macro-average accuracy of 0.563 with only 2.99 inference turns on average. In the evaluated complete-system comparison, it exceeds standard GRPO, strong multi-turn baselines, and a fixed-budget oracle-guided score-feedback reference while requiring substantially fewer turns than fixed ten-turn inference. These results demonstrate that learned self-verification can serve as an effective internal control signal for answer retention and adaptive test-time compute allocation.
- Abstract(参考訳): テスト時間計算のスケールは言語モデル推論を改善することができるが、一様予算は簡単な入力で計算を無駄にし、検証者誘導の洗練は外部からのフィードバックに依存する。
本稿では,自己検証を計算制御ポリシとして活用することを学ぶ,オラクルフリーのマルチターン強化学習フレームワークであるSelf-Verifying Refinement(SVR)を紹介する。
各ターンにおいて、モデルは離散的正当性判定と信頼度スコアと共に解を生成するが、その解が正当で信頼がしきい値を超える場合にのみ現在の解を保ち、それ以外は独自の自己検証を用いて洗練を続ける。
地道的正当性はトレーニング報酬の構築にのみ使用され、修正プロンプトや推論の要求によって政策に晒されることは決してない。
SVRは、解の正当性、校正を意識した自己検証、停止可能な正当性を促進する報酬を用いて、GRPOの固定水平軌道上で訓練され、適応停止は推論時にのみ活性化される。
Qwen3.5-2Bを用いた7つの数学的推論ベンチマークにおいて、SVRは平均値0.563のマクロ平均精度を平均2.99回だけ達成している。
評価された完全システム比較では、標準のGRPO、強いマルチターンベースライン、固定予算のオラクル誘導スコアフィードバック基準を超越し、固定10ターン推論よりもかなり少ないターンを必要とする。
これらの結果は、学習した自己検証が、回答の保持と適応的なテスト時間計算割り当てのための効果的な内部制御信号として機能することを示した。
関連論文リスト
- SVR-R1: Bootstrapping Multi-modal Reasoning with Self-verification in Reinforcement Learning [47.4480595602701]
本稿では、モデル自身の検証をマルチモーダル推論のための学習信号に変換するマルチターンRLフレームワークであるSelf-Verified Reasoner(SVR-R1)を紹介する。
各クエリに対して、同じ重みを使って回答を提案し、バイナリの自己予測(Yes/No)を発行する。
No'は第2のチャンスを再考し、"Yes"(ターンキャップ)は結果ベースの報酬を計算するためのアウトプットを確定する。
論文 参考訳(メタデータ) (2026-07-13T00:21:30Z) - Learning from Failures: Correction-Oriented Policy Optimization with Verifiable Rewards [73.44333771806282]
RLVR(Reinforcement Learning with Verifiable Rewards)は,大規模言語モデルの推論能力向上に有効なパラダイムとして登場した。
本稿では,RLVRの簡易かつ効果的な拡張であるCIPO(Correction-Oriented Policy Optimization)を提案する。
CIPOは学習効率を向上し、モデルが自身のエラーを修正する能力を明示的に強化する。
論文 参考訳(メタデータ) (2026-05-14T08:22:21Z) - Confidence Before Answering: A Paradigm Shift for Efficient LLM Uncertainty Estimation [47.91529693614168]
既存の方法は、主に回答ファーストであり、回答を生成した後のみ信頼を生み出す。
モデルが答える前に信頼を出力する信頼第一パラダイムについて検討し、このスコアを正解する確率として解釈する。
我々は,信頼度校正と正解精度をセグメント化された信用代入を通じて協調的に最適化する強化学習フレームワークであるCoCAを提案する。
論文 参考訳(メタデータ) (2026-03-06T04:03:13Z) - VI-CuRL: Stabilizing Verifier-Independent RL Reasoning via Confidence-Guided Variance Reduction [55.04308051033549]
RLVR(Reinforcement Learning with Verifiable Rewards)は、LLM(Large Language Models)推論を向上するための主要なパラダイムとして登場した。
モデル固有の信頼性を活用して外部検証から独立したカリキュラムを構築するフレームワークであるVerifier-Independent Curriculum Reinforcement Learning (VI-CuRL)を紹介する。
論文 参考訳(メタデータ) (2026-02-13T03:40:52Z) - CoRefine: Confidence-Guided Self-Refinement for Adaptive Test-Time Compute [10.548368675645403]
CoRefineは、トークンのごく一部を使って競争精度を達成する自信誘導型自己精製法である。
コントローラはフルトレースの信頼性を消費し、停止するか、再検査するか、あるいは別のアプローチを試すかを決定する。
これをCoRefine-Treeに拡張します。これは、探索とエクスプロイトを適応的にバランスさせる、ハイブリッドなシーケンシャル並列型です。
論文 参考訳(メタデータ) (2026-02-09T17:44:41Z) - Reliability-Aware Adaptive Self-Consistency for Efficient Sampling in LLM Reasoning [20.371912257758634]
自己整合性はマルチサンプルアグリゲーションによる推論信頼性を向上させるが、かなりの推論コストを発生させる。
本稿では,この制限に対処する信頼性適応型自己整合性(ReASC)を提案する。
ReASCは、既存のベースラインと比較して常に最高の精度とコストのトレードオフを達成し、3Bから27Bパラメータのモデルスケールでの推論効率を向上させる。
論文 参考訳(メタデータ) (2026-01-06T12:27:53Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - LaSeR: Reinforcement Learning with Last-Token Self-Rewarding [54.72617309922891]
RLVR(Reinforcement Learning with Verifiable Rewards)は、Large Language Models(LLM)の推論能力を高めるためのコアパラダイムとして登場した。
従来、LLMは2つの異なるプロンプトテンプレートを使用してソリューションと自己検証をシーケンシャルに生成し、効率を大幅に低下させる必要があった。
本稿では,従来のRLVR損失をMSE損失で増大させるアルゴリズムであるLaSeR(Reinforcement Learning with Last-Token Self-Rewarding)を提案する。
論文 参考訳(メタデータ) (2025-10-16T17:55:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。