論文の概要: When Should LLMs Trust Their Own Revisions? A Risk-Aware Study of Intrinsic Self-Correction
- arxiv url: http://arxiv.org/abs/2609.35832v1
- Date: Wed, 23 Sep 2026 21:05:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:46.855101
- Title: When Should LLMs Trust Their Own Revisions? A Risk-Aware Study of Intrinsic Self-Correction
- Title(参考訳): LLMはいつリビジョンを信頼すべきなのか : 内在的自己補正のリスク意識調査
- Abstract要約: 内在的な自己訂正は、新たな外部証拠を受け取らずに、言語モデルに自身の回答を改訂するよう要求する。
第2のパスはミスを回復できるが、すでに正しい回答を覆すこともできる。
このトレードオフを,BoolQ,GSM8K,Corr2Cause上で29個のオープンウェイトLLMに対して検討した。
- 参考スコア(独自算出の注目度): 29.91953104203498
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Intrinsic self-correction asks a language model to revise its own answer without receiving new external evidence. A second pass can recover mistakes, but it can also overturn answers that were already correct. We study this trade-off across 29 open-weight LLMs on BoolQ, GSM8K, and Corr2Cause by tracking correctness transitions between initial and revised answers. Aggregate accuracy can conceal substantially different revision behavior: for example, Llama-3.1-8B improves by 25.5 percentage points on GSM8K, while refinement changes 19.1% of initially correct answers into wrong ones. A controlled BoolQ study further shows that refinement prompts shift the balance between recovery and harm. We then compare three runtime choices: keeping the initial answer, always accepting the revision, and selectively invoking revision using signals available after the initial response. The comparison identifies settings where learned gating is useful and others where a simpler unconditional policy performs better. These results suggest treating intrinsic self-correction as a revision policy rather than as a uniformly beneficial second pass, and evaluating it through both the corrections it recovers and the errors it introduces.
- Abstract(参考訳): 内在的な自己訂正は、新たな外部証拠を受け取らずに、言語モデルに自身の回答を改訂するよう要求する。
第2のパスはミスを回復できるが、すでに正しい回答を覆すこともできる。
このトレードオフをBoolQ, GSM8K, Corr2Cause 上の29個のオープンウェイト LLM を用いて検討した。
例えば、Llama-3.1-8B は GSM8K で 25.5 ポイント向上し、改善は最初は正しい回答の 19.1% を間違ったものに変更している。
コントロールされたBoolQ研究により、リカバリと損傷のバランスは改善が促進されることが示された。
次に、初期応答を維持し、常にリビジョンを受け入れ、初期応答後に利用可能な信号を使用してリビジョンを選択的に呼び出すという3つの実行時選択を比較します。
比較では、学習したゲーティングが有用である設定と、より単純な無条件ポリシーがより優れている設定を識別する。
これらの結果から,本態性自己補正は,一様に有利な第2パスとしてではなく,修正方針として扱うこと,回復する修正と導入するエラーの両方を通じて評価すること,などが示唆された。
関連論文リスト
- Return or Revise? Learning When Revision Helps Retrieval-Augmented QA [0.0]
我々は,既存の原案回答を返却するか,回収された証拠を用いて修正するかを判断する。
オフラインのトレーニングと評価では、返却されたドラフトと候補のリビジョンの両方を格付けする。
我々は、このペア効果をその回復可能性と呼び、修正前に予測するようにポリシーを訓練します。
論文 参考訳(メタデータ) (2026-09-24T16:35:54Z) - RecurSE: Bounded Recursive Self-Evaluation for LLM Rubric Judges [48.831446371402414]
RecurSEは、訓練可能な裁判官と同期されたポリシーコピーチェッカーをペアにして、裁判官のメタルーブリックに対する推論を監査し、スカラープロセスの報酬を提供する。
本稿では,RecurSEが医療,ペアワイド,要約,プロフェッショナルベンチマークにおいて一貫した一般化を実現していることを示す。
論文 参考訳(メタデータ) (2026-08-25T08:35:04Z) - SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute [62.3458279176813]
自己検証リファインメント(Self-Verifying Refinement)は、オラクルフリーのマルチターン強化学習フレームワークである。
自己検証を計算制御ポリシとして使用することを学ぶ。
マクロ平均精度は0.563で、平均で2.99回しか推測できない。
論文 参考訳(メタデータ) (2026-07-30T16:20:58Z) - Reflective Recovery: A Self-Supervised Method for Reasoning by Learning from Mistakes [70.64622557376505]
リフレクティブリカバリは、推論中のミスを認識し、修正するようにモデルに教える。
AIME 2025では30.0%から37.5%、Minervaでは37.6%から47.8%に精度が向上している。
論文 参考訳(メタデータ) (2026-07-24T02:51:42Z) - When Does Learning to Stop Help? A Cost-Aware Study of Early Exits in Reasoning Models [4.8190992438931035]
LearnStopは、プレフィックスオブザーバブルな機能の上に隠された状態のないロジスティックストッパーである。
学習は、答えが振動し、正しさの証拠が広がる場所を給与する。
コスト計算は、KVキャッシュでトークンを32%節約するのと同じ方針で、ブラックボックスの繰り返しプリフィルで121%余分なコストがかかる。
論文 参考訳(メタデータ) (2026-06-29T19:33:42Z) - Easier to Mislead Than to Correct: Harmful and Beneficial Revision in LLM Conformity [1.4889674786265437]
ピア合意は、当初間違ったモデルを修正するよりも、最初に正しいモデルを誤解させるのがずっと簡単であることを示す。
これらの結果から,マルチエージェントLLMシステムは単に集約するのではなく,ピア回答を検証すべきであることが示唆された。
論文 参考訳(メタデータ) (2026-06-01T03:42:00Z) - Beyond Reasoning: Reinforcement Learning Unlocks Parametric Knowledge in LLMs [59.62441340813425]
我々は、強化学習がパラメトリック知識の直接的リコールを改善するかどうかを検討する。
3つのモデルファミリと複数の事実QAベンチマークで、RLの平均相対利得は27%である。
機械的には、RLは主に新しい事実を得るのではなく、既存の知識の確率質量を再分配する。
論文 参考訳(メタデータ) (2026-05-08T02:40:12Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty [59.97939500426759]
本稿ではRLCRについて述べる。RLCRは精度と信頼性を共同で向上する推論モデルを訓練する手法である。
多様なデータセット間で、RLCRは精度を損なうことなくキャリブレーションを大幅に改善することを示す。
また,言語的信頼度をテスト時に活用し,精度とキャリブレーションを向上させることも実証した。
論文 参考訳(メタデータ) (2025-07-22T17:56:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。