論文の概要: Denoising Iterative Self-Correction: Structured Verification Loops for Reliable LLM Reasoning
- arxiv url: http://arxiv.org/abs/2606.21724v1
- Date: Fri, 19 Jun 2026 20:23:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 03:47:48.625879
- Title: Denoising Iterative Self-Correction: Structured Verification Loops for Reliable LLM Reasoning
- Title(参考訳): 繰り返し自己補正:信頼性LLM推論のための構造化検証ループ
- Authors: Shen Yin, David Ken, Joel Stremmel,
- Abstract要約: 大規模言語モデルでは、流動的だがしばしば誤った多段階推論が生成され、単純補正法は、既に正しい答えを劣化させるリスクがある。
Denoising Iterative Self-Correction (DISC) は、検証された質問の出力を、解の破損箇所のノイズ測定として扱うテストタイムプロシージャである。
二分判定ゲートは、検証器と修正器が共に修理誤差を補う間、既に正しい答えを損なうような書き直しをブロックすることで補正精度を制御する。
- 参考スコア(独自算出の注目度): 5.634990956257954
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Large language models produce fluent but often incorrect multi-step reasoning, and naive correction methods risk degrading already-correct answers. We introduce Denoising Iterative Self-Correction (DISC), a test-time procedure that treats verification question outputs as noisy measurements of where a solution may be corrupted. Using these signals, DISC progressively reduces errors across multiple verify-judge-correct passes, analogous to traditional iterative denoising. A binary judgment gate controls correction precision by blocking rewrites that would damage already-correct answers while the verifier and corrector together repair errors. We evaluate this trade-off using two paired diagnostics: an improvement-to-degradation ratio (precision) and a repair rate (recall). Across three benchmarks (BIG-Bench Mistake, HotpotQA, GPQA Diamond) and four models, DISC dominates Chain-of-Verification and Self-Refine on the precision-recall trade-off, reaching 81.6% accuracy with 13x more improvements per degradation than Chain-of-Verification and 5x more than Self-Refine on BIG-Bench Mistake (Sonnet~4.5). On GPQA Diamond, we identify a capability floor below which judges acknowledge contradictions in evidence but cannot translate that recognition into a correction. We further show that cross-model role allocation -- assigning verification and judgment to a model different from the generator -- mitigates self-confirmation bias.
- Abstract(参考訳): 大規模言語モデルでは、流動的だがしばしば誤った多段階推論が生成され、単純補正法は、既に正しい答えを劣化させるリスクがある。
Denoising Iterative Self-Correction (DISC) は、検証された質問の出力を、解の破損箇所のノイズ測定として扱うテストタイムプロシージャである。
これらの信号を用いて、DECは、従来の反復 denoising に類似した、複数の検証ジャッジ正しいパスのエラーを徐々に削減する。
二分判定ゲートは、検証器と修正器が共に修理誤差を補う間、既に正しい答えを損なうような書き直しをブロックすることで補正精度を制御する。
本稿では,このトレードオフを2つの診断手法を用いて評価する。
3つのベンチマーク(BIG-Bench Mistake、HotpotQA、GPQA Diamond)と4つのモデルで、DECはチェイン・オブ・バリフィケーションとセルフ・リファインを、精度は81.6%、チェイン・オブ・バリフィケーションは13倍、自己リファインはBIG-Bench Mistake(Sonnet~4.5)より5倍高い。
GPQAダイアモンドでは,証拠の矛盾を認めつつも,その認識を修正に変換できない機能フロアを以下に同定する。
さらに、検証と判断をジェネレータとは異なるモデルに割り当てるクロスモデルロール割り当ては、自己確認バイアスを軽減することを示す。
関連論文リスト
- Trust but Verify: Prover-Verifier Deliberation for Selective LLM Prediction [4.273094752480624]
本稿では,対話的証明理論に基づく推論時間プロトコルであるPVDを導入する。
PVDは回答と構造化された信頼判定の両方を生成し、システムは不確実なケースを棄却しながら高信頼の回答を報告できる。
論文 参考訳(メタデータ) (2026-05-24T15:23:27Z) - CyberCorrect: A Cybernetic Framework for Closed-Loop Self-Correction in Large Language Models [9.281774217584289]
CyberCorrectは、大規模言語モデルの自己訂正を形式化するフレームワークである。
タイプ指向補正制御器は、診断されたエラーカテゴリに基づいて修理指示を生成する。
収束判定器は、制御理論から適応された安定性基準を用いて繰り返し終了を決定する。
論文 参考訳(メタデータ) (2026-05-17T07:47:34Z) - Knowing but Not Correcting: Routine Task Requests Suppress Factual Correction in LLMs [26.062372963777452]
LLMは、独立して提示された時に確実に偽のクレームを訂正するが、同じクレームがタスク指向のリクエストに埋め込まれている場合、そのクレームは正しいというよりも、従うことが多い。
我々は、この障害モードの誤り訂正を抑え、300の偽の前提のベンチマークを構築し、8つのモデルで体系的に評価する。
抑制率は19%から90%で、4つのモデルが80%を超え、修正抑制が一般的で深刻な現象として確立された。
論文 参考訳(メタデータ) (2026-05-07T10:04:39Z) - Correct Answers from Sound Reasoning: Verifiable Process Supervision for Language Models [94.68358825189738]
本稿では,予測精度と推論品質を協調的に最適化する検証済み領域の学習後フレームワークを提案する。
我々は,エンジン信号に対して推論ステップを確定的に検証できる制御テストベッドであるチェスのVPSを評価する。
VPSは、推論品質を著しく向上させながら精度を保ち、勝利率エラーを最大30%削減し、一貫性をほぼ飽和状態に回復する。
論文 参考訳(メタデータ) (2026-04-03T15:19:46Z) - CoVerRL: Breaking the Consensus Trap in Label-Free Reasoning via Generator-Verifier Co-Evolution [52.691495954442985]
CoVerRLは1つのモデルがジェネレータと検証ロールを交換するフレームワークで、各機能が他方をブートストラップする。
Qwen と Llama のモデルファミリーでの実験では、CoVerRL は数理推論のベンチマークで4.7-5.9% でラベルなしのベースラインを上回っている。
自己検証の精度は55%から85%以上改善され、両方の能力が真に共存することを確認した。
論文 参考訳(メタデータ) (2026-03-18T14:38:55Z) - HLE-Verified: A Systematic Verification and Structured Revision of Humanity's Last Exam [63.84155758655084]
HumanityのLast Exam (HLE)は、フロンティアの大規模言語モデルを評価するために広く使われているベンチマークである。
HLE-Verifiedは,透過的検証プロトコルときめ細かい誤り分類法を備えたHLEの検証および改訂版である。
我々は,HLEとHLE-Verifiedの7つの最先端言語モデルを評価し,平均7~10ポイントの絶対精度を観測した。
論文 参考訳(メタデータ) (2026-02-15T02:50:15Z) - Trusted Uncertainty in Large Language Models: A Unified Framework for Confidence Calibration and Risk-Controlled Refusal [31.458406135473805]
異種不確実性証拠を正当性の校正確率に変換する統一フレームワークUniCRを提案する。
UniCRは、温度スケーリングと適切なスコアリングを備えた軽量なキャリブレーションヘッドを学習する。
ショートフォームQA、実行テスト付きコード生成、検索強化ロングフォームQAの実験は、キャリブレーションメトリクスの一貫性のある改善を示している。
論文 参考訳(メタデータ) (2025-09-01T13:14:58Z) - Latent Veracity Inference for Identifying Errors in Stepwise Reasoning [78.29317733206643]
本稿では、精度割当てに対する離散探索アルゴリズムであるVeracity Search(VS)を紹介する。
その他の方法では、後続の精度値よりも後続の分布において難解な推論を行う。
VSを一般化し、新しいコンテキストで正確なゼロショットの精度推論を可能にする。
論文 参考訳(メタデータ) (2025-05-17T04:16:36Z) - Error Correction by Paying Attention to Both Acoustic and Confidence References for Automatic Speech Recognition [52.624909026294105]
本稿では,非自己回帰型音声誤り訂正法を提案する。
信頼モジュールは、N-best ASR仮説の各単語の不確実性を測定する。
提案方式は,ASRモデルと比較して誤差率を21%削減する。
論文 参考訳(メタデータ) (2024-06-29T17:56:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。