論文の概要: Verify, Repair, Repeat, or Stop? Robust Stopping for Noisy Verify-Repair Loops in LLM Agents
- arxiv url: http://arxiv.org/abs/2607.17641v1
- Date: Mon, 20 Jul 2026 07:52:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.540251
- Title: Verify, Repair, Repeat, or Stop? Robust Stopping for Noisy Verify-Repair Loops in LLM Agents
- Title(参考訳): LLM剤のノイズ除去ループに対するロバスト停止, 修復, リピート, 停止の検証
- Authors: Yitao Wu, Si Shen, Rui Yang, Hong Peng, Bin Hu,
- Abstract要約: ノイズの多い検証・再試行ループのための頑健な停止フレームワークであるVRR-Stopを提案する。
VRR-Stopは、固定された5ラウンドの修理で0.72回の修理ラウンドの平均コストで60.6ポイントの真の有効性を向上する。
- 参考スコア(独自算出の注目度): 8.346035588810516
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Verify-repair loops are a standard means for large language model (LLM) agents to correct faulty plans in code generation, mathematical reasoning, and tool use. When both the verifier and the repairer are noisy, repair can damage already-correct plans, and reported acceptance keeps rising while true validity falls, so existing methods lack a principled basis for deciding when repair should stop. We propose VRR-Stop, a robust stopping framework for noisy verify-repair-repeat (VRR) loops. A four-parameter noise model separates verifier false acceptance and false rejection from the repair and damage behavior of the repairer. Belief filtering turns repeated verification votes into an estimate of committed validity, and the loop commits or repairs according to the sign of the true marginal gain, which requires only sign identifiability rather than accurate recovery of all parameters. When verifier discrimination approaches zero, calibration itself fails and estimation error can flip the stopping sign, so we pair VRR-Stop with VRR-Guard, an estimation-free fallback that replaces the incumbent candidate only under a sufficient verification margin. On a GSM8K stress setting, VRR-Stop improves final true validity by 60.6 percentage points over fixed five-round repair at an average cost of 0.72 repair rounds. Across settings, stopping reliability is governed jointly by verifier discrimination and the decision margin rather than by the absolute size of estimation error.
- Abstract(参考訳): Verify-repairループは、コード生成、数学的推論、ツール使用における欠陥計画を修正するために、大規模言語モデル(LLM)エージェントの標準的な手段である。
検証者と修理者の両方が騒々しい場合には、修理が既に正しい計画にダメージを与え、真の有効性が低下している間、報告された受理率が上昇し続けるので、既存の方法では、修理がいつ停止するかを決めるための原則的な根拠が欠如している。
本稿では,VRRループに対する頑健な停止フレームワークであるVRR-Stopを提案する。
4パラメータノイズモデルにより、補修器の修理・損傷挙動から検証器の偽受け入れと偽拒絶を分離する。
信条フィルタリングは、繰り返し検証された投票をコミットされた妥当性の見積に変え、ループは真の限界ゲインの兆候に従ってコミットまたは修復する。
検証器の識別がゼロに近づくと、キャリブレーション自体が失敗し、推定誤差が停止符号を反転させることができるので、VRR-StopとVRR-Guardをペアリングする。
GSM8Kのストレス設定では、VRR-Stopは、固定された5ラウンドの修理において平均0.72回の修理ラウンドで60.6ポイントの最終的な真の有効性を向上させる。
設定全体において、信頼性の停止は、推定誤差の絶対サイズよりも、検証者判別と判定マージンによって共同で管理される。
関連論文リスト
- Characterizing and Bridging the Diagnostic Gap in eBPF Verifier Rejections [5.3302893005312955]
eBPFにより、開発者はLinuxカーネル内でカスタムプログラムを実行できる。
検証者がプログラムを拒否すると、不確実なエラーにより修復が困難になる。
証明が確立された場所と,検証ログから失われていた場所を再構築するbpfixを提案する。
論文 参考訳(メタデータ) (2026-07-02T20:33:32Z) - Denoising Iterative Self-Correction: Structured Verification Loops for Reliable LLM Reasoning [5.634990956257954]
大規模言語モデルでは、流動的だがしばしば誤った多段階推論が生成され、単純補正法は、既に正しい答えを劣化させるリスクがある。
Denoising Iterative Self-Correction (DISC) は、検証された質問の出力を、解の破損箇所のノイズ測定として扱うテストタイムプロシージャである。
二分判定ゲートは、検証器と修正器が共に修理誤差を補う間、既に正しい答えを損なうような書き直しをブロックすることで補正精度を制御する。
論文 参考訳(メタデータ) (2026-06-19T20:23:14Z) - Repair Before Veto: Repair-Augmented Constraint Learning for Contextual Decisions [6.016090674751934]
我々は、既知の修理作業者をセマンティクスに引き上げる文脈決定フレームワークである修復制約学習(RACL)を導入する。
候補者は、手頃な修理が十分に実現可能で好まれる場合に受け入れられる。そうでなければ、システムは構造化された拒絶債権を返却し、適用すれば、修理計画を立てる。
制御されたDB1B由来のベンチマークで、RACLは意図した信用と修復構造を回復する。
論文 参考訳(メタデータ) (2026-06-01T14:38:04Z) - Conformal Certification of Reasoning Trace Prefixes [30.432255322700126]
CROP(Conformal Reasoning Output Prefixes)は,クリーンアノテート認証のためのバリデーション非依存の校正手順である。
CROPをオーバー・アンド・アンダー・ホールドし、有効な中間的推論を保ち、下流の補修精度を向上させることを実証する。
論文 参考訳(メタデータ) (2026-05-28T15:31:42Z) - Guarded Repair for Harm-Aware Post-hoc Replacement of LLM Mathematical Reasoning [0.0]
GuardedRepairは、キャッシュされた推論トレースを診断し、修正を選択的にトリガーし、答えを変える候補を受け入れる、最高のN修復フレームワークである。
GuardedRepairは、固定/壊れたトレードオフを大幅に改善すると同時に、削除されるよりも、置き換えのリスクが低減されることを示す。
論文 参考訳(メタデータ) (2026-05-23T14:51:13Z) - IMPACT-CYCLE: A Contract-Based Multi-Agent System for Claim-Level Supervisory Correction of Long-Video Semantic Memory [73.22944697933603]
既存のパイプラインは不透明でエンドツーエンドの出力を生成し、検査の中間状態は公開しない。
IMPACT-Cycleは,マルチモーダル反復クレームレベルのメンテナンスとして,長時間ビデオ理解を再構築するマルチエージェントシステムである。
論文 参考訳(メタデータ) (2026-04-22T03:03:33Z) - Outcome-Conditioned Reasoning Distillation for Resolving Software Issues [49.16055123488827]
本稿では, 検証済みパッチを監督として, リポジトリ内問題を解決したO-CRD(Outcome-Conditioned Reasoning Distillation)フレームワークを提案する。
歴史的修正から始まり、検証結果から段階的な修理トレースを後方に再構築する。
SWE-Bench Liteでは、GPT-4oではPass@1が10.4%、DeepSeek-V3では8.6%、GPT-5では10.3%増加する。
論文 参考訳(メタデータ) (2026-01-30T18:25:39Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - Specification-Guided Repair of Arithmetic Errors in Dafny Programs using LLMs [79.74676890436174]
本稿では,障害の局所化と修復のためのオラクルとして形式仕様を用いたDafny用のAPRツールを提案する。
プログラム内の各ステートメントの状態を決定するために、Hoareロジックの使用を含む一連のステップを通じて、障害をローカライズします。
また, GPT-4o miniが74.18%と高い修理成功率を示した。
論文 参考訳(メタデータ) (2025-07-04T15:36:12Z) - Latent Veracity Inference for Identifying Errors in Stepwise Reasoning [78.29317733206643]
本稿では、精度割当てに対する離散探索アルゴリズムであるVeracity Search(VS)を紹介する。
その他の方法では、後続の精度値よりも後続の分布において難解な推論を行う。
VSを一般化し、新しいコンテキストで正確なゼロショットの精度推論を可能にする。
論文 参考訳(メタデータ) (2025-05-17T04:16:36Z) - Error Correction by Paying Attention to Both Acoustic and Confidence References for Automatic Speech Recognition [52.624909026294105]
本稿では,非自己回帰型音声誤り訂正法を提案する。
信頼モジュールは、N-best ASR仮説の各単語の不確実性を測定する。
提案方式は,ASRモデルと比較して誤差率を21%削減する。
論文 参考訳(メタデータ) (2024-06-29T17:56:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。