論文の概要: Looping Is Not Reliability: State-Bound Evidence and Typed Revision Contracts for Agentic Code Repair
- arxiv url: http://arxiv.org/abs/2607.24604v1
- Date: Mon, 27 Jul 2026 16:05:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.505241
- Title: Looping Is Not Reliability: State-Bound Evidence and Typed Revision Contracts for Agentic Code Repair
- Title(参考訳): ループは信頼性に欠ける - エージェントコード修復のためのステートバウンドエビデンスと型付きリビジョン契約
- Authors: Xueping Gao, Jianwei Yang, Qiang Yang,
- Abstract要約: 正しいパッチの発見と保持、検証、提出のギャップについて検討する。
我々はエビデンスバウンド型ループ契約を導出し、その機械的に強制可能なサブセットを参照実装でインスタンス化する。
- 参考スコア(独自算出の注目度): 36.56438114281786
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Generate--test--revise loops are common in coding agents, but repetition alone provides no reliability guarantee. We study the gap between finding a correct patch and retaining, verifying, and submitting it. A sealed five-seed study over 30 HumanEval repairs produces 900 three-revision trajectories. Under forced revision, current correctness with current traces falls from 0.820 after one revision to 0.673 after two, although ever-correct rises to 0.847. Two common-state studies use 2,430 branches from identical frozen programs to remove post-treatment risk-set bias. In a prespecified 14B replication, stale traces harm 34/135 correct starts versus 4/135 with current traces, a 22.2-point increase (task-cluster 95\% CI $[8.9,37.0]$, exact Holm $p=0.0337$). A prospective 540-rollout policy eliminates observed correct-start harm but reduces wrong-start repair and fails its joint criterion. Repository experiments over 24 bugs and four coder stacks expose floor effects and component heterogeneity without Holm-significant effects. We therefore separate admission, preservation, grounded certification, competence, and liveness. We derive an evidence-bound typed loop contract and instantiate its mechanically enforceable subset in a reference implementation that binds verifier evidence to exact code states, preserves verified checkpoints, and emits auditable admission receipts. The implementation is an executable specification and conformance artifact, not evidence of improved repair competence or calibrated verifier dependence.
- Abstract(参考訳): 生成--テスト-修正ループはコーディングエージェントでは一般的なものだが、繰り返しだけは信頼性を保証するものではない。
正しいパッチの発見と保持、検証、提出のギャップについて検討する。
30件以上のHumanEval修復を封印した5シードの研究では、900件の3段階の軌道が作成されている。
強制的な修正では、現在の痕跡の現在の正しさは、1修正後の0.820から2修正後の0.673に低下するが、常に0.847に上昇する。
2つの共通状態の研究は、同じ凍結プログラムから2,430の枝を使って、治療後のリスクセットバイアスを取り除く。
予め規定された14Bレプリケーションでは、ステールトレースは34/135の正しいスタートと4/135の現在のトレース、22.2ポイントの増加(タスククラスタ95\% CI $[8.9,37.0]$、正確なHolm $p=0.0337$)を損なう。
予想される540ロールアウトポリシーは、観測された修正開始障害を除去するが、誤スタート修理を減らし、共同基準を満たさない。
24のバグと4つのコーダスタックにまたがるリポジトリ実験では、フロア効果とコンポーネントの不均一性がホルムに重要な効果を伴わない。
したがって、我々は受け入れ、保護、根拠付き認定、能力、生活を分離する。
我々はエビデンスバウンド型ループ契約を導出し、その機械的に強制可能なサブセットを参照実装でインスタンス化し、検証対象のエビデンスを正確なコード状態にバインドし、検証済みのチェックポイントを保持し、監査可能なレシートを出力する。
この実装は実行可能な仕様と適合品であり、補修能力の向上や校正検証器依存の証拠ではない。
関連論文リスト
- DualityCert: Verifier-Gated Language-Model Repair of Broken Duality Claims in Quantum Field Theory [0.0]
ここでは、4次元N=1 quiverゲージ理論におけるゼーベルグ双対主張の記号的検証器である DualityCert を提案する。
パスするクレームは一貫性証明書を受け取り、テストされた矛盾は見つからず、二重性は証明されない。
我々は、言語モデルエージェントの修復環境として検証器を使用し、故意に壊れたクレームを受け取り、それが認証されるまでそれを編集しなければならない。
論文 参考訳(メタデータ) (2026-07-26T11:39:49Z) - Fantastic Adaptive Taxonomies and How to Use Them [100.20614173157708]
AdaMASTは、実行トレースをコンパクトでエビデンスに基づく障害分類に変換する。
コードには手書きのコードはなく、人間による注釈もない。
エージェント・システム・サーチでは、失敗候補の分類コード診断が自由形式より優れている。
論文 参考訳(メタデータ) (2026-07-17T17:41:16Z) - Proof-or-Stop: Don't Trust the Agent, Trust the Evidence -- Loop Engineering for Verifiable Evidence-Gated Lifecycle Control [5.796499740822509]
本稿では, プロフ・オ・ストップライフサイクル・コントロールについて紹介する。
これは、新しい、追跡されたソースベースで機械的に検証可能な証拠が関連するゲートを満たす場合にのみ、ライフサイクルの遷移を可能にする。
我々は, 機構試験, パワードコントロール・ポリシー・アブレーション, セルフアプリケーション・エビデンスによるオープンソース実装の評価を行った。
論文 参考訳(メタデータ) (2026-07-16T12:06:21Z) - Structured Feedback Improves Repair in an LLM Agent Loop [2.8890052855500143]
LLMエージェントは、外部から候補を拒否した後で再試行されることが多いが、検証と次のモデル呼び出しの間のインターフェースは未特定のままである。
コード制御エージェントループであるVeriHarnessを導入し、モデルが候補を生成し、外部検証者が受け入れ、予算、トレースを制御する。
生の診断と、失敗位置、観測値、許容可能な代替品を識別するフィードバックを比較します。
論文 参考訳(メタデータ) (2026-07-15T06:14:45Z) - SEVA: Self-Evolving Verification Agent with Process Reward for Fact Attribution [6.908637308550535]
SEVAは、エビデンスアライメント、ステップバイステップの推論チェーン、キャリブレーションされた信頼度、6カテゴリのエラー診断を発行する構造化検証エージェントである。
ClearFacts では、SEVA-3B は GPT-4o-mini (69.0 vs. 69.8 F1) と一致し、よりリッチで監査可能な出力を生成する。
論文 参考訳(メタデータ) (2026-06-29T02:37:13Z) - Code Correctness Signals in LLM Hidden States: Pre-Generation Probing and Repair Geometry [0.0]
モデルのファーストアタプティブコードの正しさは、プロンプト-ファイナル隠れ状態から線形にデオード可能である。
モデルが失敗した最初の試みを修復しようとするケース236では、失敗した試みからその修復への隠れ状態シフトが統計的に検出可能なコントラスト方向をもたらす。
論文 参考訳(メタデータ) (2026-06-12T15:06:15Z) - Converted, Not Equivalent: Benchmarking Codebase Conversion via Observational Equivalence [56.25095230687242]
コーディングエージェントは、しばしば自身のローカル検証ルーチンを過度に信頼し、表面チェックを満たすアーティファクトの成功を宣言する。
この問題は、事前評価が結果駆動である変換において特に深刻である。
ブラインド・コンバージョンは26.7-28.9%に達し、スペック・パスレートは91.1%まで上昇した。
このことは、失敗は限られた予算やバックボーンの強さよりも、契約ミスによる自己検証に起因していることを示唆している。
論文 参考訳(メタデータ) (2026-05-27T19:57:15Z) - Are Benchmark Tests Strong Enough? Mutation-Guided Diagnosis and Augmentation of Regression Suites [49.16055123488827]
十分に強力なテストスイートは、報告された成功率を膨らませながら、妥当だが意味的に正しくないパッチを認めることができる。
STINGは、意味的に変化するプログラムの変種を診断ストレス要因として利用する、ターゲットテスト拡張のためのフレームワークである。
STINGは211インスタンスにまたがる1014の検証テストを生成し、パッチリージョンラインとブランチカバレッジを10.8%、9.5%向上させた。
論文 参考訳(メタデータ) (2026-04-02T01:13:40Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。