論文の概要: Validation Evidence in LLM Repair Agents: How Much of What Passes Actually Tests the Bug?
- arxiv url: http://arxiv.org/abs/2607.28871v1
- Date: Thu, 30 Jul 2026 22:32:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 14:29:40.495945
- Title: Validation Evidence in LLM Repair Agents: How Much of What Passes Actually Tests the Bug?
- Title(参考訳): LLM修復剤のバリデーション・エビデンス:実際にバグを検査するのはどれくらいか?
- Abstract要約: BSG-VAは、各バリデーションコマンドをその正確な作業ツリー状態にキャプチャし、テストのみのパッチを抽出し、元のバギーコードでコマンドを再生する。
キャプチャされた結果とリプレイ結果は、ゴールドアラインのバグ識別からレグレッションのみ、誤解を招くまで、すべてのイベントにエビデンスの役割を割り当てます。
エージェントにB-replay結果を返すかどうかを3本腕で実験すると、このパターンが変わる。
- 参考スコア(独自算出の注目度): 1.6787220460106658
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: When a repair agent runs a test and sees it pass, the result is treated as evidence about the reported defect. We measure how often that treatment is warranted. BSG-VA (buggy-state/candidate-state/gold-fix validation analysis) captures each validation command at its exact working-tree state, extracts a test-only patch, and replays the command on the original buggy code (B), the candidate state (S), and the developer gold fix (G). The captured outcome and the replay results assign every event an evidence role, from gold-aligned bug-discriminating through regression-only to misleading. Across 3,730 events in 643 rollouts on 110 tasks, 46.0% of positive comparable events carry no bug-discriminating information; 23.8% of baseline rollouts, with no feedback injected, close with a patch whose entire positive evidence base is of this kind. A three-arm experiment tests whether returning the B-replay outcome to the agent changes this pattern. Bug-contrast feedback reduces evidence-inadequate closure by 7.8 percentage points relative to an attention-matched reminder (p = 0.0029) and raises bug-discriminating evidence by 7.4 points (p = 0.011), with no detectable cost to repair success. Both estimates fall below the prespecified 10-percentage-point smallest effect size of interest, so practical magnitude remains uncertain. Roughly a third of the improvement traces to the reminder alone; across two exploratory replications, varying the scaffold and the model, the B-replay content adds a detectable increment only with gpt-5.6-sol under the unconstrained tool-use loop. BSG-VA applies post hoc to any replayable repair trajectory that preserves the required code states and execution environment. Keywords: program repair agents, validation evidence, test adequacy, large language models, software quality, controlled experiment.
- Abstract(参考訳): 修理業者が検査を実行して合格すると、報告された欠陥の証拠として扱われる。
私たちはその治療の頻度を測定します。
BSG-VA (buggy-state/candidate-state/gold-fix validation analysis)は、各バリデーションコマンドをその正確な作業ツリー状態でキャプチャし、テスト専用パッチを抽出し、元のバグギーコード(B)、候補状態(S)、開発者ゴールドフィックス(G)上でコマンドを再生する。
キャプチャされた結果とリプレイ結果は、ゴールドアラインのバグ識別からレグレッションのみ、誤解を招くまで、すべてのイベントにエビデンスの役割を割り当てます。
110のタスクで643回のロールアウトで3,730回のイベントが実施され、46.0%のポジティブなイベントがバグを識別する情報を持っていない。
エージェントにB-replay結果を返すかどうかを3本腕で実験すると、このパターンが変わる。
バグコントラストフィードバックは、アテンションマッチングされたリマインダー(p = 0.0029)と比較して、エビデンス不適切なクロージャを7.8ポイント削減し、バグ識別されたエビデンスを7.4ポイント(p = 0.011)引き上げる。
どちらの推定も、規定されている10パーセントの最小の利子効果サイズを下回っているため、実用的規模は依然として不明である。
改善のおよそ3分の1はリマインダーのみに遡り、足場とモデルの異なる2つの探索的な複製を通して、B-replayコンテンツは、制約のないツール使用ループの下でgpt-5.6-solでのみ検出可能なインクリメントを追加する。
BSG-VAは、必要なコード状態と実行環境を保存する再生可能な修理軌道にポストホックを適用する。
キーワード: プログラム修復エージェント、バリデーションエビデンス、テスト精度、大規模言語モデル、ソフトウェア品質、制御された実験。
関連論文リスト
- Looping Is Not Reliability: State-Bound Evidence and Typed Revision Contracts for Agentic Code Repair [36.56438114281786]
正しいパッチの発見と保持、検証、提出のギャップについて検討する。
我々はエビデンスバウンド型ループ契約を導出し、その機械的に強制可能なサブセットを参照実装でインスタンス化する。
論文 参考訳(メタデータ) (2026-07-27T16:05:23Z) - Beyond Fail-to-Pass: Iterative Hardening of Co-Generated Bug Reproduction Tests and Fixes [55.114939648705395]
大規模言語モデル(LLM)は、現実のバグに対して、プログラムの自動修正をますます実用的にしている。
バグ再現テスト(BRT)は、バグレポートを実行可能なバグ固有の信号に変換することで、このギャップを埋めるのに役立つ。
本稿では,ループ内収束基準としてLax信号を用いるコジェネレーションフレームワークであるCoHardenを提案する。
論文 参考訳(メタデータ) (2026-07-22T07:30:07Z) - AgentDebugX: An Open-Source Toolkit for Failure Observability, Attribution, and Recovery in LLM Agents [83.37969790806069]
LLMエージェントのエラーは、エラーが表面化するステップが原因ではないことが多いため、デバッグが難しい。
Agent DebuggerXはオープンソースのフレームワークで、デバッグをDe Detect, Attribute, Recover, Rerunのクローズドループとして整理する。
コアとなるDeep Debuggerは、グローバルな軌跡理解を通じてマルチターン根本原因診断を行う。
論文 参考訳(メタデータ) (2026-07-21T06:21:13Z) - Fantastic Adaptive Taxonomies and How to Use Them [100.20614173157708]
AdaMASTは、実行トレースをコンパクトでエビデンスに基づく障害分類に変換する。
コードには手書きのコードはなく、人間による注釈もない。
エージェント・システム・サーチでは、失敗候補の分類コード診断が自由形式より優れている。
論文 参考訳(メタデータ) (2026-07-17T17:41:16Z) - Structured Feedback Improves Repair in an LLM Agent Loop [2.8890052855500143]
LLMエージェントは、外部から候補を拒否した後で再試行されることが多いが、検証と次のモデル呼び出しの間のインターフェースは未特定のままである。
コード制御エージェントループであるVeriHarnessを導入し、モデルが候補を生成し、外部検証者が受け入れ、予算、トレースを制御する。
生の診断と、失敗位置、観測値、許容可能な代替品を識別するフィードバックを比較します。
論文 参考訳(メタデータ) (2026-07-15T06:14:45Z) - Auditing Reward Hackability in Code RL Training Environments [0.0]
コードRL環境が誤った解を正しく受け入れる速度を計測する。
SWE-bench Verifiedの49タクのサンプルでは、28.5%のタスクがテストスイートが弱く、Dockerで検証された不正確なパッチがそれらをパスしている。
論文 参考訳(メタデータ) (2026-06-14T23:31:42Z) - Code Correctness Signals in LLM Hidden States: Pre-Generation Probing and Repair Geometry [0.0]
モデルのファーストアタプティブコードの正しさは、プロンプト-ファイナル隠れ状態から線形にデオード可能である。
モデルが失敗した最初の試みを修復しようとするケース236では、失敗した試みからその修復への隠れ状態シフトが統計的に検出可能なコントラスト方向をもたらす。
論文 参考訳(メタデータ) (2026-06-12T15:06:15Z) - EviACT: An Evidence-to-Action Framework for Agentic Program Repair [21.78498442884825]
EviACTは、3つのエビデンス駆動ガードレールを修復段階にわたって調整するエージェントAPRフレームワークである。
最強の報告されたベースラインよりも1.6-6.0ポイントのリゾルバ率を改善する。
ベースラインコストが利用可能なバグ毎のAPIコストは70.1-88.6%低下している。
論文 参考訳(メタデータ) (2026-05-26T16:17:47Z) - Are Benchmark Tests Strong Enough? Mutation-Guided Diagnosis and Augmentation of Regression Suites [49.16055123488827]
十分に強力なテストスイートは、報告された成功率を膨らませながら、妥当だが意味的に正しくないパッチを認めることができる。
STINGは、意味的に変化するプログラムの変種を診断ストレス要因として利用する、ターゲットテスト拡張のためのフレームワークである。
STINGは211インスタンスにまたがる1014の検証テストを生成し、パッチリージョンラインとブランチカバレッジを10.8%、9.5%向上させた。
論文 参考訳(メタデータ) (2026-04-02T01:13:40Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - DoVer: Intervention-Driven Auto Debugging for LLM Multi-Agent Systems [48.971606069204825]
DoVerは、大規模言語モデル(LLM)ベースのマルチエージェントシステムのための介入駆動デバッグフレームワークである。
ターゲットの介入を通じて、アクティブな検証によって仮説生成を増強する。
DoVerは失敗試験の18~28%を成功させ、最大16%のマイルストーンを達成し、失敗仮説の30~60%を検証または否定する。
論文 参考訳(メタデータ) (2025-12-07T09:23:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。