論文の概要: Independent Patch Verification for Coding Agents with a Bidirectional Reconstruct-and-Verify Framework
- arxiv url: http://arxiv.org/abs/2608.08950v1
- Date: Sun, 09 Aug 2026 22:59:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.002576
- Title: Independent Patch Verification for Coding Agents with a Bidirectional Reconstruct-and-Verify Framework
- Title(参考訳): 双方向再構成・検証フレームワークを用いた符号化エージェントの独立パッチ検証
- Authors: Chenglin Li, Yisen Xu, Zehao Wang, Shin Hwei Tan, Tse-Hsun, Chen,
- Abstract要約: 大規模言語モデルを利用したコーディングエージェントは、バグレポートから直接コードパッチを生成することができる。
報告された問題を真に解決するかどうかを独立に検証するメカニズムは存在しない。
本稿では,RETRACE をトレーニング不要なポストジェネレーション検証フレームワークとして提案する。
- 参考スコア(独自算出の注目度): 49.16055123488827
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Autonomous coding agents powered by large language models can now generate code patches directly from bug reports, but a fundamental gap remains: once a patch is produced, no mechanism independently verifies whether it truly resolves the reported problem. Prior work has sought to address this through iterative self-refinement and inference-time scaling, but these approaches either review the patch under the same interpretation that produced it or broaden candidate generation without verifying individual patches, and neither provides an explicit verification signal for assessing patch correctness. We propose RETRACE, a training-free post-generation verification framework that derives such a signal through bidirectional reconstruction and reconciliation. When a coding agent generates a candidate patch for an issue, RETRACE performs forward reconstruction to build an explicit repair rationale from the issue and the agent's trajectory; backward reconstruction then independently infers, from the patch and its trajectory alone and without access to the original issue, a description of the problem the patch appears to address, and compares this reconstruction against the original issue to produce an alignment verdict; a reconciliation stage then checks the consistency between the forward rationale and the patch, diagnoses the source of any misalignment, and either submits the patch or produces targeted revision guidance. Evaluated on SWE-bench Verified with two backbones (GPT-5-mini and MiniMax-2.5), RETRACE lifts Pass@1 by 7.0% and 3.6% respectively on the mini-SWE-agent scaffold, and delivers comparable gains on OpenHands without modification. Ablation experiments show that both the forward and backward stages contribute to the overall improvement and that adding reconciliation yields further gains.
- Abstract(参考訳): 大規模な言語モデルを活用した自動コーディングエージェントは、バグレポートから直接コードパッチを生成することができるようになったが、根本的なギャップは残る。
以前の研究は、反復的な自己修正と推論時間スケーリングによってこの問題に対処しようとしたが、これらのアプローチはパッチを作成したのと同じ解釈でレビューするか、個別のパッチを検証することなく候補生成を拡張するかのいずれかであり、パッチの正しさを評価するための明示的な検証信号も提供していない。
本稿では、双方向の再構築と和解を通じてこのようなシグナルを導出する、トレーニング不要なポストジェネレーション検証フレームワークRETRACEを提案する。
コーディングエージェントが問題の候補パッチを生成すると、RETRACEは前方再構築を行い、問題とエージェントの軌跡から明示的な修復合理性を構築する。その後、後方再構築は、パッチとその軌跡のみから、元の問題にアクセスせずに独立して推測し、パッチが対応しているように見える問題について記述し、この再構成を元の問題と比較してアライメントの判定を生成する。
SWE-bench Verified with two backbones (GPT-5-mini and MiniMax-2.5), RETRACE lifts Pass@1 by 7.0% and 3.6% in the mini-SWE-agent scaffold, and delivers comparable gains on OpenHands without modified。
アブレーション実験は、前方と後方の両方の段階が全体的な改善に寄与し、和解を追加することでさらに利益が得られることを示した。
関連論文リスト
- Claim Plane: Enforceable Change Intents and Dynamic Scope for Parallel Coding Agents [1.4721615285883427]
本稿では,同時ソフトウェア変更をプリライト入力問題として扱うモデルに依存しない協調アーキテクチャであるClim Planeを提案する。
決定論的制御プレーンは、互換性のある意図をアトミックに認め、宣言された領域に同ファイルの並列性を制約し、未解決の重複をシリアライズし、依存性の無効性を追跡し、曖昧な権限で閉じる。
最初に試みられた突然変異は、現在のアクティブセットに対するアトミックスコープの促進と再許可を引き起こす。
論文 参考訳(メタデータ) (2026-07-24T02:30:50Z) - AuditWeave: A Tamper-Evident, Auditor-Navigable Evidence Layer for AI-Assisted and Data-Transformation Workflows [0.0]
AuditWeaveは、AIアシストとデータ変換のステップを1つのハッシュチェーンの台帳に記録する軽量Pythonライブラリである。
本稿では,参照実装におけるオーバヘッド,拡張性,タンパー検出の正確さを設計し,評価する。
論文 参考訳(メタデータ) (2026-06-14T21:46:04Z) - EviACT: An Evidence-to-Action Framework for Agentic Program Repair [21.78498442884825]
EviACTは、3つのエビデンス駆動ガードレールを修復段階にわたって調整するエージェントAPRフレームワークである。
最強の報告されたベースラインよりも1.6-6.0ポイントのリゾルバ率を改善する。
ベースラインコストが利用可能なバグ毎のAPIコストは70.1-88.6%低下している。
論文 参考訳(メタデータ) (2026-05-26T16:17:47Z) - ContraFix: Agentic Vulnerability Repair via Differential Runtime Evidence and Skill Reuse [10.503895811137095]
大規模言語モデル(LLM)エージェントは、自動脆弱性修復にますます利用されている。
最近の実証的な結果は、これらのエージェントがいまだに現実世界の脆弱性と戦っていることを示している。
ContraFixは、再利用可能な修復スキルとランタイムエビデンスを結合するエージェントフレームワークである。
論文 参考訳(メタデータ) (2026-05-17T13:48:25Z) - IMPACT-CYCLE: A Contract-Based Multi-Agent System for Claim-Level Supervisory Correction of Long-Video Semantic Memory [73.22944697933603]
既存のパイプラインは不透明でエンドツーエンドの出力を生成し、検査の中間状態は公開しない。
IMPACT-Cycleは,マルチモーダル反復クレームレベルのメンテナンスとして,長時間ビデオ理解を再構築するマルチエージェントシステムである。
論文 参考訳(メタデータ) (2026-04-22T03:03:33Z) - Beyond Crash-to-Patch: Patch Evolution for Linux Kernel Repair [2.267311896805228]
Linuxカーネルの修正は、受け入れ前にメーリングリストの反復的なリビジョンが行われ、レビュアーからのフィードバックが正確さ、ハンドリング、APIコンプライアンスを形作る。
6946 syzbot-linked bug-fix cyclesを再構築し,カーネルパッチの進化に関する大規模な研究を行った。
我々は、検索ベースのメモリと微調整された診断アドバイザを統合する修復フレームワークであるPatchAdvisorを開発し、コードエージェントをレビュアー対応パッチへ誘導する。
論文 参考訳(メタデータ) (2026-04-04T20:23:32Z) - Outcome-Conditioned Reasoning Distillation for Resolving Software Issues [49.16055123488827]
本稿では, 検証済みパッチを監督として, リポジトリ内問題を解決したO-CRD(Outcome-Conditioned Reasoning Distillation)フレームワークを提案する。
歴史的修正から始まり、検証結果から段階的な修理トレースを後方に再構築する。
SWE-Bench Liteでは、GPT-4oではPass@1が10.4%、DeepSeek-V3では8.6%、GPT-5では10.3%増加する。
論文 参考訳(メタデータ) (2026-01-30T18:25:39Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - Metacognitive Self-Correction for Multi-Agent System via Prototype-Guided Next-Execution Reconstruction [58.51530390018909]
大規模言語モデルに基づくマルチエージェントシステムは、協調的な問題解決において優れているが、エラーのカスケードには脆弱である。
我々は,MASにリアルタイム,教師なし,ステップレベルの誤り検出と自己補正を付与するメタ認知フレームワークMASCを提案する。
論文 参考訳(メタデータ) (2025-10-16T05:35:37Z) - RAP-Gen: Retrieval-Augmented Patch Generation with CodeT5 for Automatic
Program Repair [75.40584530380589]
新たな検索型パッチ生成フレームワーク(RAP-Gen)を提案する。
RAP-Gen 以前のバグ修正ペアのリストから取得した関連する修正パターンを明示的に活用する。
RAP-GenをJavaScriptのTFixベンチマークとJavaのCode RefinementとDefects4Jベンチマークの2つのプログラミング言語で評価する。
論文 参考訳(メタデータ) (2023-09-12T08:52:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。