論文の概要: AuditCoder: Responsibility-Preserving Task Graphs for Auditable Code Generation and Bounded Repair
- arxiv url: http://arxiv.org/abs/2607.29529v1
- Date: Fri, 31 Jul 2026 15:29:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 14:29:40.781013
- Title: AuditCoder: Responsibility-Preserving Task Graphs for Auditable Code Generation and Bounded Repair
- Title(参考訳): AuditCoder: 監査可能なコード生成と境界修正のための責任保持タスクグラフ
- Abstract要約: AuditCoderは、プログラムと監査可能な構成トレースを共同出力として扱う。
安定で局所的なテスト可能な境界を持つタスクの場合、グラフは分解構造だけでなく、検証と修復のための永続的なインデックスとしても機能する。
- 参考スコア(独自算出の注目度): 2.2743778085578437
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Code generators return programs, but typically do not preserve the construction record needed to connect a failure to the decision that produced the affected code or to delimit a justified repair. We present AuditCoder, which treats the program and an auditable construction trace as joint outputs. Before code generation, a contract-annotated task graph assigns stable responsibility identities that remain attached to each commitment, its owned implementation, provenance, validation evidence, and intervention history. When validation fails, a conservative locator maps heterogeneous evidence to a node or dependency branch---or abstains---and bounded repair regenerates only that region while reusing the frozen complement. On APPS, \method{} reaches $82.5$--$83.0\%$ \texttt{pass@1}, recovering much of the loss caused by unrepaired graph decomposition but trailing AgentCoder by $7.5$--$8.5$ points. On ClassEval, it reaches $75.0$--$82.0\%$, outperforming CoT + retry while remaining below AgentCoder. A separate audit of 200 APPS records yields $0.9725$ task-macro decision--code trace coverage; the locator identifies an evidence-supported node or branch for 26 of 60 failures, and 17 of those localized repairs pass. For tasks with stable, locally testable boundaries, the graph functions not only as a decomposition structure but also as a persistent index for validation and repair.
- Abstract(参考訳): コードジェネレータはプログラムを返却するが、典型的には、損傷したコードを生成する決定や、正当化された修復を省略するために必要な建設記録を保存しない。
本稿では,プログラムと監査可能な構成トレースを共同出力として扱うAuditCoderを提案する。
コード生成の前に、契約アノテートされたタスクグラフは、各コミットメント、その所有する実装、証明、バリデーションエビデンス、介入履歴にアタッチされた安定した責任アイデンティティを割り当てます。
検証が失敗すると、保守的なロケータが不均一なエビデンスをノードや依存関係のブランチにマッピングします。
APPSでは、 \method{} が 82.5$-$83.0\%$ \texttt{pass@1} に達する。
ClassEvalでは75.0$--82.0\%$に到達し、AgentCoderの下にある間にCoT + retryを上回ります。
200APPSレコードの別の監査では、0.9725$のタスクマクロ決定-コードトレースカバレッジが得られ、ロケータは60の障害のうち26のエビデンスサポートされたノードまたはブランチを特定し、17の局所的な修復がパスする。
安定で局所的なテスト可能な境界を持つタスクの場合、グラフは分解構造だけでなく、検証と修復のための永続的なインデックスとしても機能する。
関連論文リスト
- Assurance Envelopes for Autonomous Coding Agents: Minimum-Cost Evidence for Software Change [0.0]
利用可能な証拠の少なくともコストの低いサブセットが要求された資産を再確立するかどうかを問う。
私たちは、クロージャを信頼するのではなく、クロージャによってすべての選択を検証する。
Rust、IronBlocks、Pongの結果の小さなグラフは、最小エンベロープがタスクに依存することを示している。
論文 参考訳(メタデータ) (2026-09-14T20:06:46Z) - Recoverability as a System Primitive for Long-Horizon AI Agents [5.008310199603767]
再利用を明示的な決定とするシステムプリミティブとして,リカバリビリティを導入する。
4つの決定論的ファイルと20のペアファイルの課題は、正確な復元と完了が許可されていない開始点を隠蔽できることを示している。
論文 参考訳(メタデータ) (2026-09-12T02:54:33Z) - Guardrailed Meta-Agent Loops: Stress-Testing Policy Pinning, Budget Bounds, and Crash Recovery [7.414694666903067]
GuardrailLoopはシミュレーションベースのテストベッドで、3つの運用契約を共同でテスト可能にする。
ハッシュピン付ポリシーは、目標、スコープ、評価アイデンティティ、予算、リリース条件を修正します。
有用な適応、状態回復、反復実行を分離する。
論文 参考訳(メタデータ) (2026-09-10T21:22:08Z) - SWE-Gate: Passing Functional Tests Is Not Enough for Software Engineering Agents [63.65682461568621]
ソフトウェアエンジニアリングエージェントのためのリポジトリレベルのベンチマークであるSWE-Gateを導入し、機能的正当性とともにレビュー制約コンプライアンスを明示的に評価する。
SWE-Gateは、実際のプルリクエストレビューコメントからレビュー制約を導き、これらの制約に関するリポジトリレベルの修復インスタンスを合成する。
各インスタンスは、非準拠およびゴールドパッチとともに、機能テストと制約テストの分離を提供し、イシュー解決能力とレビュー制約コンプライアンスの明確な分離を可能にする。
論文 参考訳(メタデータ) (2026-09-03T17:53:34Z) - Independent Patch Verification for Coding Agents with a Bidirectional Reconstruct-and-Verify Framework [49.16055123488827]
大規模言語モデルを利用したコーディングエージェントは、バグレポートから直接コードパッチを生成することができる。
報告された問題を真に解決するかどうかを独立に検証するメカニズムは存在しない。
本稿では,RETRACE をトレーニング不要なポストジェネレーション検証フレームワークとして提案する。
論文 参考訳(メタデータ) (2026-08-09T22:59:13Z) - Change2Task: From Repository Changes to Executable Coding Agent Tasks and Environments [46.958911818255565]
Change2Taskは、統合されたプルリクエストを、同じリポジトリの健全なモダンなリビジョンに関する検証されたタスクに変換する。
歴史的証拠を進化したコードと整合させ、パッチリバーサル、コードマッピング、エージェント再構築を通じてタスク状態を再構築する。
本システムは,バグフィックス,機能追加,テスト生成,アプリケーションプログラミングインタフェースのマイグレーション,セキュリティ修復という,広く普及している5つのプログラミングエージェントタスクファミリを通じて評価する。
論文 参考訳(メタデータ) (2026-07-30T17:44:31Z) - Beyond Fail-to-Pass: Iterative Hardening of Co-Generated Bug Reproduction Tests and Fixes [55.114939648705395]
大規模言語モデル(LLM)は、現実のバグに対して、プログラムの自動修正をますます実用的にしている。
バグ再現テスト(BRT)は、バグレポートを実行可能なバグ固有の信号に変換することで、このギャップを埋めるのに役立つ。
本稿では,ループ内収束基準としてLax信号を用いるコジェネレーションフレームワークであるCoHardenを提案する。
論文 参考訳(メタデータ) (2026-07-22T07:30:07Z) - One Rewrite to Fix Them All? Type-Aware Repair Allocation for Text-to-Image Prompt Optimization [59.164665622252016]
テキスト・トゥ・イメージ(T2I)ジェネレータは、間違ったカウント、スワップされた属性、あいまいな関係、不可解なテキストを生成し、そのプロンプトに忠実に従わないことが多い。
Prompt最適化は、ユーザプロンプトを書き換えて、ジェネレータの再トレーニングを必要としないことで、このような障害を修復する。
失敗する各命題は、結果のローカル制約が1つの実行可能なプロンプトにコンパイルされる前に、タイプ条件の修復演算子にルーティングされる。
論文 参考訳(メタデータ) (2026-07-21T05:31:43Z) - Fantastic Adaptive Taxonomies and How to Use Them [100.20614173157708]
AdaMASTは、実行トレースをコンパクトでエビデンスに基づく障害分類に変換する。
コードには手書きのコードはなく、人間による注釈もない。
エージェント・システム・サーチでは、失敗候補の分類コード診断が自由形式より優れている。
論文 参考訳(メタデータ) (2026-07-17T17:41:16Z) - Characterizing and Bridging the Diagnostic Gap in eBPF Verifier Rejections [5.3302893005312955]
eBPFにより、開発者はLinuxカーネル内でカスタムプログラムを実行できる。
検証者がプログラムを拒否すると、不確実なエラーにより修復が困難になる。
証明が確立された場所と,検証ログから失われていた場所を再構築するbpfixを提案する。
論文 参考訳(メタデータ) (2026-07-02T20:33:32Z) - Handoff Debt: The Rediscovery Cost When Coding Agents Take Over Interrupted Tasks [0.0]
他のエージェントやエンジニアが残した部分的な状態からタスクを中断し、再割り当てし、レビューし、再開するからです。
前任者の作業が不透明あるいは不完全である場合に課される再検討コスト。
我々の乗っ取りプロトコルは、決定論的ハンドオフポイントで符号化エージェントを中断し、リポジトリを凍結し、4つのハンドオフビューで後継エージェントを評価する。
論文 参考訳(メタデータ) (2026-06-01T20:40:38Z) - ContraFix: Agentic Vulnerability Repair via Differential Runtime Evidence and Skill Reuse [10.503895811137095]
大規模言語モデル(LLM)エージェントは、自動脆弱性修復にますます利用されている。
最近の実証的な結果は、これらのエージェントがいまだに現実世界の脆弱性と戦っていることを示している。
ContraFixは、再利用可能な修復スキルとランタイムエビデンスを結合するエージェントフレームワークである。
論文 参考訳(メタデータ) (2026-05-17T13:48:25Z) - ANNEAL: Adapting LLM Agents via Governed Symbolic Patch Learning [12.44509691077682]
本稿では,繰り返し発生する障害をプロセス知識グラフのシンボル編集に変換する神経シンボルエージェントであるANNEALを紹介する。
その中核となるメカニズムであるFDKA(Failure-Driven Knowledge Acquisition)は、責任のあるオペレータをローカライズし、制約付きLLM生成を通じて型付きパッチを合成し、提案を検証する。
4つのドメインと27のマルチシードランをまたいだANNEALは、永続的な構造修復を行う唯一の評価システムである。
論文 参考訳(メタデータ) (2026-05-04T05:24:03Z) - IMPACT-CYCLE: A Contract-Based Multi-Agent System for Claim-Level Supervisory Correction of Long-Video Semantic Memory [73.22944697933603]
既存のパイプラインは不透明でエンドツーエンドの出力を生成し、検査の中間状態は公開しない。
IMPACT-Cycleは,マルチモーダル反復クレームレベルのメンテナンスとして,長時間ビデオ理解を再構築するマルチエージェントシステムである。
論文 参考訳(メタデータ) (2026-04-22T03:03:33Z) - SlopCodeBench: Benchmarking How Coding Agents Degrade Over Long-Horizon Iterative Tasks [55.76734816061826]
我々は20の問題と93のチェックポイントからなる言語に依存しないベンチマークであるSlopCodeBenchを紹介する。
我々は、冗長性、重複コードの割合、構造的侵食という2つの軌道レベルの品質信号を追跡する。
11モデルにまたがるエンドツーエンドの問題を解決するエージェントは存在しない。
論文 参考訳(メタデータ) (2026-03-25T19:26:44Z) - Agentproof: Static Verification of Agent Workflow Graphs [0.0]
エージェントフレームワークは、ツール使用の振る舞いを明示的なワークフローグラフとしてエンコードする傾向にある。
本稿では,4つの主要なエージェントフレームワークから統合抽象グラフモデルを自動的に抽出するAgentproofを提案する。
汎用的なモデルチェッカーとは異なり、Agentproofは手動モデリングを必要としない。
論文 参考訳(メタデータ) (2026-03-20T13:56:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。