論文の概要: Coding Agents as Test-Suite Auditors: Finding What Official Suites Miss While Approaching What They Catch
- arxiv url: http://arxiv.org/abs/2608.01715v1
- Date: Mon, 03 Aug 2026 05:24:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.333988
- Title: Coding Agents as Test-Suite Auditors: Finding What Official Suites Miss While Approaching What They Catch
- Title(参考訳): テストスパイトオーディタとしてのコーディングエージェント - マッチするものに近づく際に、オフィシャルスイートに何が欠けているかを見つける
- Abstract要約: テストスイート監査官として機能する市販のコーディングエージェントは、どちらも、公式スイートが見逃すものを公開するために、敵対的なテストスイートを構築します。
認証チェーンは、各エージェントフラッグされた申請が、公式の裁判官に頼らずに、真にバグだらけであるか否かを判定する。
Codeforceは、利用可能なオフィシャルスイートを持たない問題に対して、同じテストビルディングメソッドを使用して、テストされた入力予算毎に5つの再生ベースラインを導出する。
- 参考スコア(独自算出の注目度): 47.836680625916266
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Online-judge verdicts and the datasets and benchmarks built on them are treated as ground truth for evaluating and training large language models for code. Yet prior audits have sounded a warning: official suites accept buggy submissions. These audits, however, stop at the warning and offer no practical remedy. Our remedy has two parts: an off-the-shelf coding agent, serving as a test-suite auditor, both builds adversarial test suites to expose what official suites miss and supplies these suites where no official suite exists; a certification chain determines whether each agent-flagged submission is genuinely buggy without relying on the official judge: multiple independently written accepted solutions agree on the expected output for every test, brute-force solutions settle disagreements, and a per-problem validator certifies each failing input legal. One such agent identifies 589 verified accepted-but-buggy submissions among AtCoder's 20,375 audited accepted submissions; extending the same certification to all five agents yields a union floor of 906 such submissions. Five agents, scored separately, each stay within 1.7pp of official-suite coverage on logic bugs those suites catch. On post-cutoff Codeforces problems with no available official suites, the same test-building method leads all five reproduced baselines at every tested input budget. Where an official suite exists, the agent audits suite adequacy instead of assuming it; where none exists, agent suites catch the most buggy submissions among methods we reproduced and tested.
- Abstract(参考訳): オンラインの判断とそれらの上に構築されたデータセットとベンチマークは、コードのための大きな言語モデルを評価し、訓練するための基礎的な真実として扱われる。
公式のスイートはバグだらけの投稿を受け付けている。
しかし、これらの監査は警告に立ち止まり、実用的な対策を提供しない。
我々の救済策には2つの部分がある: テストスーツの監査役を務めるオフ・ザ・シェルフのコーディングエージェント 両者は、公式スイートが欠落したことを公開し、公式スイートが存在しないこれらのスイートを供給するための敵対的なテストスイートを構築する; 認証チェーンは、各エージェントがフラッグした申請が、公式の判断に頼らず、真にバグが多いかどうかを判断する。
あるエージェントは、AtCoderが監査した20,375件のうち、589件が承認されたが、バグがあると確認し、同じ認証を5件すべてに拡張すると、906件の組合のフロアが得られる。
5人のエージェントが別々に得点し、それぞれがスイートがキャッチするロジックバグに関する公式のスーツカバーの1.7pp以内に留まる。
Codeforceは、利用可能なオフィシャルスイートを持たない問題に対して、同じテストビルディングメソッドを使用して、テストされた入力予算毎に5つの再生ベースラインを導出する。
公式スイートが存在する場合、エージェントはそれを仮定せずにスイートを監査します。
関連論文リスト
- SaltBench: A Referee-Gated Protocol for Measuring Method Effects in Machine-Checked Software Work [0.0]
SaltBenchは1つの質問に対するベンチマークプロトコルである。 マシンレフェリーは、コーディングエージェントの動作方法をどのように変えますか?
本研究では,ベンチマークの対象がシート'であり,標準ハーネスにおけるエージェントセッションを意味する。
私たちは5つのシステムコンポーネントをテストしました。いずれもRustで記述されたVerusツールチェーンの下で,それぞれがレフェリーとして使用可能なテストスイートを使用しています。
論文 参考訳(メタデータ) (2026-09-10T04:32:43Z) - ExecCritic: Learn to Test, Test to Improve for Coding Agents [68.42713285082912]
実行時のフィードバックは、コーディングエージェントを正しいリポジトリの修復に導くことができますが、テストが問題によって要求された振る舞いをキャプチャした場合のみです。
ExecCriticを導入し、テスト-検証-修正足場と、その中のトレーニングエージェントのためのロール固有の強化学習レシピを組み合わせる。
テストエージェントが独立してリポジトリネイティブなテストを生成し、フェイルクローズされたハーネスがそれらを調整して凍結し、リカバリエージェントがテストを変更することなく、ソースコードを実行フィードバックから修正する。
論文 参考訳(メタデータ) (2026-09-08T17:53:37Z) - Grounding AI Agents in Contracts: An Empirical Evaluation of Spec-Driven Test Generation [4.061618191574875]
仕様駆動テスト生成(Spec-Driven Test Generation)は、エージェントに対して、コード事前条件、事後条件、未定義の振る舞いについて-および明示的に文書化するように指示する。
この中間半形式仕様は、その後のテスト生成を導くための認知的足場として機能する。
論文 参考訳(メタデータ) (2026-08-17T22:36:12Z) - A First Look at Coding Agents' Compliance with AI Contribution Rules in Open-Source Communities [13.02344624749338]
オープンソースリポジトリにおけるコーディングエージェントの現実ルールコンプライアンスを推定する。
我々の実験では、今日のエージェントはほとんど積極的に貢献規則を回収しないことが示されている。
この状況は、検証と開示の問題が既存のメカニズムで解決可能であることを示している。
論文 参考訳(メタデータ) (2026-07-29T12:14:17Z) - Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction [57.138342889101345]
Tencent WorkBuddy Benchは、コーディングエージェントのためのマルチドメイン評価スイートである。
本報告では, 設計手法, スコアリングプロトコル, クロスモデルリーダーボードについて述べる。
論文 参考訳(メタデータ) (2026-07-23T04:34:06Z) - Fantastic Adaptive Taxonomies and How to Use Them [100.20614173157708]
AdaMASTは、実行トレースをコンパクトでエビデンスに基づく障害分類に変換する。
コードには手書きのコードはなく、人間による注釈もない。
エージェント・システム・サーチでは、失敗候補の分類コード診断が自由形式より優れている。
論文 参考訳(メタデータ) (2026-07-17T17:41:16Z) - The Prover Is the Judge: Verified Security Software from AI Coding Agents in Ada/SPARK [0.0]
検証者主導のループにおいて、AIエージェントは古典的および後量子暗号、TLS 1.3、IKEv2、X.509、マトリックスクライアントにまたがるAda/SPARKのベアメタルセキュリティソフトウェアを書いて検証した。
GNATproveは49,280の証明義務を解除し、選択されたプリミティブに対して機能的正当性を確立し、残りのプリミティブに対して実行時のエラーがないことを証明した。
それぞれのレイヤが障害をキャッチし,中心的な教訓を引き出す方法を報告します。エージェントが確立するために信頼できるものは,そのフィードバックの強さに縛られているのです。
論文 参考訳(メタデータ) (2026-07-15T20:09:05Z) - Auditing the Audit: Five Failure Modes in Benchmark-Validity Audits [0.30586855806896046]
パイプライン障害を5つのクラスに分類し、安全ベンチマークとオープンウェイトなインストラクションチューニングモデルによる自己監査を行った。
我々は、ゲートを保証グレードの証拠の保持および開示のプロトコルとして位置づけ、古典的な構成正当性証拠を補足する(置き換えるものではない)。
論文 参考訳(メタデータ) (2026-07-01T05:30:07Z) - Bayesian control for coding agents [63.64172141184361]
本稿では,コーディングエージェントのためのコスト依存型シーケンシャル仮説テストフレームワークを提案する。
ベイズ管制官は、正確性に対する信念を維持し、より多くの証拠を集め、候補者を精査し、検証し、停止するかを決定する。
本研究では, 信頼状態が, 不確実性定量化のためのトークン確率と生ツール・サクセスベースラインを上回り, 解釈可能な正当性スコアを得ることを示す。
論文 参考訳(メタデータ) (2026-06-23T11:41:32Z) - AgentBeats: Agentifying Agent Assessment for Openness, Standardization, and Reproducibility [104.46861849039357]
エージェントシステムはドメイン間で急速に進歩しているが、その評価は断片化されている。
根本的問題は、オープンでエージェントに依存しないアセスメントインタフェースがないことである。
我々は、審査員が評価を行い、すべての参加者が標準化されたプロトコルを介して対話するエージェントエージェントアセスメント(AAA)を提唱する。
論文 参考訳(メタデータ) (2026-06-11T17:23:54Z) - Iterative Audit Convergence in LLM-Managed Multi-Agent Systems: A Case Study in Prompt Engineering Quality Assurance [0.0]
AEGISに適用されたエージェント駆動型監査の単一システム事例研究を報告する。
本報告では, 明示的な符号規則, 非単調な収束, 監査スコープの拡がりを含む7カテゴリーの欠陥分類を報告する。
論文 参考訳(メタデータ) (2026-05-12T15:39:04Z) - BenchGuard: Who Guards the Benchmarks? Automated Auditing of LLM Agent Benchmarks [26.58983143152204]
BenchGuardはタスク指向、実行ベースのエージェントベンチマークのための最初の自動監査フレームワークである。
それは、ScienceAgentBenchの12の著者確認問題と、BIXBench Verified-50サブセットのエキスパート特定問題の83.3%を特定している。
USD 15の50の複雑なバイオインフォマティクスタスクの完全な監査により、自動ベンチマーク監査は人間によるレビューの実践的で価値のある補完となる。
論文 参考訳(メタデータ) (2026-04-27T19:51:25Z) - VulAgent: Hypothesis-Validation based Multi-Agent Vulnerability Detection [55.957275374847484]
VulAgentは仮説検証に基づくマルチエージェント脆弱性検出フレームワークである。
セマンティクスに敏感なマルチビュー検出パイプラインを実装しており、それぞれが特定の分析の観点から一致している。
平均して、VulAgentは全体的な精度を6.6%改善し、脆弱性のある固定されたコードペアの正確な識別率を最大450%向上させ、偽陽性率を約36%削減する。
論文 参考訳(メタデータ) (2025-09-15T02:25:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。