論文の概要: SCATE: Learning to Supervise Coding Agents for Cost-Effective Test Generation
- arxiv url: http://arxiv.org/abs/2607.08983v1
- Date: Thu, 09 Jul 2026 23:13:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 14:47:12.754207
- Title: SCATE: Learning to Supervise Coding Agents for Cost-Effective Test Generation
- Title(参考訳): SCATE:コスト効果テスト生成のためのコーディングエージェントの指導
- Authors: Sijia Gu, Noor Nashid, Ali Mesbah,
- Abstract要約: SCATEは、コーディングエージェントの適応的で自動化された監視のためのフレームワークである。
現在のカバレッジとクラステスト容易性メトリクスに基づいて、最も有望なテストアクションを選択することを学ぶ。
32.3%のラインカバレッジ、30.9%のブランチカバレッジをエージェントのみのベースラインよりも達成している。
- 参考スコア(独自算出の注目度): 3.511540973608371
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: While autonomous coding agents have significantly advanced automated test generation, they remain fundamentally limited by lazy generation, a phenomenon where agents prematurely terminate tasks and systematically avoid complex programmatic logic, resulting in inadequate code coverage. Currently, mitigating this premature termination requires continuous human-in-the-loop supervision. This heavy reliance on human intuition creates a bottleneck that negates the efficiency gains of automated generation. We propose SCATE, a framework for adaptive, automated supervision of coding agents that replaces human intervention during test generation. By formulating supervision as a contextual bandit problem, SCATE learns to select the most promising testing actions based on the current coverage and class testability metrics, maximizing coverage gains while minimizing wasted generation effort. Our empirical evaluation demonstrates that SCATE integrates seamlessly with different coding agents. When applied to GEMINI-CLI, it achieves 32.3% higher line coverage and 30.9% higher branch coverage than the agent-only baseline. A comparison with CLAUDE CODE confirms the framework dynamically adapts its policy to optimize each agent's unique strengths. SCATE also consistently outperforms state-of-the-art non-agentic approaches across all metrics.
- Abstract(参考訳): 自律的なコーディングエージェントは、かなり高度な自動テスト生成を持っているが、それらは基本的に遅延生成によって制限されている。
現在、この早期終了を緩和するには、継続した人道監視が必要である。
この人間の直感への強い依存は、自動生成の効率向上を否定するボトルネックを生み出します。
テスト生成時の人間の介入を代替する,コーディングエージェントの適応的かつ自動的な監視を行うフレームワークであるSCATEを提案する。
SCATEは、コンテキスト的盗聴問題として監督を定式化することによって、現在のカバレッジとクラステスト容易性メトリクスに基づいて、最も有望なテストアクションを選択することを学び、無駄な生成作業を最小化しながら、カバレッジゲインを最大化する。
私たちの経験的評価は、SCATEが異なるコーディングエージェントとシームレスに統合できることを示しています。
GEMINI-CLIに適用すると、32.3%のラインカバレッジと30.9%のブランチカバレッジを達成する。
CLAUDE CODEとの比較により、フレームワークは各エージェントのユニークな強みを最適化するために、そのポリシーを動的に適用することを確認した。
SCATEはまた、すべてのメトリクスで最先端の非アジェンティックアプローチを一貫して上回ります。
関連論文リスト
- Perception, Verdict, and Evolution: Hindsight-Driven Self-Refining Forensics Agent for AI-Generated Image Detection [80.15317858033534]
ForeAgentは、反復的な自己進化を伴うAI生成画像検出のためのエージェント法医学フレームワークである。
ForeAgentはChameleonベンチマークで最先端のパフォーマンスを達成し、精度は82.18%に達した。
ForeAgent は GPT-5 や GPT-5-mini と比較して、より一貫性があり、因果的な推論をもたらす。
論文 参考訳(メタデータ) (2026-06-25T02:59:33Z) - The Meta-Agent Challenge: Are Current Agents Capable of Autonomous Agent Development? [80.24951682268332]
本稿では,自律エージェント開発のためのフロンティアモデルのキャパシティをテストするための評価フレームワークであるMeta-Agent Challenge(MAC)を紹介する。
評価の整合性を確保するため、このフレームワークは報奨ハッキングに対する多層防御によって確保される。
メタエージェントは人間工学的な基本方針とほとんど一致せず、その一部はプロプライエタリなフロンティアモデルに支配されている。
論文 参考訳(メタデータ) (2026-06-03T04:58:17Z) - Towards a Virtual Neuroscientist: Autonomous Neuroimaging Analysis via Multi-Agent Collaboration [53.772014300855375]
我々は,自律型エンドツーエンド神経画像解析のためのマルチエージェントシステムであるNIAgentを紹介する。
従来のフラットなツール呼び出しエージェントとは異なり、NIAgentはコード中心の実行パラダイムを採用している。
本稿では,コホートレベルの検定とエージェント視覚検査を組み合わせた,自律的品質管理のための階層的検証フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-10T06:30:19Z) - ACE: Self-Evolving LLM Coding Framework via Adversarial Unit Test Generation and Preference Optimization [28.464748466548965]
ACEは、ソルバ・アドバイザリーアーキテクチャに基づく自己進化型コード生成フレームワークである。
実行中心の監視を通じて、アクティブな障害発見を優先する。
ACEは強いソルバよりも一貫して優れています。
論文 参考訳(メタデータ) (2026-04-17T07:20:01Z) - CovAgent: Overcoming the 30% Curse of Mobile Application Coverage with Agentic AI and Dynamic Instrumentation [10.80010959571188]
CovAgentは、AndroidアプリのUIテストを強化するためのエージェントAIを使った新しいアプローチである。
我々のフレームワークは、最先端のLLMDroidよりもテストカバレッジが大幅に向上する。
CovAgentはクラス、メソッド、ラインカバレッジなど、他のメトリクスのベースラインよりも優れています。
論文 参考訳(メタデータ) (2026-01-29T04:21:11Z) - The Rise of Agentic Testing: Multi-Agent Systems for Robust Software Quality Assurance [0.0]
現在のAIベースのテストジェネレータは、実行意識のフィードバックがないため、無効、冗長、あるいは実行不可能なテストを生成する。
本稿では,テスト生成エージェント,実行・分析エージェント,レビュー・最適化エージェントが協調してテストの生成,実行,解析,精査を行う,クローズドループの自己修正システムを提案する。
論文 参考訳(メタデータ) (2026-01-05T18:20:14Z) - Stop Wasting Your Tokens: Towards Efficient Runtime Multi-Agent Systems [11.42175340352007]
SupervisorAgentは、ランタイムと適応的な監視のための軽量でモジュール化されたフレームワークです。
SupervisorAgentは、エラーを積極的に修正し、非効率な振る舞いを誘導し、観察を浄化するために、臨界点に介入する。
挑戦的なGAIAベンチマークでは、SupervisorAgentは成功率を損なうことなく、Smolagentフレームワークのトークン消費を平均29.45%削減した。
論文 参考訳(メタデータ) (2025-10-30T15:12:59Z) - Alita-G: Self-Evolving Generative Agent for Agent Generation [54.49365835457433]
汎用エージェントをドメインエキスパートに変換するフレームワークであるALITA-Gを提案する。
このフレームワークでは、ジェネラリストエージェントが対象ドメインタスクのキュレートされたスイートを実行する。
計算コストを削減しながら、大きな利益を得ることができます。
論文 参考訳(メタデータ) (2025-10-27T17:59:14Z) - AegisLLM: Scaling Agentic Systems for Self-Reflective Defense in LLM Security [74.22452069013289]
AegisLLMは、敵の攻撃や情報漏洩に対する協調的なマルチエージェント防御である。
テスト時のエージェント推論システムのスケーリングは,モデルの有用性を損なうことなく,ロバスト性を大幅に向上させることを示す。
アンラーニングやジェイルブレイクを含む主要な脅威シナリオに対する総合的な評価は、AegisLLMの有効性を示している。
論文 参考訳(メタデータ) (2025-04-29T17:36:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。