論文の概要: When Agents Implement Systems: A Case Study in Defects, Detection, and Evaluation Rigor
- arxiv url: http://arxiv.org/abs/2609.01985v1
- Date: Wed, 02 Sep 2026 01:43:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 17:53:18.026343
- Title: When Agents Implement Systems: A Case Study in Defects, Detection, and Evaluation Rigor
- Title(参考訳): エージェントがシステムを実装するとき:欠陥, 検出, 評価に関する事例研究
- Abstract要約: 本稿では,既存の詳細な仕様に対するマルチコンポーネントデータシステムを実装するエージェントのケーススタディを提案する。
制約違反と検出方法によって分類された5つの欠陥をカタログ化する。
回収予算は、2994段落のプール型コーパスに対して1~10件、100件で、選抜されたリコールは金段落に限れば3件の予算で天井に達する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/publicdomain/zero/1.0/
- Abstract: As LLM coding agents increasingly perform end-to-end engineering work, we lack empirical characterization of how they behave on systems-level requirements: schema design, async orchestration, configuration correctness, and retrieval-filtering trade-offs. We present a case study of one such agent implementing a multi-component data system against a detailed pre-existing specification. Storage technologies, schema, entity-resolution algorithm, and retrieval-filtering strategy were fixed in advance; the agent autonomy was in the implementation, in diagnosing and fixing defects it introduced, and in interaction-design choices left open. Over a single session, we catalog five such defects, categorized by constraint violated and detection method. We further evaluate, on the public HotpotQA benchmark, the one retrieval trade-off specified in that architecture: restricting candidates to a graph-identified entity set before ranking versus unfiltered search. We substitute the benchmark gold evidence labels for entity identification, since we lacked LLM access to run that stage, and report standard recall rather than the benchmark own accuracy metrics. Across retrieval budgets from 1 to 10 and 100 questions against a pooled corpus of 2994 paragraphs, filtered recall reaches its ceiling by a budget of 3, expected once candidates are restricted to the gold paragraphs themselves, while unfiltered search recovers all required evidence only 69 percent of the time even at a budget of 10, a gap that holds at every budget tested, with sign test p less than 0.0001. We close with a discussion of where the agent autonomy succeeded versus required correction, including one instance where a claimed performance fix was never re-measured on the regression that motivated it.
- Abstract(参考訳): LLMコーディングエージェントがエンドツーエンドのエンジニアリング作業をますます行うようになるにつれて、スキーマ設計、非同期オーケストレーション、設定の正確性、検索-フィルタリングのトレードオフといった、システムレベルの要求に対する動作の実証的な特徴が欠如しています。
本稿では,既存の詳細な仕様に対するマルチコンポーネントデータシステムを実装するエージェントのケーススタディを提案する。
ストレージ技術、スキーマ、エンティティ-レゾリューションアルゴリズム、検索-フィルタリング戦略は、事前に修正されており、エージェントの自律性、導入した欠陥の診断と修正、そしてインタラクション-設計の選択は、未解決のままであった。
1回のセッションで、制約違反と検出方法によって分類された5つの欠陥をカタログ化する。
さらに、公開HotpotQAベンチマークにおいて、そのアーキテクチャで指定された1つの検索トレードオフとして、候補をランク付け前のグラフ識別エンティティに制限する。
我々は、ベンチマークのゴールドエビデンスラベルをエンティティ識別に置き換える。なぜなら、私たちは、そのステージの実行にLLMアクセスが欠如しており、ベンチマーク自身の精度メトリクスではなく、標準リコールを報告しています。
回収予算は、2994段落のプールコーパスに対して1から10、100問までで、選抜されたリコールは、金段落自体に制限された場合に予想される3の予算で天井に到達し、未ろ過された検索では10段落の予算でも必要な証拠の69%しか回収できないが、各予算で保持される差は0.0001未満である。
例えば、要求されたパフォーマンス修正がモチベーションを動機付けるレグレッションに対して再測定されることはない、というケースです。
関連論文リスト
- From Matching Models to Recruiting Agents: A Systematized Narrative Review of AI Recruitment Systems, Evaluation, and Governance [1.436449142247059]
このレビューは、ニューラル・パーソナリティ・マッチングによる双方向の検索と行動ランキングから発展を辿る。
類似性から相互適合性、モデルから複合ワークフロー、オフライン予測からエビデンスと生産性に整合した評価という3つの組み合わせの遷移を分析した。
評価証拠から最強の証明可能なクレームへのステージマッピングと,相互性,エビデンス,時間的制御,選択的,監査可能なシステムに関するアジェンダを導入する。
論文 参考訳(メタデータ) (2026-09-03T08:46:03Z) - Codebook Agent: Amortized Topology Design for LLM Multi-Agent Systems [67.04448659688579]
クエリ非依存の16エントリのコードブックを開発し、上位のデコード候補を1回のバッチフォワードパスでランク付けする。
反復検索がなく、テスト時にメッセージパッシングがないため、Codebook Agentは6つのベンチマークでもっとも正確な方法である。
論文 参考訳(メタデータ) (2026-09-02T08:10:22Z) - FinSAgent: Corpus-Aligned Multi-Agent RAG Framework for Evidence-Grounded SEC Filing Question Answering [16.415865984091667]
FinSAgentはエビデンスベースのマルチエージェントフレームワークで、SECのQA申請をコーパス対応の検索計画として再編成している。
FinSAgentは、強力なシングルエージェントとマルチエージェントのベースラインに対する検索カバレッジと回答の正しさを改善している。
論文 参考訳(メタデータ) (2026-07-20T16:03:15Z) - Fantastic Adaptive Taxonomies and How to Use Them [100.20614173157708]
AdaMASTは、実行トレースをコンパクトでエビデンスに基づく障害分類に変換する。
コードには手書きのコードはなく、人間による注釈もない。
エージェント・システム・サーチでは、失敗候補の分類コード診断が自由形式より優れている。
論文 参考訳(メタデータ) (2026-07-17T17:41:16Z) - Compliance-Scored Best-of-N Guardrail Orchestration for Multimodal Document Generation in Payments Dispute Defense [0.0]
企業文書の大量生成には、財務紛争の物語、コンプライアンス通知、監査要約が含まれる。
統一されたガードレール層の前に、プロダクションシステムはしばしば別々のPIIリアクション、コンテンツモデレーション、フォーマット検証ステップを縫い合わせていた。
本稿では,テキストと画像入力のためのガードレールオーケストレーションレイヤを提案する。
論文 参考訳(メタデータ) (2026-06-01T00:24:30Z) - PJB: A Reasoning-Aware Benchmark for Person-Job Retrieval [21.108322341202815]
パーソン・ジョブマッチングは、明示的な制約を検証し、スキル・トランスファー推論とジョブ・コンピテンシー推論を実行するシステムを必要とする。
既存のベンチマークでは、このタスクの体系的な診断サポートは提供されていない。
PJB(PJB)を導入した。
論文 参考訳(メタデータ) (2026-03-18T06:08:06Z) - Automated Self-Testing as a Quality Gate: Evidence-Driven Release Management for LLM Applications [51.56484100374058]
我々は,エビデンスに基づくリリース決定を伴う品質ゲートを導入する自動自己テストフレームワークを提案する。
内部展開型多エージェント対話型AIシステムの縦型ケーススタディにより,本フレームワークの評価を行った。
論文 参考訳(メタデータ) (2026-03-13T20:44:15Z) - DoVer: Intervention-Driven Auto Debugging for LLM Multi-Agent Systems [48.971606069204825]
DoVerは、大規模言語モデル(LLM)ベースのマルチエージェントシステムのための介入駆動デバッグフレームワークである。
ターゲットの介入を通じて、アクティブな検証によって仮説生成を増強する。
DoVerは失敗試験の18~28%を成功させ、最大16%のマイルストーンを達成し、失敗仮説の30~60%を検証または否定する。
論文 参考訳(メタデータ) (2025-12-07T09:23:48Z) - Rethinking Retrieval: From Traditional Retrieval Augmented Generation to Agentic and Non-Vector Reasoning Systems in the Financial Domain for Large Language Models [0.0]
本稿では,ベクトルベースエージェントRAGをハイブリッド検索とメタデータフィルタリングを用いて比較した最初の体系的評価を行う。
検索指標(MRR, Recall@5), LLM-as-a-judgeのペア比較, レイテンシ, 前処理コストを計測する。
以上の結果から,金融Q&Aシステムに先進的なRAG技術を適用することにより,検索精度,回答品質が向上し,生産における費用対効果のトレードオフが考慮されることが明らかとなった。
論文 参考訳(メタデータ) (2025-11-22T20:06:25Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - COIN: Uncertainty-Guarding Selective Question Answering for Foundation Models with Provable Risk Guarantees [51.5976496056012]
COINは、統計的に有効な閾値を校正し、質問毎に1つの生成された回答をフィルタリングする不確実性保護選択フレームワークである。
COINはキャリブレーションセット上で経験的誤差率を推定し、信頼区間法を適用して真誤差率に高い確率上界を確立する。
リスク管理におけるCOINの堅牢性,許容回答を維持するための強いテストタイムパワー,キャリブレーションデータによる予測効率を実証する。
論文 参考訳(メタデータ) (2025-06-25T07:04:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。