論文の概要: Failure as a Process: An Anatomy of CLI Coding Agent Trajectories
- arxiv url: http://arxiv.org/abs/2607.09510v1
- Date: Fri, 10 Jul 2026 15:25:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 14:47:12.882803
- Title: Failure as a Process: An Anatomy of CLI Coding Agent Trajectories
- Title(参考訳): プロセスとしての失敗:CLIコーディングエージェントの軌道の解剖
- Abstract要約: 大規模言語モデル(LLM)コーディングエージェントは、端末ベースの環境でソフトウェアエンジニアリングタスクを自律的に実行するために、ますます多くデプロイされている。
既存の実証研究は、なぜコーディングエージェントが失敗するのかを調査するが、失敗を一時的なプロセスではなく最終的な結果として扱う。
本稿では、CLIコーディングエージェント障害軌跡に関する大規模な実証的研究を行い、プロセス指向のフレームワークを導入し、実行軌跡をまたいだ障害の開始、進化、回復を解析した。
- 参考スコア(独自算出の注目度): 21.513740407266354
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language model (LLM) coding agents are increasingly deployed to autonomously perform software engineering tasks in terminal-based environments, making their reliability a growing concern. Existing empirical studies investigate why coding agents fail, yet they largely treat failure as a final outcome rather than a temporal process, providing limited insight into how failures emerge, evolve, and become unrecoverable. We present the first large-scale empirical study of CLI coding-agent failure trajectories, introducing a process-oriented framework that analyzes failure through its onset, evolution, and recovery across execution trajectories. We first collect 3,843 execution trajectories generated by seven frontier models across three coding-agent scaffolds (OpenHands, MiniSWE, and Terminus2) on Terminal-Bench, then carefully filter them to obtain 1,794 complete and valid trajectories for manual annotation (over 63,000 execution steps), from which we derive 14 findings spanning failure occurrence, root causes, recovery, and cross-system consistency. Our findings show that coding-agent failures are predominantly driven by epistemic errors, typically begin within the first few execution steps, and often remain hidden until recovery is no longer possible, suggesting that improving coding-agent reliability requires earlier validation and intervention rather than relying solely on final-outcome evaluation.
- Abstract(参考訳): 大規模言語モデル(LLM)コーディングエージェントは、端末ベースの環境でソフトウェアエンジニアリングタスクを自律的に実行するために、ますますデプロイされ、信頼性が懸念されるようになっている。
既存の実証的研究は、なぜコーディングエージェントが失敗するのかを調査するが、彼らは失敗を一時的なプロセスではなく最終結果として扱う。
本稿では、CLIコーディングエージェント障害軌跡に関する大規模な実証的研究を行い、プロセス指向のフレームワークを導入し、実行軌跡をまたいだ障害の開始、進化、回復を解析した。
まず,3つのコーディングアジェント足場(OpenHands, MiniSWE, Terminus2)にまたがる7つのフロンティアモデル(OpenHands, MiniSWE, Terminus2)で生成された3,843個の実行トラジェクトリを収集し,手作業によるアノテーション(63,000以上の実行ステップ)の完全かつ有効な1,794個のトラジェクトリを慎重にフィルタし,障害発生,根本原因,回復,システム間の一貫性に関する14の知見を導出する。
以上の結果から, コーディングエージェントの信頼性向上には, ファイナルアウトカム評価にのみ依存するのではなく, 早期の検証と介入が必要であることが示唆された。
関連論文リスト
- HarnessEvolve: Learning from Reference Trajectories for Reliable Agent Self-Evolution [11.431479238875712]
我々は、信頼できるエージェントの自己進化を実現するために、参照軌道から学習する自己進化フレームワークであるHarnessEvolveを紹介する。
私たちは、さまざまなモデルとエージェントフレームワークを使用して、オープンドメインとエンタープライズシナリオにまたがるいくつかのベンチマークで広範な実験を行います。
結果は、HarnessEvolveがすべてのベンチマークと設定で、最先端のベースラインを一貫して上回っていることを示している。
論文 参考訳(メタデータ) (2026-09-01T07:31:18Z) - FailForge: Distilling Procedural Competence from Persistent Failures into Code Agents [49.519184792774304]
FailForgeは、失敗したロールアウトをトレーニングシグナルに変換するエージェントフレームワークである。
FailForgeは、これまで失敗したインスタンスの26%を、限界的な追加コストでリカバリする。
論文 参考訳(メタデータ) (2026-08-09T08:22:57Z) - TRAJDEBUG: Tracing Error Lifecycle to Identify Critical Failures in Long-Horizon Agent Trajectories [48.638067300108276]
臨界エラー検出は、最終失敗の原因となる軌道上の最初期のエラーステップを見つけることを目的としている。
長い軌道は、ステップを判断する証拠は遠方の指示、観察、事前の文脈に散らばっているため、個々のエラーを特定するのを困難にしている。
長距離エラー検出に対処するエラーライフサイクルトレースフレームワークであるTraj Debugを提案する。
論文 参考訳(メタデータ) (2026-08-06T17:51:20Z) - TrajAudit: Automated Failure Diagnosis for Agentic Coding Systems [18.833806809109536]
エージェントシステムは、バグ修正などのソフトウェアエンジニアリングジョブを自動化するために広く研究されている。
既存の自動故障診断アプローチはタスク実行軌跡を活用するが、その効果は軌道長と複雑性の増加とともに低下する。
リポジトリレベルのコーディングタスクには、冗長なプログラム構造や冗長なコードコンテキストなど、トラジェクトリにはノイズが伴っている。
我々は,リポジトリレベルのコーディングトラジェクトリのための最初の障害診断フレームワークであるTrajAuditを提案する。
論文 参考訳(メタデータ) (2026-05-26T05:24:37Z) - Claw-Eval: Toward Trustworthy Evaluation of Autonomous Agents [66.97968363332465]
エージェントベンチマークの3つのギャップに対処するエンドツーエンド評価スイートであるClaw-Evalを紹介した。
Claw-Evalは3つのグループにまたがる9つのカテゴリにまたがる300の人間検証タスクで構成されている。
すべてのエージェントアクションは、3つの独立したエビデンスチャネルを通じて記録される。
論文 参考訳(メタデータ) (2026-04-07T17:43:18Z) - TRAJEVAL: Decomposing Code Agent Trajectories for Fine-Grained Diagnosis [23.834704102474927]
コードエージェントはGitHubの問題を解決することができるが、失敗した場合、現在の評価は場所や理由を可視化しない。
本稿では,エージェントトラジェクトリを3つの解釈段階に分解する診断フレームワークTRAJEVALを紹介する。
我々はこれらの診断が予測可能であることを確認し、0.87-2.1% MAEでモデルレベルのPass@1予測を達成する。
論文 参考訳(メタデータ) (2026-03-25T05:27:03Z) - AgentProcessBench: Diagnosing Step-Level Process Quality in Tool-Using Agents [50.481033105867205]
我々はAgentProcessBenchを紹介した。AgentProcessBenchは、現実的なツール拡張トラジェクトリにおけるステップレベルの有効性を評価するための最初のベンチマークである。
ベンチマークは、1,000の多様な軌跡と8,509の人間ラベル付きステップアノテーションと89.1%のアノテーション間合意で構成されている。
探索をキャプチャする3つのラベリングスキームと、ラベルのあいまいさを減らすためのエラー伝搬ルールを備えている。
論文 参考訳(メタデータ) (2026-03-15T16:13:58Z) - TraceCoder: A Trace-Driven Multi-Agent Framework for Automated Debugging of LLM-Generated Code [11.207330722400764]
人間の観察・分析・修復過程をエミュレートするフレームワークであるTraceCoderを提案する。
このフレームワークはまずコードを診断プローブで測定し、粒度の細かいランタイムトレースをキャプチャする。
その後、これらのトレースについて因果解析を行い、失敗の根本原因を正確に特定する。
論文 参考訳(メタデータ) (2026-02-06T16:59:48Z) - DoVer: Intervention-Driven Auto Debugging for LLM Multi-Agent Systems [48.971606069204825]
DoVerは、大規模言語モデル(LLM)ベースのマルチエージェントシステムのための介入駆動デバッグフレームワークである。
ターゲットの介入を通じて、アクティブな検証によって仮説生成を増強する。
DoVerは失敗試験の18~28%を成功させ、最大16%のマイルストーンを達成し、失敗仮説の30~60%を検証または否定する。
論文 参考訳(メタデータ) (2025-12-07T09:23:48Z) - Understanding Code Agent Behaviour: An Empirical Study of Success and Failure Trajectories [10.751728274263536]
本稿では,エージェントのトラジェクトリ,すなわちソフトウェア問題の解決に際し,エージェントが行うステップを捉えた実行トレースについて,実証的研究を行う。
我々は、SWE-Benchベンチマークで、最先端の3つのコードエージェント(OpenHands、SWE-agent、Prometheus)の軌跡を分析し、成功と失敗の両方について検討した。
論文 参考訳(メタデータ) (2025-10-31T18:58:13Z) - Metacognitive Self-Correction for Multi-Agent System via Prototype-Guided Next-Execution Reconstruction [58.51530390018909]
大規模言語モデルに基づくマルチエージェントシステムは、協調的な問題解決において優れているが、エラーのカスケードには脆弱である。
我々は,MASにリアルタイム,教師なし,ステップレベルの誤り検出と自己補正を付与するメタ認知フレームワークMASCを提案する。
論文 参考訳(メタデータ) (2025-10-16T05:35:37Z) - An Empirical Study on Failures in Automated Issue Solving [12.571536148821144]
我々は,SWE-Bench-Verifiedの自動問題解決タスクにおいて,パイプラインベースとエージェントアーキテクチャの両方にまたがる3つのSOTAツールの性能と効率を分析する。
ハイレベルなパフォーマンス指標から根本原因分析に移行するために,150件の障害事例の体系的手動分析を行った。
その結果、2つのアーキテクチャパラダイムの間には明確な失敗の指紋が明らかとなり、ほとんどのエージェント的失敗は、欠陥のある推論と認知的デッドロックに起因する。
論文 参考訳(メタデータ) (2025-09-17T13:07:52Z) - Which Agent Causes Task Failures and When? On Automated Failure Attribution of LLM Multi-Agent Systems [50.29939179830491]
LLMマルチエージェントシステムにおける障害帰属は、まだ調査が過小評価されており、労働集約的である。
本稿では,3つの自動故障帰属手法の開発と評価を行い,その欠点と欠点を要約する。
最良の方法は、障害に応答するエージェントを特定する際に53.5%の精度を達成するが、故障の特定には14.2%しか役に立たない。
論文 参考訳(メタデータ) (2025-04-30T23:09:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。