論文の概要: TRAJDEBUG: Tracing Error Lifecycle to Identify Critical Failures in Long-Horizon Agent Trajectories
- arxiv url: http://arxiv.org/abs/2608.06346v1
- Date: Thu, 06 Aug 2026 17:51:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-07 15:25:20.990551
- Title: TRAJDEBUG: Tracing Error Lifecycle to Identify Critical Failures in Long-Horizon Agent Trajectories
- Title(参考訳): TRAJDEBUG:ロング・ホライゾン・エージェント・トラジェクターの臨界故障を識別するためのエラーライフサイクルの追跡
- Abstract要約: 臨界エラー検出は、最終失敗の原因となる軌道上の最初期のエラーステップを見つけることを目的としている。
長い軌道は、ステップを判断する証拠は遠方の指示、観察、事前の文脈に散らばっているため、個々のエラーを特定するのを困難にしている。
長距離エラー検出に対処するエラーライフサイクルトレースフレームワークであるTraj Debugを提案する。
- 参考スコア(独自算出の注目度): 48.638067300108276
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: LLM-based agentic systems have shown remarkable capabilities in complex domains, while suffering from cascading errors and difficulty in debugging. Critical error detection aims to locate the earliest error step in a failed trajectory that is responsible for the final failure. However, progress faces two main challenges. First, long trajectories make it difficult to identify individual errors, since the evidence for judging a step may be scattered across distant instructions, observations, and prior context. Second, failed trajectories often contain multiple local errors with different downstream effects, only some of which remain responsible for the final failure. In this work, we propose TrajDebug, an error-lifecycle tracing framework that addresses long-trajectory error discovery with multi-granularity history compression and evidence-based error identification, and supports critical attribution by tracing each error's resolution status and terminal impact. We further construct TrajErrBench, a benchmark of 486 manually annotated failed trajectories from Tau2Bench and SWE-Bench Pro, covering realistic tool-use and coding scenarios. Experiments across diverse agent benchmarks show that TrajDebug achieves the best overall performance over existing baselines, and application studies further demonstrate that its diagnoses provide actionable feedback for improving downstream agent success. We will release the codes and data to facilitate further research.
- Abstract(参考訳): LLMベースのエージェントシステムは、カスケードエラーやデバッグの困難さに悩まされながら、複雑なドメインにおいて顕著な機能を示した。
臨界エラー検出は、最終失敗の原因となる軌道上の最初期のエラーステップを見つけることを目的としている。
しかし、進歩は2つの大きな課題に直面している。
第一に、長い軌道は、ステップを判断する証拠は遠方の指示、観察、事前の文脈に散らばっているため、個々の誤りを特定するのが難しくなる。
第二に、失敗した軌道はしばしば下流効果の異なる複数の局所誤差を含むが、そのうちのいくつかだけが最終失敗の原因である。
そこで本研究では,TrajDebugを提案する。TrajDebugは,複数粒度履歴の圧縮とエビデンスに基づく誤り識別による長い軌道誤差検出に対処し,各エラーの解決状況と端末への影響をトレースすることで,重要な帰属を支援する。
さらに,TrajErrBenchを,Tau2BenchとSWE-Bench Proから手動でアノテートした486のベンチマークで構築した。
さまざまなエージェントベンチマークによる実験は、TrajDebugが既存のベースラインよりも全体的なパフォーマンスを最高のものにしていることを示している。
さらなる研究を促進するために、コードとデータを公開します。
関連論文リスト
- Leveraging Trajectory Graphs for Pre-Execution Error Diagnosis in Agentic LLM Systems [47.66236392009794]
LLM(Large Language Model)ベースのエージェントは、様々な複雑な対話的タスクにおいて、例外的なパフォーマンスを示す。
textitTrajectory Graph Copilot は LLM エージェントの副操縦士' として機能する新しいフレームワークで,実行前に潜在的な動作エラーを診断する。
論文 参考訳(メタデータ) (2026-07-29T20:14:43Z) - What Resolve Rate Hides: Trajectory Structure Diagnostics for Coding Agents [14.988334585821939]
コーディングエージェントは、ほぼ完全に解決率でランク付けされる。
単一のパス/フェイルラベルは、なぜ実行が失敗したのか、なぜ承認された実行が追加のステップ、時間、トークンを費やしたのかについて何も述べていない。
TraceProbeは、リゾルフレートが隠すものを回復するトラジェクトリに依存しないフレームワークである。
論文 参考訳(メタデータ) (2026-07-07T12:09:46Z) - ExComm: Exploration-Stage Communication for Error-Resilient Agentic Test-Time Scaling [57.42714978834704]
ExCommは、探索段階のエージェントテストタイムスケーリングのための通信プロトコルである。
ExCommは、強いテスト時間スケーリングベースラインを一貫して上回ります。
論文 参考訳(メタデータ) (2026-05-21T07:38:44Z) - Trace2Skill: Verifier-Guided Skill Evolution for Long-Context EDA Agents [0.3733676450456031]
テスト時間スケーリングフレームワークであるTrace2Skillを提案する。
新しいモデルをトレーニングしたり、より多くの候補ソリューションをサンプリングする代わりに、Trace2Skillはエージェントの自然言語スキルを進化可能なポリシーとして扱う。
成功と失敗モードのために繰り返しロールアウトトレースをマイニングし、それらを密集した診断やオラクルのレッスンに変換し、オラクル、ミューテータ、セレクタループを使用してタスク固有のスキルを生成する。
論文 参考訳(メタデータ) (2026-05-20T23:10:49Z) - Towards Self-Improving Error Diagnosis in Multi-Agent Systems [31.04613892300063]
セマンティック障害帰属のための自己改善フレームワークであるErrorProbeを紹介する。
ErrorProbeは、責任あるエージェントと発生したエラーステップを特定する。
検証されたエピソードメモリを維持しており、実行可能証拠によってエラーパターンが確認された場合にのみ更新される。
論文 参考訳(メタデータ) (2026-04-19T23:13:05Z) - CodeTracer: Towards Traceable Agent States [40.51936201889185]
異種実行アーティファクトを解析し,抽出器を進化させるトレースアーキテクチャであるCodeTracerを提案する。
CodeTracerは、永続的なメモリを持つ階層的なトレースツリーとして、完全な状態遷移履歴を再構築する。
障害発生元とその下流チェーンを特定するために、障害オンセットのローカライゼーションを実行する。
論文 参考訳(メタデータ) (2026-04-13T15:52:03Z) - DoVer: Intervention-Driven Auto Debugging for LLM Multi-Agent Systems [48.971606069204825]
DoVerは、大規模言語モデル(LLM)ベースのマルチエージェントシステムのための介入駆動デバッグフレームワークである。
ターゲットの介入を通じて、アクティブな検証によって仮説生成を増強する。
DoVerは失敗試験の18~28%を成功させ、最大16%のマイルストーンを達成し、失敗仮説の30~60%を検証または否定する。
論文 参考訳(メタデータ) (2025-12-07T09:23:48Z) - Metacognitive Self-Correction for Multi-Agent System via Prototype-Guided Next-Execution Reconstruction [58.51530390018909]
大規模言語モデルに基づくマルチエージェントシステムは、協調的な問題解決において優れているが、エラーのカスケードには脆弱である。
我々は,MASにリアルタイム,教師なし,ステップレベルの誤り検出と自己補正を付与するメタ認知フレームワークMASCを提案する。
論文 参考訳(メタデータ) (2025-10-16T05:35:37Z) - Where LLM Agents Fail and How They can Learn From Failures [62.196870049524364]
大規模言語モデル(LLM)エージェントは、複雑なマルチステップタスクの解決において有望であることを示す。
単一ルート原因エラーがその後の決定を通じて伝播する、障害のカスケードに対する脆弱性を増幅する。
現在のシステムは、モジュール的で体系的な方法でエージェントエラーを包括的に理解できるフレームワークを欠いている。
AgentErrorTaxonomyは、メモリ、リフレクション、計画、アクション、システムレベルの操作にまたがる障害モードのモジュール分類である。
論文 参考訳(メタデータ) (2025-09-29T18:20:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。