論文の概要: AgentTether: Graph-Guided Diagnosis and Runtime Intervention for Reliable LLM Agent Operation
- arxiv url: http://arxiv.org/abs/2607.06273v1
- Date: Tue, 07 Jul 2026 13:40:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.537837
- Title: AgentTether: Graph-Guided Diagnosis and Runtime Intervention for Reliable LLM Agent Operation
- Title(参考訳): AgentTether: 信頼性 LLM エージェントのグラフガイド診断と実行操作
- Abstract要約: AgentTetherは実行時修復フレームワークで、基礎となるエージェントや環境を変更することなく、実行後の診断とガイド付きリカバリを自動化する。
オフラインのノーマルビヘイビアモデルとランローカルグラフ検出器を組み合わせることで、障害クリティカルなサブトラジェクトリをローカライズする。
オフラインの診断とガイダンスツールとして、あるいはオンラインの修復レイヤとしてデプロイできる。
- 参考スコア(独自算出の注目度): 27.0859707906163
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language model (LLM) agents are increasingly used for multi-step, stateful tool-use tasks, yet production reliability remains limited. Unlike static software repair, agent repair must recover dynamic trajectories whose early decisions can propagate into later errors and external state changes. Existing automatic remedies address only part of this problem: blind retry adds no diagnosis, outcome feedback says whether a run failed but not where or why, and self-reflection often lacks grounded evidence to prevent the same failure from recurring. We present AgentTether, a run-time repair framework that automates post-run diagnosis and guided recovery without modifying the underlying agent or environment. AgentTether abstracts each run into Transition Units, links them through a dependency-aware Critical Transition Graph, and localizes failure-critical subtrajectories by combining an offline normal-behavior model with a run-local graph detector. It then converts the localized cause into behavior-scoped guidance backed by cross-iteration Repair Memory, and can optionally apply guarded run-time intervention to keep the correction active during re-execution. The same design can be deployed as an offline diagnostic-and-guidance tool or as an online repair layer. We evaluate AgentTether on 261 tau-bench tasks across three domains with Qwen3.7-max, and test cross-model transfer on Banking with GPT-5.4. On the hardest Banking domain, AgentTether repairs 59.04% (49/83) of initially failed Qwen3.7-max tasks and 65.12% (56/86) of initially failed GPT-5.4 tasks. Overall, AgentTether improves repair effectiveness while reducing agent turns and end-to-end approach tokens, suggesting a practical reliability layer that can wrap existing agent deployments, reduce wasted re-execution, and improve recovery without retraining the agent.
- Abstract(参考訳): 大規模言語モデル(LLM)エージェントは、多段階でステートフルなツール使用タスクに益々使用されているが、生産信頼性は限られている。
静的なソフトウェア修復とは異なり、エージェントの修復は、初期決定が後のエラーや外部の状態変化に伝播する動的な軌道を復元する必要がある。
既存の自動治療は、この問題の一部にのみ対処する: 盲目再検査は診断を付加せず、結果のフィードバックは、実行が失敗したが、どこで失敗したのか、なぜ失敗したかを述べ、自己修正は、同じ障害が再発するのを防ぐための根拠を欠いていることが多い。
我々は,実行後診断とガイド付き回復を自動化するランタイム修復フレームワークであるAgentTetherについて,基礎となるエージェントや環境を変更することなく紹介する。
AgentTetherは各ランをトランジションユニットに抽象化し、依存を意識したクリティカルトランジショングラフを通じてリンクし、オフラインの通常の振る舞いモデルとランローカルグラフ検出器を組み合わせることで、障害クリティカルなサブトラジェクトリをローカライズする。
次に、ローカライズされた原因をクロスイテレーション修復メモリによってバックアップされた行動スコープによるガイダンスに変換し、任意にガードされた実行時の介入を適用して、再実行中の修正をアクティブにする。
同じ設計をオフラインの診断・指導ツールとして、あるいはオンラインの修復レイヤとしてデプロイすることができる。
我々は,Qwen3.7-maxで3つの領域にまたがる261のtau-benchタスク上でAgenTetherを評価し,GPT-5.4でバンク上でのクロスモデル転送をテストする。
最も難しいバンキング領域では、エージェントテザーが最初に失敗したQwen3.7-maxタスクの59.04% (49/83) と、最初に失敗したGPT-5.4タスクの65.12% (56/86) を修復した。
全体として、AgentTetherは、エージェントのターンとエンドツーエンドのアプローチトークンを削減しながら、修復効率を改善し、既存のエージェントデプロイメントをラップし、無駄な再実行を削減し、エージェントを再トレーニングすることなくリカバリを改善する実用的な信頼性レイヤを提案する。
関連論文リスト
- Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction [22.654396704495934]
開発セット障害は、どのリカバリ介入が許容可能かを決定することにより、欠落診断基板の一部を回復することができる。
DARCは、タスクファミリー障害モードをプロファイリングし、共有リカバリライブラリから不正な介入を発生させ、検証者選択によるデプロイメント成功コストポリシーを凍結する、診断誘導型リカバリハーネスである。
論文 参考訳(メタデータ) (2026-08-12T08:14:45Z) - FailForge: Distilling Procedural Competence from Persistent Failures into Code Agents [49.519184792774304]
FailForgeは、失敗したロールアウトをトレーニングシグナルに変換するエージェントフレームワークである。
FailForgeは、これまで失敗したインスタンスの26%を、限界的な追加コストでリカバリする。
論文 参考訳(メタデータ) (2026-08-09T08:22:57Z) - ScrambleToolBench: Agents Search Exhaustively Even When Their Own Map Points to the Next Step [74.83535434786145]
ScrambleToolBenchは,行動推論の分離を目的とした対話型端末ベンチマークである。
このベンチマークでは、エージェントがテストとエラーのインタラクションを通じて、隠されたツールの振る舞いを明らかにする必要がある。
現状の言語モデルに対する我々の評価は、初期発見が成功しても頑健な適応にはならないことを示している。
論文 参考訳(メタデータ) (2026-08-03T15:07:46Z) - When Agents Do Not Stop: Uncovering Infinite Agentic Loops in LLM Agents [7.986500985812644]
私たちはこの問題をInfinite Agentic Loops (IALs)と呼んでいる。
IALはエージェントロジック、フレームワークセマンティクス、実行時の観察、終了メカニズム間の相互作用から生まれる。
本研究では,実世界のLLMエージェントプロジェクトにおけるALF検出のための静的解析ツールであるIAL-Scanを提案する。
論文 参考訳(メタデータ) (2026-07-02T03:14:27Z) - Your Agents Are Aging Too: Agent Lifespan Engineering for Deployed Systems [60.79651380135334]
長寿命のAIエージェントは、永続的な運用システムとしてますますデプロイされる。
エージェントはデプロイ後、いつまで信頼できるのか?
エージェントライフスパンエンジニアリングのための縦型信頼性ベンチマークであるAgingBenchを紹介する。
論文 参考訳(メタデータ) (2026-05-25T19:55:12Z) - On-Policy Self-Evolution via Failure Trajectories for Agentic Safety Alignment [54.30690671490447]
既存の安全アライメント信号は、主に応答レベルまたは政治外である。
FATEは、検証済みの失敗を専門家のデモンストレーションなしで修復管理に変換する。
FATEは攻撃成功率を33.5%、有害なコンプライアンスを82.6%削減し、外的軌道安全診断を6.5%改善する。
論文 参考訳(メタデータ) (2026-05-12T09:56:28Z) - Debugging the Debuggers: Failure-Anchored Structured Recovery for Software Engineering Agents [26.16025682022058]
PROBEは、ソフトウェアエンジニアリングエージェントの構造化リカバリのための、障害対応フレームワークである。
PROBEは、リポジトリレベルのソフトウェア修復、エンタープライズワークフローのリカバリ、AIOpsサービス緩和の3つの設定で評価します。
論文 参考訳(メタデータ) (2026-05-09T06:02:08Z) - AgentDevel: Reframing Self-Evolving LLM Agents as Release Engineering [8.201374511929538]
AgentDevelは、現行のエージェントを反復的に実行するリリースエンジニアリングパイプラインである。
実行トレースから実装盲の症状レベルの品質信号を生成する。
主要な症状パターンを集約し、監査可能なエンジニアリング仕様を生成する。
論文 参考訳(メタデータ) (2026-01-08T05:49:01Z) - DoVer: Intervention-Driven Auto Debugging for LLM Multi-Agent Systems [48.971606069204825]
DoVerは、大規模言語モデル(LLM)ベースのマルチエージェントシステムのための介入駆動デバッグフレームワークである。
ターゲットの介入を通じて、アクティブな検証によって仮説生成を増強する。
DoVerは失敗試験の18~28%を成功させ、最大16%のマイルストーンを達成し、失敗仮説の30~60%を検証または否定する。
論文 参考訳(メタデータ) (2025-12-07T09:23:48Z) - Alita-G: Self-Evolving Generative Agent for Agent Generation [54.49365835457433]
汎用エージェントをドメインエキスパートに変換するフレームワークであるALITA-Gを提案する。
このフレームワークでは、ジェネラリストエージェントが対象ドメインタスクのキュレートされたスイートを実行する。
計算コストを削減しながら、大きな利益を得ることができます。
論文 参考訳(メタデータ) (2025-10-27T17:59:14Z) - Where LLM Agents Fail and How They can Learn From Failures [62.196870049524364]
大規模言語モデル(LLM)エージェントは、複雑なマルチステップタスクの解決において有望であることを示す。
単一ルート原因エラーがその後の決定を通じて伝播する、障害のカスケードに対する脆弱性を増幅する。
現在のシステムは、モジュール的で体系的な方法でエージェントエラーを包括的に理解できるフレームワークを欠いている。
AgentErrorTaxonomyは、メモリ、リフレクション、計画、アクション、システムレベルの操作にまたがる障害モードのモジュール分類である。
論文 参考訳(メタデータ) (2025-09-29T18:20:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。