論文の概要: One Readout, Many Repairs: Diffusion-Guided Hierarchical Search for Tool-Agent Repair
- arxiv url: http://arxiv.org/abs/2609.34879v2
- Date: Tue, 29 Sep 2026 05:05:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:46.778181
- Title: One Readout, Many Repairs: Diffusion-Guided Hierarchical Search for Tool-Agent Repair
- Title(参考訳): ツールエージェント修復のための拡散誘導階層探索
- Abstract要約: 本稿では,修復計算の削減を図り,ツールエージェントの故障復旧を改善するためのトレーニング不要な拡散誘導フレームワークを提案する。
ReCommitは、マスク付き言語モデルの単一並列読み出しから操作型スコアを再利用することにより、修復試験全体にわたって操作レベルの提案を補正する。
Agent-Diffベンチマークで4つのエンタープライズサービスにまたがる実際の障害に関する実験では、75.9%と63.2%の相対的な回復率が61.3%、51.3%の削減率を示した。
- 参考スコア(独自算出の注目度): 14.373144574240165
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Tool agents use large language models to act through external tools, yet successfully executed calls can still leave user requests unfulfilled. Tool-agent repair seeks alternative call sequences that execute successfully and fulfill the original requests. However, repair requires exploring both operation choices and their concrete realizations, making complete-sequence regeneration costly. Moreover, regeneration repeats operation selection even when failure arises from how those operations are realized. The resulting challenge is to reduce this repetition while preserving exploration of alternative operations and realizations. Therefore, we formulate repair as hierarchical search over operation supports, which we introduce as sets of permitted operation types that define reusable search regions for concrete tool-call sequences. We propose ReCommit, a training-free, diffusion-guided framework for improving tool-agent failure recovery while reducing repair computation. ReCommit amortizes operation-level proposal computation across repair trials by reusing operation-type scores from a single parallel readout of a masked diffusion language model. These scores guide search across supports, while realization search explores alternative entity bindings, arguments, and action composition within each support. Experiments on real failures across four enterprise services in the Agent-Diff benchmark show 75.9\% and 63.2\% relative recovery gains with 61.3\% and 51.3\% reductions in mean full-budget repair time at repair budgets $B=3$ and $B=13$, respectively, over the strongest evaluated 8B comparison method. ReCommit achieves a favorable recovery--cost trade-off, including in comparisons with the evaluated 32B models.
- Abstract(参考訳): ツールエージェントは、大きな言語モデルを使用して外部ツールを介して動作します。
ツールエージェントの修復は、正常に実行し、元の要求を満たす代替の呼び出しシーケンスを探す。
しかし、修復には操作の選択と具体的実現の両方を探索する必要があるため、完全系列の再生はコストがかかる。
さらに、再生は、これらの操作の実現方法から障害が発生した場合でも、操作選択を繰り返す。
結果として生じる課題は、代替操作と実現の探索を保ちながら、この繰り返しを減らすことである。
そこで我々は, 具体的ツールコールシーケンスに対して, 再利用可能な検索領域を定義する操作型の集合として, 階層的検索支援として修復を定式化する。
ReCommitは、ツールエージェントの故障回復を改善するためのトレーニング不要で拡散誘導型フレームワークであり、補修計算の削減を図っている。
ReCommitは、マスク付き拡散言語モデルの単一並列読み出しから操作型スコアを再利用することにより、修復試験全体にわたる操作レベル提案計算を補正する。
これらのスコアは、サポート間で検索をガイドし、実現検索は、各サポート内の代替エンティティバインディング、引数、アクションコンポジションを探索する。
Agent-Diffベンチマークの4つのエンタープライズサービスにおける実際の障害に関する実験では、最も評価の高い8B比較法に対して、それぞれ75.9\%と63.2\%の相対回復率が61.3\%と51.3\%で、修理予算における全予算の修理時間の平均は、それぞれ$B=3$と$B=13$である。
ReCommitは評価された32Bモデルと比較して、良好なリカバリコストトレードオフを実現している。
関連論文リスト
- Grow the Harness, Not the Context: From Strategy-Free Scaffolds to Reusable Specialist Agents [40.22528682803753]
大きな言語モデル(LLM)エージェントは、しばしば関連するタスクのストリームを処理するが、標準的なハーネスは、各タスクのコンテキスト内で同じ制御決定を再構築するようモデルに繰り返し要求する。
タスク固有のセマンティック推論のためのLCMコールを保存しながら、繰り返し制御を再利用可能なコードに変換することができるかどうかを検討する。
我々は,障害誘導型トレーニングパラダイムであるGrowing Harnessを紹介し,エージェント自身を戦略のない足場から学習する。
論文 参考訳(メタデータ) (2026-09-22T17:40:45Z) - ParaRecover: A Process-Level Benchmark for Error Localization and Recovery in Parallel Tool-Use Agents [9.426759720914623]
ParaRecoverは、マルチターン並列ツール使用エージェントのエラーローカライゼーションとリカバリを評価するための、プロセスレベルのベンチマークである。
計画依存関係、ツールの選択、引数マッチングを含む14のエラータイプの詳細な分類に基づいて、ベンチマークは2つの困難レベルにまたがる10,626のインスタンスで構成されている。
実験によると、最先端のモデルでさえも、マルチターンエラーの伝播、ツール使用障害の簡易化、正確な再計画に苦戦している。
論文 参考訳(メタデータ) (2026-09-11T02:09:33Z) - EAVer: Long-Form Factuality Verification as an End-to-End Agentic Policy [50.665874114632]
我々は、完全な応答レベルの検証ワークフローを統一ポリシーとして制御することを学ぶ、エンドツーエンドのエージェント検証であるEAVerを紹介する。
EAVerはセマンティック関連クレームをグループ化し、信頼に基づいた直接検証やターゲット検索にルートし、コンパクトなインコンテキストメモで検索によって返される証拠を保持する。
論文 参考訳(メタデータ) (2026-09-02T21:00:35Z) - Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction [22.654396704495934]
開発セット障害は、どのリカバリ介入が許容可能かを決定することにより、欠落診断基板の一部を回復することができる。
DARCは、タスクファミリー障害モードをプロファイリングし、共有リカバリライブラリから不正な介入を発生させ、検証者選択によるデプロイメント成功コストポリシーを凍結する、診断誘導型リカバリハーネスである。
論文 参考訳(メタデータ) (2026-08-12T08:14:45Z) - ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment [66.45065414461274]
ロングホライゾン検索エージェントは、最終的な答えを得るために証拠を検索、検索、検証、統合するための複数のシーケンシャルなアクション(ステップ)をしなければならない。
本稿では,長距離検索エージェントを訓練するためのきめ細かい信用割当てフレームワークであるAnswer-Backtracked Credit Assignment (ABC)を提案する。
ABCは、スパース軌跡レベルの結果を、誤動作や冗長な動作を抑えながら、有用な動作(たとえ軌道が失敗しても)を報いるような、密度の高いステップレベルの監視に変換する。
論文 参考訳(メタデータ) (2026-08-05T17:41:31Z) - SearchAuditor: Auditing and Attributing Failures in Long-Horizon Search Agents [56.400332595452966]
我々は、監査人が検索エージェントの障害をローカライズ、属性付け、修復できるかどうかを評価するベンチマークであるSearchAuditBenchを紹介する。
SearchAuditBenchは1,243の障害トラックで構成され、平均73.1メッセージと65.1Kトークンを5つのディープサーチベンチマークで8つのオープンウェイトモデルから収集している。
本稿では,検索エージェントの障害を効果的にローカライズ,属性,修復するマルチパースペクティブ監査フレームワークであるSearchAuditorを提案する。
論文 参考訳(メタデータ) (2026-08-05T09:09:00Z) - Causal-AgentIR: Self-Evolving Causal Memory for Adaptive Image Restoration Agents [54.85451496831771]
Causal-AgentIRは階層的なマルチエージェントフレームワークであり、画像復元インテリジェンスのための自己進化型因果記憶を持つ。
分解パターン、画像領域、復元ツール、アクション、品質変更、ユーザの好みを構造化された因果記憶グラフに整理する。
このグラフはグラフベースの検索とマルチホップ因果推論をサポートしており、エージェントは特定の復元操作やツールシーケンスが異なる劣化条件下での修復品質にどのように影響するかを推測することができる。
論文 参考訳(メタデータ) (2026-07-23T09:59:44Z) - Self-Healing Agentic Orchestrators for Reliable Tool-Augmented Large Language Model Systems [0.10210859604701106]
セルフヒーリングエージェントオーケストレータは、信頼性をランタイム境界制御問題として扱う。
セルフヒーリングは98.8%のタスク成功を達成し、リトライオンリーでは94.5%、フルリプランでは93.8%を達成している。
論文 参考訳(メタデータ) (2026-05-31T19:27:22Z) - RepoMirage: Probing Repository Context Reasoning in Code Agents with Perturbations [51.43574078961796]
本稿では,SWE-Bench Verified上に構築された2段階評価スイートRepoMirageを紹介する。
RepoMirage-Perturbは、リポジトリレベルの摂動を保存する3つのタイプのセマンティクスを適用している。
RepoAnchorは、下流の問題解決からリポジトリの探索を分離する構造第一のプロトタイプワークフローである。
論文 参考訳(メタデータ) (2026-05-25T06:26:43Z) - Cycle-Consistent Search: Question Reconstructability as a Proxy Reward for Search Agent Training [80.20022221643414]
Cycle-Consistent Searchは、検索エージェントを訓練するための金色のスーパービジョンのないフレームワークである。
CCSは教師付きベースラインに匹敵する性能を示す。
これらの結果から,CCSは金の監督が不可能な環境で検索エージェントを訓練するためのスケーラブルな訓練パラダイムを提供する可能性が示唆された。
論文 参考訳(メタデータ) (2026-04-14T17:00:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。