論文の概要: TROVE: Adaptive Agent Skill Orchestration via Trace-Grounded Route Validation and Editing
- arxiv url: http://arxiv.org/abs/2609.05019v1
- Date: Fri, 04 Sep 2026 11:38:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-07 18:15:24.022627
- Title: TROVE: Adaptive Agent Skill Orchestration via Trace-Grounded Route Validation and Editing
- Title(参考訳): TROVE: トレーサグラウンドルート検証と編集による適応エージェントスキルオーケストレーション
- Abstract要約: 検証・編集(TROVE)によるトレーサグラウンドルートオーケストレーションを提案する。
オフライン, TROVE蒸留は, ワークフローのトレースから原子・複合技術, 結果条件遷移グラフまでの評価を行った。
オンラインでは、計画されたルートを暫定的に扱い、1つのトップレベルスキルをコミットした後、コントローラは有効な継続を保持し、トレースサポートされたローカルレスポンスを挿入し、無効な接尾辞のみを置き換える。
- 参考スコア(独自算出の注目度): 14.424308190797683
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Agents tend to optimize, select, or constrain execution structures before decisive runtime outcomes are observed. However, such pre-execution commitment creates an orchestration bottleneck: when intermediate evidence invalidates the pending continuation, agents must either execute stale steps or replan broadly, compounding errors, wasting computation, and discarding progress. We thus propose Trace-grounded Route Orchestration via Validation and Editing (TROVE), which revises only what runtime evidence invalidates. Offline, TROVE distills evaluated workflow-search traces into atomic and composite skills and an outcome-conditioned transition graph, preserving stable fragments while exposing outcome-dependent decisions. Online, it treats a planned route as provisional: after committing one top-level skill, the controller retains a valid continuation, inserts a trace-supported local response, or replaces only the invalid suffix. Evaluation across code-generation, question-answering, and math reasoning benchmarks with different LLM backbones show that TROVE delivers a stronger quality-efficiency trade-off than existing baselines of dataset-level optimization, query-level architecture selection, and graph-constrained scheduling. Quality gains are largest when outcomes change the appropriate continuation, whereas early termination yields substantial efficiency gains on near-saturated tasks. Ablations further show that composite skills capture most offline benefits, insertion enables local correction, and suffix replacement primarily improves efficiency. These findings establish selective route editing as a general principle for adaptive agent orchestration.
- Abstract(参考訳): エージェントは決定的な実行結果が観察される前に、実行構造を最適化、選択、あるいは制約する傾向がある。
中間的証拠が保留中の継続を無効にする場合、エージェントは古いステップを実行するか、広範囲に計画し、エラーを複雑にし、計算を無駄にし、進捗を破棄しなければならない。
そこで我々は,TROVE (Trace-grounded Route Orchestration via Validation and Editing) を提案する。
オフラインで、TROVE蒸留はワークフローのトレースを、原子と合成のスキルと結果条件の遷移グラフに評価し、安定した断片を保存し、結果に依存した決定を公表した。
1つのトップレベルスキルをコミットした後、コントローラは有効な継続を保持し、トレースサポートされたローカルレスポンスを挿入し、無効な接尾辞のみを置き換える。
コード生成、問合せ、数学推論ベンチマークの異なるLCMバックボーンによる評価は、TROVEが既存のデータセットレベルの最適化、クエリレベルのアーキテクチャ選択、グラフ制約付きスケジューリングのベースラインよりも、より優れた品質と効率のトレードオフを提供することを示している。
結果が適切な継続を変更した場合、品質向上は最大であり、一方、早期終了は、ほぼ飽和したタスクにおいて実質的な効率向上をもたらす。
さらにアブレーションは、複合的なスキルがほとんどのオフラインの利点を捉え、挿入は局所的な修正を可能にし、接尾辞の置き換えは、主に効率を向上することを示している。
これらの知見は適応的エージェントオーケストレーションの一般的な原理として選択的経路編集を確立した。
関連論文リスト
- HarnessEvolve: Learning from Reference Trajectories for Reliable Agent Self-Evolution [11.431479238875712]
我々は、信頼できるエージェントの自己進化を実現するために、参照軌道から学習する自己進化フレームワークであるHarnessEvolveを紹介する。
私たちは、さまざまなモデルとエージェントフレームワークを使用して、オープンドメインとエンタープライズシナリオにまたがるいくつかのベンチマークで広範な実験を行います。
結果は、HarnessEvolveがすべてのベンチマークと設定で、最先端のベースラインを一貫して上回っていることを示している。
論文 参考訳(メタデータ) (2026-09-01T07:31:18Z) - CAFE: Self-Improving Search Agents Need Co-Evolving Feedback [64.5257526832476]
アウトカム管理された検索エージェントは、いつ、どのように証拠を回収するかを学習するが、端末の報酬は中間エラーのローカライズも、それらのエラーが複雑になる前に継続する軌道のリダイレクトもしない。
学習した軌道内での介入として修正的フィードバックを扱うことは、エージェントがいつフィードバックを要求し使用するかを決めなければならないのに対し、批評家は、エージェントが改善するにつれて障害パターンが変化する結果構築されたロールアウトから有用な修正を推測しなければならない。
論文 参考訳(メタデータ) (2026-08-25T16:39:00Z) - Escaping the Self-Repair Trap: Improving Test Oracle Generation via Dual-Context Awareness [4.39623958563083]
DCAwareは、マルチラウンド修復よりも高信号対雑音のコンテキストグラウンドを優先する非定型フレームワークである。
DCAウェアは、高い実行成功を維持しながら、フォールトリーベリングの有効性を一貫して向上することを示す。
以上の結果から,反復的な補修複雑性を付加するよりも,文脈品質の向上が有効であることが示唆された。
論文 参考訳(メタデータ) (2026-08-06T11:43:11Z) - TTHE: Test-Time Harness Evolution [50.26245555541721]
既存のアプローチでは、デプロイ前、トレーニング前、あるいはテスト時に凍結される固定されたエージェントワークフローの開発データを最適化する。
我々は、エージェントがテスト入力で生成するラベルのない実行トレースのみを使用して、評価自体にハーネスを最適化できるかどうかを問う。
評価中、TTHEは候補ハーネスの人口を維持し、それらの実行トレースの理由をエージェントプロジェクタを通じてそれらを洗練する。
その後、審査員は実行元プロキシ信号から改善されたハーネスをコミットし、選択したプログラムは継続してその後の入力を統治する。
論文 参考訳(メタデータ) (2026-07-09T05:53:39Z) - Atomic Task Graph: A Unified Framework for Agentic Planning and Execution [13.978062792065215]
Atomic Task Graph (ATG) は、計画と実行のための統一された制御フレームワークである。
ATGは依存関係を公開するための明示的なグラフを維持し、再利用をサポートする。
ATGは、成功率と実行効率の強いベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2026-07-02T09:34:20Z) - From Verdict to Process: Agentic Reinforcement Learning for Multi-Stage Fact Verification [4.539896456749749]
本稿では,多段階事実検証トラジェクトリのエンドツーエンド最適化のためのエージェント強化学習フレームワークProFactを提案する。
ProFactは、クレームの分解、証拠探索、回答生成、検証予測を協調する統一的なポリシーを訓練する。
実証評価の結果,ProFactは検証性能と推論効率の両方において,高いベースラインを一貫して上回っていることがわかった。
論文 参考訳(メタデータ) (2026-06-11T12:17:18Z) - CausalFlow: Causal Attribution and Counterfactual Repair for LLM Agent Failures [4.061481215870679]
フェールエージェントトレースを最小限の偽物修復と再利用可能な監視に変換する介入フレームワークであるCausalFlowを紹介した。
CaulFlowは、最小限の振る舞いドリフトで障害から回復するターゲットテスト時修復と、オフラインの優先度最適化や報酬モデリングに適したトレーニング時間監視の2つの補完的な使用をサポートする。
論文 参考訳(メタデータ) (2026-05-25T01:47:01Z) - OLIVIA: Online Learning via Inference-time Action Adaptation for Decision Making in LLM ReAct Agents [74.20327254615854]
大規模言語モデルエージェントは、シーケンシャルな意思決定タスクを解決するために、推論、行動選択、観察をインターリーブする。
LLMエージェントの既存の推論時間適応法は、主にプロンプトや検索に依存している。
提案するOLIVIAは,ReAct型エージェントのための推論時行動適応フレームワークである。
論文 参考訳(メタデータ) (2026-05-11T19:28:20Z) - AdaExplore: Failure-Driven Adaptation and Diversity-Preserving Search for Efficient Kernel Generation [59.964989458924585]
AdaExploreは、パフォーマンスクリティカルなカーネルコード生成のための蓄積された実行フィードバックによる自己改善を可能にするエージェントフレームワークである。
適応段階では、エージェントはタスクを合成し、繰り返し発生する障害を有効ルールの再利用可能なメモリに変換する。
探索段階では、候補核を木として整理し、小さな局所精製とより大きな構造再生を交互に行う。
論文 参考訳(メタデータ) (2026-04-17T18:25:03Z) - Training LLMs for Multi-Step Tool Orchestration with Constrained Data Synthesis and Graduated Rewards [76.49428173793386]
LLMは、中間出力を伝搬しながら、正しい順序で複数の依存APIを呼び出す必要がある。
既存の環境は、シミュレーションデータを使った単純なターン毎の関数呼び出しとバイナリ報酬に重点を置いている。
まず、実APIレスポンスの大規模キャッシュを背景とした強化学習環境を構築し、有効なマルチステップオーケストレーショントレースをサンプリングするデータ合成パイプラインを実現する。
第二に、正当性を原子の妥当性とオーケストレーションに分解する、段階的な報酬設計を提案する。
論文 参考訳(メタデータ) (2026-03-25T18:31:39Z) - Veri-Sure: A Contract-Aware Multi-Agent Framework with Temporal Tracing and Formal Verification for Correct RTL Code Generation [4.723302382132762]
シリコングレードの正しさは、 (i) シミュレーション中心の評価の限られたカバレッジと信頼性、 (ii) 回帰と修復幻覚、 (iii) エージェントハンドオフ間で意図が再解釈される意味的ドリフトによってボトルネックが残っている。
エージェントの意図を整合させる設計契約を確立するマルチエージェントフレームワークであるVeri-Sureを提案する。
論文 参考訳(メタデータ) (2026-01-27T16:10:23Z) - On the Role of Feedback in Test-Time Scaling of Agentic AI Workflows [71.92083784393418]
エージェントAI(自律的な計画と行動を行うシステム)は広く普及しているが、複雑なタスクにおけるタスクの成功率は低いままである。
推論時のアライメントは、サンプリング、評価、フィードバックの3つのコンポーネントに依存します。
本稿では,様々な形態の批判から抽出されたフィードバックを繰り返し挿入するIterative Agent Decoding(IAD)を紹介する。
論文 参考訳(メタデータ) (2025-04-02T17:40:47Z) - Where is the Grass Greener? Revisiting Generalized Policy Iteration for
Offline Reinforcement Learning [81.15016852963676]
オフラインRL体制における最先端のベースラインを、公正で統一的で高分解能なフレームワークの下で再実装する。
与えられたベースラインが、スペクトルの一方の端で競合する相手よりも優れている場合、他方の端では決してしないことを示す。
論文 参考訳(メタデータ) (2021-07-03T11:00:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。