論文の概要: Self-Evolving Agents via Likelihood-Guided Tool-Space Optimization
- arxiv url: http://arxiv.org/abs/2609.34151v1
- Date: Mon, 28 Sep 2026 02:32:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-04 06:25:53.795177
- Title: Self-Evolving Agents via Likelihood-Guided Tool-Space Optimization
- Title(参考訳): Likelihood-Guided Tool-Space Optimizationによる自己進化型エージェント
- Abstract要約: 自己進化エージェントは、その振る舞いを継続的に改善し、ツールは、環境と相互作用する実行可能なアクション空間を定義する。
ツール空間の自己進化について検討し、各繰り返しタスクタイプは、蓄積された出力経験から構築された永続的なツール空間を維持する。
LOTS(Likelihood-Only Tool Scoring)を導入し、モデルパラメータを固定しつつ、蓄積した出力経験からエージェントのツール空間を進化させる。
- 参考スコア(独自算出の注目度): 36.51237259175279
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Self-evolving agents can continually improve their behavior, while tools define the executable action space through which they interact with the environment. However, exposing the full tool library to model introduces substantial irrelevant context and can impair tool-use decisions. We study tool-space self-evolution, where each recurring task type maintains a persistent tool space which is constructed from accumulated output experience. We identify three limitations of existing methods: (1) output-unaware selection: they rely primarily on tool descriptions or model priors rather than observed tool outputs; (2) statelessness across request: they select tools independently for each request without consolidating prior output experience into persistent task-specific state; (3) inference cost: they repeatedly search, rank, or reason over candidate tools for subsequent requests of the same task. We address these limitations through output-aware tool scoring, persistent task-specific tool spaces, amortized tool selection, and reusable configurations across models. We introduce LOTS (Likelihood-Only Tool Scoring), which evolves an agent's tool space from accumulated output experience while keeping model parameters fixed. After each request, LOTS holds the model's generated answer and estimates each tool's contribution by measuring how much the answer likelihood changes when its observed output is removed. These contributions are aggregated within each recurring task to rank tools and update its persistent space. Across three benchmarks, LOTS improves task performance while substantially reducing tool context. More importantly, sequential experiments demonstrate that task-specific spaces persist and continue to improve over time, while cross-model experiments show that learned configurations transfer across different models.
- Abstract(参考訳): 自己進化エージェントは、その振る舞いを継続的に改善し、ツールは、環境と相互作用する実行可能なアクション空間を定義する。
しかし、フルツールライブラリをモデルに公開すると、意味のないコンテキストが導入され、ツール使用の決定が損なわれる可能性がある。
ツール空間の自己進化について検討し、各繰り返しタスクタイプは、蓄積された出力経験から構築された永続的なツール空間を維持する。
既存のメソッドの3つの制限を識別する: (1) アウトプットを意識しない選択: 観察されたツール出力よりもツール記述やモデル先行に主に依存する; (2) リクエスト間のステートレス性: 以前のアウトプットエクスペリエンスを永続的なタスク固有の状態に集約することなく、各要求に対して独立してツールを選択する; (3) 推論コスト: 繰り返し検索、ランク付け、および、同じタスクのその後の要求に対する候補ツールの理由付けを行う。
出力対応ツールスコアリング、永続的なタスク固有のツールスペース、償却ツールの選択、モデル間の再利用可能な設定などを通じて、これらの制限に対処する。
LOTS(Likelihood-Only Tool Scoring)を導入し、モデルパラメータを固定しつつ、蓄積した出力経験からエージェントのツール空間を進化させる。
各要求の後、LOTSはモデルが生成した回答を保持し、観測された出力が削除されたときの回答の確率がどれくらい変化するかを測定することで、各ツールの貢献を推定する。
これらのコントリビューションは、各繰り返しタスクに集約され、ツールをランク付けし、永続的なスペースを更新する。
3つのベンチマークで、LOTSはタスクパフォーマンスを改善し、ツールコンテキストを大幅に削減する。
さらに重要なことは、シーケンシャルな実験では、タスク固有の空間が持続し、時間とともに改善され続けることが示され、一方、クロスモデル実験では、学習された構成が異なるモデル間で伝達されることが示されている。
関連論文リスト
- SING: Synthetic Intention Graph for Scalable Active Tool Discovery in LLM Agents [64.59100414726556]
大規模言語モデル(LLM)エージェントは、コンテキスト、ツール、マルチターン実行を管理するハーネスに依存している。
Retrieval-augmented Tool selectionは、自然な代替手段を提供するが、既存のワンショット検索方法は、独立したツール記述とエージェントの真のタスク意図との整合に失敗する。
我々は、ユーザ意図、ツール機能、ツールコラボレーションパターンをリンクするインテントツーオールグラフを構築する、意図認識型のアクティブツール発見フレームワークであるSINGを提案する。
論文 参考訳(メタデータ) (2026-06-15T11:37:37Z) - Tool-Genesis: A Task-Driven Tool Creation Benchmark for Self-Evolving Language Agent [45.450766613995135]
Tool-Genesisは、複数の次元にわたるエージェント能力の定量化のために設計された診断ベンチマークである。
最先端モデルでさえ、ワンショット設定で正確なツールインターフェースや実行可能なロジックを生成するのに苦労しています。
論文 参考訳(メタデータ) (2026-03-05T17:44:29Z) - Learning to Rewrite Tool Descriptions for Reliable LLM-Agent Tool Use [21.666294374943178]
トレースリッチな設定からトレースフリーなデプロイメントへ監督を移行するカリキュラム学習フレームワークを提案する。
実験では、予期せぬツール、強力なクロスドメインの一般化、そして、候補ツールの数が100を超えるほど堅牢性に一貫した向上が示されている。
論文 参考訳(メタデータ) (2026-02-23T23:50:24Z) - AdaReasoner: Dynamic Tool Orchestration for Iterative Visual Reasoning [66.24374176797075]
textbfAdaReasonerは、ツール固有の、あるいは明示的な教師付き行動ではなく、一般的な推論スキルとしてツールの使用を学ぶマルチモーダルモデルのファミリーである。
AdaReasonerは、(i)スケーラブルなデータキュレーションパイプラインによって、長期にわたる多段階のツールインタラクションにモデルを公開し、(ii)ツール-GRPO、(ii)ツールの選択とシークエンシングをエンドツーエンドの成功に基づいて優先順位付けする強化学習アルゴリズム、(iii)ツールの使用を動的に規制する適応学習メカニズムによって実現されている。
論文 参考訳(メタデータ) (2026-01-26T16:04:43Z) - ToolLibGen: Scalable Automatic Tool Creation and Aggregation for LLM Reasoning [80.10274552177096]
外部ツールを備えたLarge Language Models (LLM) は、複雑な推論タスクにおけるパフォーマンスの向上を実証している。
このツールに強化された推論が広く採用されるのは、ドメイン固有のツールが不足しているためである。
構造化ツールライブラリに非構造化ツールのコレクションを自動的に組み込むための体系的なアプローチを提案する。
論文 参考訳(メタデータ) (2025-10-09T04:11:16Z) - Adaptive Tool Use in Large Language Models with Meta-Cognition Trigger [49.81945268343162]
我々は,外部ツール利用のための適応型意思決定戦略であるMeCoを提案する。
MeCoは、表現空間内の高レベル認知信号をキャプチャすることで、メタ認知スコアを定量化する。
MeCoは微調整不要で、最小限のコストがかかる。
論文 参考訳(メタデータ) (2025-02-18T15:45:01Z) - Re-Invoke: Tool Invocation Rewriting for Zero-Shot Tool Retrieval [47.81307125613145]
Re-Invokeは、トレーニングなしで大規模ツールセットに効果的にスケールするために設計された教師なしツール検索手法である。
我々は、クエリ毎に最も関連性の高いツールを特定するために、意図に基づいて、新しいマルチビュー類似度ランキング戦略を採用する。
評価の結果、Re-Invokeはシングルツールとマルチツールの両方のシナリオにおいて、最先端の代替よりも大幅に優れていた。
論文 参考訳(メタデータ) (2024-08-03T22:49:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。