論文の概要: CIPO: Counterfactual Imagination Policy Optimization for Adaptive Tool Granularity Selection
- arxiv url: http://arxiv.org/abs/2610.04991v1
- Date: Sun, 04 Oct 2026 06:20:50 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 21:35:12.469066
- Title: CIPO: Counterfactual Imagination Policy Optimization for Adaptive Tool Granularity Selection
- Title(参考訳): CIPO:アダプティブツールの粒度選択のためのファクトファクトイマジネーションポリシー最適化
- Abstract要約: 大規模言語モデル(LLM)エージェントは、外部ツールとのマルチステップインタラクションによって複雑なタスクを解決する。
複合的な"スキル"のようなシーケンスを扱うことは、ツール使用の軌跡を短くし、繰り返し低レベルな意思決定を減らすことができる。
本稿では,適応的なツールの粒度選択法として,効果的なスキル・ユースを研究すべきである,と論じる。
- 参考スコア(独自算出の注目度): 32.9086642603553
- License:
- Abstract: Large language model (LLM) agents solve complex tasks through multi-step interactions with external tools. These interactions often contain recurring local tool sequences. Treating such sequences as composite "Skills" can shorten tool-use trajectories and reduce repeated low-level decisions. However, when atomic tools and composite skills coexist, skill use becomes a policy problem: the agent must decide whether the current state requires atomic fine control or skill-level abstraction. In this paper, we argue that effective skill use should be studied as adaptive tool granularity selection. The most direct training signal for this problem is to compare the consequences of atomic and skill choices available from the same state. Based on this view, we propose CIPO, a Counterfactual Imagination Policy Optimization framework for adaptive tool granularity. CIPO constructs executable skills through budget-constrained mining of successful tool-use trajectories and trains granularity decisions with counterfactual branch rollouts. For each base rollout, CIPO branches at the first eligible granularity decision and replaces the chosen action with a feasible atomic or skill alternative. The paired outcome difference serves as a supplementary reward for policy optimization. Experiments across multiple benchmarks and model backbones show that CIPO improves task success and decision efficiency over baselines. Further analyses show that CIPO learns effective skill use by improving the choice between atomic tools and composite skills based on the current state, without simply increasing skill frequency.
- Abstract(参考訳): 大規模言語モデル(LLM)エージェントは、外部ツールとのマルチステップインタラクションによって複雑なタスクを解決する。
これらの相互作用は、しばしば局所的なツール配列を含む。
複合的な"スキル"のようなシーケンスを扱うことは、ツール使用の軌跡を短くし、繰り返し低レベルな意思決定を減らすことができる。
しかし、アトミックツールと複合スキルが共存する場合、スキルの使用はポリシーの問題となる。
本稿では,適応的なツールの粒度選択法として,効果的なスキル・ユースを研究すべきである,と論じる。
この問題の最も直接的な訓練信号は、同じ状態から利用できる原子とスキルの選択の結果を比較することである。
この観点から,適応ツールの粒度に対する対実的イマジネーションポリシー最適化フレームワークであるCIPOを提案する。
CIPOは、成功したツール利用軌道の予算制約によるマイニングを通じて実行可能なスキルを構築し、偽のブランチロールアウトで粒度決定を訓練する。
それぞれのベースロールアウトに対して、CIPOは最初の粒度決定で分岐し、選択されたアクションを実行可能なアトミックまたはスキルの代替品に置き換える。
ペアの結果の違いは、ポリシー最適化の補助的な報酬として役立ちます。
複数のベンチマークとモデルバックボーンでの実験は、CIPOがタスクの成功とベースラインよりも意思決定効率を改善していることを示している。
さらに分析したところ、CIPOは、単にスキル周波数を増大させることなく、現在の状況に基づいて、原子ツールと複合スキルの選択を改善することで、効果的なスキル使用を学習していることがわかった。
関連論文リスト
- Spurious Tool Use: When RL Agents Learn the Wrong Reason to Act [38.40533345940731]
大規模言語モデル(LLM)エージェントは、外部ツールによる自然言語推論をますますインターリーブする。
RLを訓練したエージェントが、ツール選択ポリシーをいつ、なぜ学習するかについて検討する。
論文 参考訳(メタデータ) (2026-09-14T19:31:04Z) - SPyCE: Skill-Policy Co-evolution for Multimodal Agents [12.105041985483167]
階層型スキルライブラリにトラジェクトリを蒸留し,強化学習を通じて更新するフレームワークであるSPyCEを提案する。
トレーニング中、ポリシーモデルはそのロールアウトをガイドするために回収されたスキルに条件を課し、スキルライブラリはポリシーによって生成された貴重なロールアウトを使用して進化する。
8つのベンチマークの実験では、SPyCEはRLベースとメモリベースの両方のベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2026-07-15T14:01:48Z) - From Atomic Actions to Standard Operating Procedures: Iterative Tool Optimization for Self-Evolving LLM Agents [90.3279207163486]
EvoSOPは、エージェントが実行軌跡からSOPを抽出し、反復的にツールセットを最適化することを可能にするフレームワークである。
EvoSOPはタスク成功率を大幅に向上し,インタラクションラウンドの回数を大幅に削減することを示す。
論文 参考訳(メタデータ) (2026-07-08T12:09:49Z) - Acting Less is Reasoning More! Teaching Model to Act Efficiently [87.28134636548705]
ツール統合推論は、タスクを解決するために外部ツールを呼び出す機能によって、大きな言語モデルを拡張します。
現在のアプローチは、外部ツールの使用効率や必要性を考慮せずに、最終的な正確性のためにのみ最適化されている。
最小限のツールコールで正確な回答をモデルに提示するフレームワークを提案する。
このアプローチでは,ツールコールを最大68.3%削減し,ツールの生産性を最大215.4%向上すると同時に,同等の回答精度を維持している。
論文 参考訳(メタデータ) (2025-04-21T05:40:05Z) - Learning to Use Tools via Cooperative and Interactive Agents [58.77710337157665]
ツール学習は、外部ツールを使用してユーティリティを拡張するエージェントとして、大きな言語モデル(LLM)を促進する。
ツール選択,ツール実行,アクションキャリブレーションの3つの特別なエージェントを個別にコーディネートする,協調型対話型エージェントフレームワークであるConAgentsを提案する。
3つのデータセットに対する実験により、LLMは、ConAgentsを装備した場合、大幅に改善されたベースラインよりも優れた性能を示した。
論文 参考訳(メタデータ) (2024-03-05T15:08:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。