論文の概要: ToolAnchor: Anchoring Counterfactual Context to Boost Agentic Tool-use Capability
- arxiv url: http://arxiv.org/abs/2607.14145v1
- Date: Tue, 14 Jul 2026 06:03:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:32.839799
- Title: ToolAnchor: Anchoring Counterfactual Context to Boost Agentic Tool-use Capability
- Title(参考訳): ToolAnchor: エージェントツールの利用能力を向上する対実的コンテキスト
- Authors: Weiting Liu, Jieyi Bi, Wanqi Zhou, Jianfeng Feng, Yining Ma, Ai Han, Wenlian Lu,
- Abstract要約: ツール拡張された大きな言語モデルエージェントは、長い水平タスクで優れているが、固定されたツールセットで後トレーニングされるのが一般的である。
このようなツールセット拡張問題における中核的障害を行動慣性とみなす。
批判的決定点に反事実的アンカーコンテキストを注入することは、この慣性を損なうことを実証する。
- 参考スコア(独自算出の注目度): 16.62013823879194
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Tool-augmented large language model agents excel at long-horizon tasks, yet they are typically post-trained on fixed toolsets. When tasks demand new tools, these agents struggle to incorporate them effectively, and retraining from scratch is often impractical. We identify the core obstacle in such toolset expansion problem as behavioral inertia: the tendency of agents to fall back on familiar tools and established reasoning patterns despite having access to new ones. We demonstrate that injecting counterfactual anchor contexts at critical decision points can break this inertia, recovering failed trajectories by eliciting suppressed agent capabilities. To scale this insight, we propose ToolAnchor, a framework that uses teacher models to hypothesize these counterfactual contexts, verifies them via student rollouts, and internalizes the successful interventions through agentic post-training. Extensive evaluations across general AI assistant (GAIA), textual search (BrowseComp), and visual search (VDR-Bench) tasks demonstrate that ToolAnchor consistently exhibits competitive performance under expanded toolsets. Our work bridges the gap between static post-training and dynamic adaptation, charting a new path for scalable agentic reinforcement learning.
- Abstract(参考訳): ツール拡張された大きな言語モデルエージェントは、長い水平タスクで優れているが、固定されたツールセットで後トレーニングされるのが一般的である。
タスクが新しいツールを要求するとき、これらのエージェントはそれらを効果的に組み込むのに苦労する。
このようなツールセット拡張問題における中核的な障害を行動慣性(行動慣性)とみなし,エージェントが慣れ親しんだツールに取って代わり,新たなツールにアクセスできたとしても推論パターンを確立した。
本研究は, 臨界決定点における反事実的アンカーコンテキストの注入が, この慣性を損なう可能性を示し, 抑制されたエージェント能力を引き出すことにより, 故障した軌道を回復することを示した。
この知見をスケールするために、教師モデルを用いて、これらの反現実的文脈を仮説化し、学生のロールアウトを通じて検証し、エージェントによるポストトレーニングを通じて成功した介入を内部化するフレームワークであるToolAnchorを提案する。
汎用AIアシスタント(GAIA)、テキスト検索(BrowseComp)、ビジュアル検索(VDR-Bench)タスクにわたる広範囲な評価は、ツールAnchorが拡張ツールセットの下で一貫して競争性能を示すことを示している。
我々の研究は、静的なポストトレーニングと動的適応のギャップを埋め、スケーラブルなエージェント強化学習のための新しいパスをチャート化します。
関連論文リスト
- SENTINEL: Failure-Driven Reinforcement Learning for Training Tool-Using Language Model Agents [52.758563996979596]
言語モデルエージェントは、マルチターンツールの使用によって現実的なタスクを解決するのにますます効果的である。
SENTINELは障害駆動型強化学習フレームワークで,障害のロールアウトを目標とするトレーニングタスクに変換する。
Tau2-Bench Retail with Qwen3-4B-Thinking-2507では、SENTINELはPass1を66.4から74.9に改善し、Passkメトリクス全体にわたる一般的な合成タスクにおいてRLを上回っている。
論文 参考訳(メタデータ) (2026-06-11T05:06:50Z) - Diversity Over Frequency: Rethinking Tool Use in Visual Chain-of-Thought Agents [8.575257729172202]
視覚エージェントは、微粒な証拠を組み込むために、思考の視覚連鎖の中で外部視覚ツールを使用する。
本稿では,3次元空間推論や医用視覚質問応答など,より困難な課題を探索するために,単純な視覚探索タスクを超えて進める。
モデルは、高いタスク精度を達成しながら、ツールの使用を徐々に停止する。
バニラトレーニングとツール使用促進の両方がロールアウトの多様性を減らし、ツールの使用率が向上しない理由を説明する。
論文 参考訳(メタデータ) (2026-05-25T13:06:59Z) - Tool-Genesis: A Task-Driven Tool Creation Benchmark for Self-Evolving Language Agent [45.450766613995135]
Tool-Genesisは、複数の次元にわたるエージェント能力の定量化のために設計された診断ベンチマークである。
最先端モデルでさえ、ワンショット設定で正確なツールインターフェースや実行可能なロジックを生成するのに苦労しています。
論文 参考訳(メタデータ) (2026-03-05T17:44:29Z) - Evolving from Tool User to Creator via Training-Free Experience Reuse in Multimodal Reasoning [16.12114923351562]
エージェントをツールユーザからツールクリエータに変換する,トレーニング不要のフレームワークを提案する。
このアプローチは推論の経験を抽出し、再利用可能な資産に蒸留する。
ツールライブラリをメンテナンスするためのメモリ統合機構も導入する。
論文 参考訳(メタデータ) (2026-02-02T11:37:45Z) - AdaReasoner: Dynamic Tool Orchestration for Iterative Visual Reasoning [66.24374176797075]
textbfAdaReasonerは、ツール固有の、あるいは明示的な教師付き行動ではなく、一般的な推論スキルとしてツールの使用を学ぶマルチモーダルモデルのファミリーである。
AdaReasonerは、(i)スケーラブルなデータキュレーションパイプラインによって、長期にわたる多段階のツールインタラクションにモデルを公開し、(ii)ツール-GRPO、(ii)ツールの選択とシークエンシングをエンドツーエンドの成功に基づいて優先順位付けする強化学習アルゴリズム、(iii)ツールの使用を動的に規制する適応学習メカニズムによって実現されている。
論文 参考訳(メタデータ) (2026-01-26T16:04:43Z) - Improving Large Language Models Function Calling and Interpretability via Guided-Structured Templates [56.73907811047611]
大規模言語モデル(LLM)は強力な推論とツール使用能力を示している。
LLMは、誤ったパラメータ化、悪いツールの選択、ユーザーの意図の誤解釈によって、現実世界のツールインタラクションで失敗することが多い。
我々は、構造化推論テンプレートを利用して、関数呼び出しを生成するためのより故意なステップバイステップ命令を通してLCMをガイドするカリキュラムに着想を得たフレームワークを提案する。
論文 参考訳(メタデータ) (2025-09-22T17:55:14Z) - Self-Challenging Language Model Agents [98.62637336505242]
本稿では,エージェントが自ら生成する高品質なタスクについて,エージェントを訓練するためのセルフチェンジフレームワークを提案する。
このフレームワークは、Llama-3.1-8B-Instructの2倍の改善を実現している。
論文 参考訳(メタデータ) (2025-06-02T14:23:33Z) - Learning to Use Tools via Cooperative and Interactive Agents [58.77710337157665]
ツール学習は、外部ツールを使用してユーティリティを拡張するエージェントとして、大きな言語モデル(LLM)を促進する。
ツール選択,ツール実行,アクションキャリブレーションの3つの特別なエージェントを個別にコーディネートする,協調型対話型エージェントフレームワークであるConAgentsを提案する。
3つのデータセットに対する実験により、LLMは、ConAgentsを装備した場合、大幅に改善されたベースラインよりも優れた性能を示した。
論文 参考訳(メタデータ) (2024-03-05T15:08:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。