論文の概要: The Tool Illusion: Rethinking Tool Use in Web Agents
- arxiv url: http://arxiv.org/abs/2604.03465v1
- Date: Fri, 03 Apr 2026 21:18:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-07 15:49:18.594246
- Title: The Tool Illusion: Rethinking Tool Use in Web Agents
- Title(参考訳): ツールIllusion: Webエージェントで使うツールを再考する
- Abstract要約: 我々は、広範囲かつ慎重に制御された研究を通じて、Webエージェントにおけるツールの使用を再考する。
いずれの結論も事前の結論を再検討し, より広範な証拠で他の結論を補完した。
- 参考スコア(独自算出の注目度): 60.49303190288166
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As web agents rapidly evolve, an increasing body of work has moved beyond conventional atomic browser interactions and explored tool use as a higher-level action paradigm. Although prior studies have shown the promise of tools, their conclusions are often drawn from limited experimental scales and sometimes non-comparable settings. As a result, several fundamental questions remain unclear: i) whether tools provide consistent gains for web agents, ii) what practical design principles characterize effective tools, and iii) what side effects tool use may introduce. To establish a stronger empirical foundation for future research, we revisit tool use in web agents through an extensive and carefully controlled study across diverse tool sources, backbone models, tool-use frameworks, and evaluation benchmarks. Our findings both revise some prior conclusions and complement others with broader evidence. We hope this study provides a more reliable empirical basis and inspires future research on tool-use web agents.
- Abstract(参考訳): Webエージェントが急速に進化するにつれて、従来のアトミックブラウザのインタラクションを超えて、より高度なアクションパラダイムとしてのツールの使用を探求する動きが増えている。
以前の研究ではツールの約束が示されていたが、その結論はしばしば限られた実験スケールと時には比較不可能な設定から導かれる。
その結果、いくつかの根本的な疑問が残る。
一 ツールがウェブエージェントに一貫した利益をもたらすか否か。
二 実用設計原則が有効な道具を特徴付けるもの
三 副作用用具の活用により、どのような効果が生じるか。
将来の研究のためのより強力な実証的基盤を確立するため、さまざまなツールソース、バックボーンモデル、ツール使用フレームワーク、評価ベンチマークなどにわたる、広範囲かつ慎重に制御された研究を通じて、Webエージェントでのツール使用を再考する。
いずれの結論も事前の結論を再検討し, より広範な証拠で他の結論を補完した。
この研究がより信頼性の高い実証的基盤を提供し、ツール利用ウェブエージェントの将来の研究に刺激を与えてくれることを願っている。
関連論文リスト
- Diversity Over Frequency: Rethinking Tool Use in Visual Chain-of-Thought Agents [8.575257729172202]
視覚エージェントは、微粒な証拠を組み込むために、思考の視覚連鎖の中で外部視覚ツールを使用する。
本稿では,3次元空間推論や医用視覚質問応答など,より困難な課題を探索するために,単純な視覚探索タスクを超えて進める。
モデルは、高いタスク精度を達成しながら、ツールの使用を徐々に停止する。
バニラトレーニングとツール使用促進の両方がロールアウトの多様性を減らし、ツールの使用率が向上しない理由を説明する。
論文 参考訳(メタデータ) (2026-05-25T13:06:59Z) - ARMOR: An Agentic Framework for Reaction Feasibility Prediction via Adaptive Utility-aware Multi-tool Reasoning [11.65859277511507]
ARMORは、ツール固有のユーティリティを明示的にモデル化し、ツールを適応的に優先順位付けし、潜在的なツール競合を解決するエージェントフレームワークである。
公開データセットの実験では、ARMORが強いベースラインを一貫して上回っていることが示されている。
論文 参考訳(メタデータ) (2026-05-08T01:30:20Z) - Agentic Tool Use in Large Language Models [33.63702247846896]
本稿では,本論文をプラグアンドプレイ,教師付きツール学習,報酬駆動型ツールポリシー学習の3つのパラダイムに分類する。
この断片化に対処し、エージェントツールの使用に関するより構造化された進化的なビューを提供することを目的としている。
論文 参考訳(メタデータ) (2026-04-01T12:46:51Z) - Which Tool Response Should I Trust? Tool-Expertise-Aware Chest X-ray Agent with Multimodal Agentic Learning [11.117796080402044]
本稿では,エージェントがツールと対話し,実践的信頼性を実証的に学習することを可能にする枠組みを提案する。
具体的インスタンス化として,胸部X線分析に焦点をあて,ツールに精通した胸部X線剤を提案する。
ツール出力が不一致になると、エージェントは実験的にマルチモーダルツールの結果を受け入れたり拒否したりし、報酬を受け取り、クエリタイプごとにどのツールを信頼するかを学ぶ。
論文 参考訳(メタデータ) (2026-02-25T03:09:47Z) - AdaReasoner: Dynamic Tool Orchestration for Iterative Visual Reasoning [66.24374176797075]
textbfAdaReasonerは、ツール固有の、あるいは明示的な教師付き行動ではなく、一般的な推論スキルとしてツールの使用を学ぶマルチモーダルモデルのファミリーである。
AdaReasonerは、(i)スケーラブルなデータキュレーションパイプラインによって、長期にわたる多段階のツールインタラクションにモデルを公開し、(ii)ツール-GRPO、(ii)ツールの選択とシークエンシングをエンドツーエンドの成功に基づいて優先順位付けする強化学習アルゴリズム、(iii)ツールの使用を動的に規制する適応学習メカニズムによって実現されている。
論文 参考訳(メタデータ) (2026-01-26T16:04:43Z) - Transductive Visual Programming: Evolving Tool Libraries from Experience for Spatial Reasoning [63.071280297939005]
提案するTransductive Visual Programming (TVP, Transductive Visual Programming) は、投機ではなく、独自の経験から新しいツールを構築する新しいフレームワークである。
TVPは最先端のパフォーマンスを達成し、GPT-4oを22%上回り、以前の最高のビジュアルプログラミングシステムを11%上回っている。
私たちの研究は、自己進化型ビジュアルプログラミングエージェントを構築するための強力なパラダイムとして、経験駆動型トランスダクティブツールの作成を確立します。
論文 参考訳(メタデータ) (2025-12-24T04:30:21Z) - TheMCPCompany: Creating General-purpose Agents with Task-specific Tools [12.249551019598442]
TheMCPCompanyは、様々な現実世界のサービスと対話するタスクにおいて、ツールコールエージェントを評価するためのベンチマークである。
また、各タスクに手動でアノテートされた接地木ツールも提供します。
全体として、我々の研究は、最も高度な推論モデルは、より単純な環境でツールを見つけるのに効果的であるが、複雑なエンタープライズ環境をナビゲートするのに深刻な苦労をしていることを示している。
論文 参考訳(メタデータ) (2025-10-22T06:42:01Z) - PaperArena: An Evaluation Benchmark for Tool-Augmented Agentic Reasoning on Scientific Literature [11.804526152911386]
本研究では,大規模言語モデル(LLM)に基づくエージェントの評価ベンチマークであるPaperArenaを提案する。
研究上の疑問から、エージェントは推論や適切なツールとのインタラクションを通じて、複数の論文にまたがる多様なフォーマットを統合する必要がある。
実験の結果、高度に確立されたエージェントを駆動する最も先進的なLCMでさえ、平均精度は38.78%に過ぎなかった。
論文 参考訳(メタデータ) (2025-10-13T02:10:39Z) - Towards Completeness-Oriented Tool Retrieval for Large Language Models [60.733557487886635]
現実世界のシステムは多種多様なツールを組み込んでおり、全てのツールを大規模言語モデルに入力することは不可能である。
既存のツール検索手法は主にユーザクエリとツール記述間のセマンティックマッチングに焦点を当てている。
我々は,ユーザクエリとツール記述のセマンティックな類似性だけでなく,ツールの協調的情報も考慮した,新しいモデル診断型協調学習型ツール検索手法であるCOLTを提案する。
論文 参考訳(メタデータ) (2024-05-25T06:41:23Z) - EASYTOOL: Enhancing LLM-based Agents with Concise Tool Instruction [56.02100384015907]
EasyToolは、多種多様で長いツールドキュメントを統一的で簡潔なツール命令に変換するフレームワークである。
トークン使用量を大幅に削減し、現実のシナリオにおけるツール利用のパフォーマンスを向上させることができる。
論文 参考訳(メタデータ) (2024-01-11T15:45:11Z) - Tool Learning with Foundation Models [158.8640687353623]
基礎モデルの出現により、AIシステムは、人間としてのツールの使用に等しく適応できる可能性がある。
その大きな可能性にもかかわらず、この分野における重要な課題、機会、そして将来の取り組みに関する包括的な理解はいまだに欠けている。
論文 参考訳(メタデータ) (2023-04-17T15:16:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。