論文の概要: Screenshots or Tools? Eliciting Tool Use and Managing Multimodal Context in Hybrid GUI-MCP Computer-Use Agents
- arxiv url: http://arxiv.org/abs/2608.03327v1
- Date: Tue, 04 Aug 2026 08:35:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.101762
- Title: Screenshots or Tools? Eliciting Tool Use and Managing Multimodal Context in Hybrid GUI-MCP Computer-Use Agents
- Title(参考訳): スクリーンショットかツールか? ハイブリッドGUI-MCPコンピュータ利用エージェントにおけるツール使用とマルチモーダルコンテキストの管理
- Abstract要約: ツールを持つことは、その効果がどの方向に進むかに落ち着かない。
推論モデルはこれらの失敗を避けるが、ツール修正可能なタスクの23.9%である55/309タスクのみをツールと呼ぶ。
ボトルネックはツールコールセマンティクスにある。
- 参考スコア(独自算出の注目度): 20.08454833886751
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Hybrid computer-use agents can act through screenshots or call text tools. We find that having a tool available does not settle which way the effect goes. Under one identical GUI-MCP harness on the OSWorld-MCP benchmark (309 tasks), the same MCP tools improve a reasoning model by +4.0pp and degrade a non-reasoning model by -5.9pp (5 runs each, both beyond 2 SE). What separates the two is tool-decision behavior. The non-reasoning policy ignores, misnames, or falsely terminates around tools. The reasoning model avoids these failures, yet still calls a tool on only 55/309 tasks, 23.9% of the tool-reachable ones. We call this shortfall the adoption gap. Both levels of the problem share one cause: the model already has a cheaper route and is never trained to take it. Multi-turn RL probes that cause. At the action level, a dense tool bonus raises spreadsheet adoption 0.03 -> 0.33 and carries into greedy decoding, but held-out accuracy does not follow. Behavior is steerable; competence is not. The bottleneck lies in tool-call semantics. At the context level, a successful tool call often makes the next screenshot redundant. Dropping it and halving image history cuts input tokens by about a third, at a small accuracy cost. Retraining under the same observation rule removes that cost. The compressed agent then reaches 37.8% against 33.0% for the uncompressed operating point, at 53% of the input cost, and closes the rich-lean gap on a pre-registered degraded subset to zero. Tools help when the model chooses and integrates them, and current hybrid agents leave many such choices unused.
- Abstract(参考訳): ハイブリッドコンピュータ利用エージェントは、スクリーンショットを通じて動作したり、テキストツールを呼び出すことができる。
利用可能なツールがなければ、その効果がどの方向に進むかは解決できません。
OSWorld-MCPベンチマーク(309タスク)で同一のGUI-MCPハーネスの下では、同一のMPPツールが推論モデルを+4.0pp改善し、非推論モデルを-5.9pp(それぞれ5回、それぞれ2 SE以上)で分解する。
2つを分けるのはツールの判断行動です。
非合理的なポリシーは、ツールの周りで無視、ミスネーム、または誤って終了する。
推論モデルはこれらの失敗を避けるが、ツール修正可能なタスクの23.9%である55/309タスクのみをツールと呼ぶ。
私たちはこの不足を採用ギャップと呼んでいる。
モデルはすでにより安価なルートを持ち、それを取るように訓練されることは決してありません。
マルチターンRLプローブはその原因である。
アクションレベルでは、高密度ツールボーナスはスプレッドシートの採用率0.03 -> 0.33を高め、グリージーなデコーディングを行うが、ホールドアウトの精度は従わない。
行動は操縦可能であり、能力はそうではない。
ボトルネックはツールコールセマンティクスにある。
コンテキストレベルでは、成功したツールコールは、しばしば次のスクリーンショットを冗長にする。
ドロップして画像履歴を半減すると、入力トークンは約3分の1削減され、精度は低い。
同じ観察規則の下でのトレーニングは、そのコストを削減します。
圧縮剤は、非圧縮動作点の33.0%に対して37.8%に達し、入力コストの53%に達し、予め登録された劣化したサブセットのリッチリーンギャップを0に閉じる。
モデルはモデルを選択して統合するのに役立つツールであり、現在のハイブリッドエージェントはそのような選択の多くを未使用のままにしておく。
関連論文リスト
- Joint Optimization of Tool Creation and Use for Large Language Model Agents [69.07066297088187]
SMITH (-grounded Multi-task Iterative Tool Honing) は、単一のポリシー内でツールの作成とツールの使用を訓練する。
SMITHで訓練された4B Qwen3は、正確に検証された13の手続き的推論タスクで、保持されたタスクで平均79.8のマクロ平均精度に達する。
また、TabMWP-Hardでは40.4、ドメイン外のGQAでは42.6に到達している。
論文 参考訳(メタデータ) (2026-08-25T13:59:34Z) - ToolFailBench: Diagnosing Tool-Use Failures in LLM Agents [0.0]
ToolFailBenchは、ツール使用障害を測定するための診断ベンチマークである。
それぞれのトレースをTool-Skip、Result-Ignore、Output-Fabrication、Unnecessary-Tool-Useとラベル付けします。
論文 参考訳(メタデータ) (2026-07-06T05:25:21Z) - HyperTool: Beyond Step-Wise Tool Calls for Tool-Augmented Agents [52.33697136670754]
textbfHyperToolは、実行可能なMPPスタイルのツールインターフェースで、ツール実行のモデル可視単位を変更する。
モデルはHyperToolをコードブロックで呼び出し、既存のツールを元のスキーマを通じて呼び出し、返却された値を操作し、中間結果をローカルに渡すことができる。
MCP-Universeでは、HyperToolは平均精度をQwen3-32Bで15.69%から35.29%、Qwen3-8Bで9.93%から33.33%に改善し、GPT-OSSとKimi-k2.5を平均で上回っている。
論文 参考訳(メタデータ) (2026-06-11T17:56:36Z) - Do Multimodal Agents Really Benefit from Tool Use? A Systematic Study of Capability Gains [20.11899219087138]
画像のエージェントであるThymeとDeepEyesV2を用いて、現実世界の理解、OCR、チャート理解、数学的推論の2つの代表的思考について検討する。
ツールアクセスは、一貫した集約的改善がほとんど得られず、生成したコストを確実に削減することができず、小さなツールのみの解決セットのみを残している。
論文 参考訳(メタデータ) (2026-06-01T15:04:25Z) - LLM Agents Already Know When to Call Tools -- Even Without Reasoning [25.40369702634587]
LLMエージェントは、たとえモデルが直接答えられるとしても、ツールを無差別に呼び出す傾向がある。
ツールコールが実際に必要になった場合、既存のベンチマークは体系的に研究されない。
ツールの必要性の3つのカテゴリにまたがる18の環境のベンチマークである When2Tool を提案する。
論文 参考訳(メタデータ) (2026-05-10T01:37:40Z) - When to Trust Tools? Adaptive Tool Trust Calibration For Tool-Integrated Math Reasoning [58.75883713573783]
Tool-Integrated Reasoningは、推論軌道にツール呼び出しと実行を組み込む有望なパラダイムとして登場した。
モデルの推論がツールの結果と矛盾する場合、モデルは自身の推論を信じる傾向にあります。
アダプティブ・ツール・トラスト(ATTC、Adaptive Tool Trust)は、モデルに対して、ツール結果の信頼性や無視を適応的に選択するフレームワークである。
論文 参考訳(メタデータ) (2026-04-09T14:14:37Z) - From Proof to Program: Characterizing Tool-Induced Reasoning Hallucinations in Large Language Models [18.072434766310458]
ツール拡張言語モデル(TaLM)は、パラメトリック能力を超えた問題を解決するために外部ツールを呼び出すことができる。
ツールが正しく選択され、実行されたとしても、TaLMは推論の代用としてツール出力を扱います。
論文 参考訳(メタデータ) (2025-11-14T02:21:34Z) - OSWorld-MCP: Benchmarking MCP Tool Invocation In Computer-Use Agents [49.34040731113563]
我々は,コンピュータ利用エージェントのツール実行,GUI操作,意思決定能力を評価するための,最初の総合的かつ公正なベンチマークであるOSWorld-MCPを提案する。
厳密な手作業による検証は158の高品質なツールをもたらし、それぞれが正しい機能、実用性、汎用性を検証します。
OSWorld-MCPはマルチモーダルエージェントの理解を深め、複雑なツール支援環境でのパフォーマンスを評価するための新しい標準を設定している。
論文 参考訳(メタデータ) (2025-10-28T15:56:36Z) - ToolTweak: An Attack on Tool Selection in LLM-based Agents [52.17181489286236]
対戦相手は,特定のツールの選択に対して,エージェントを体系的にバイアスし,等しく有能な代替手段に対して不公平な優位性を得ることができることを示す。
提案するToolTweakは,ベースラインの20%程度から最大81%までの選択率を向上する,軽量自動攻撃である。
これらのリスクを軽減するために、パラフレージングとパープレキシティ・フィルタリングという2つの防御効果を評価し、バイアスを低減し、エージェントが機能的に類似したツールをより平等に選択できるようにする。
論文 参考訳(メタデータ) (2025-10-02T20:44:44Z) - MICE for CATs: Model-Internal Confidence Estimation for Calibrating Agents with Tools [54.63478102768333]
十分に校正されたモデル信頼度は、潜在的な行動の報酬に対するリスクを測るために使用することができる。
本稿では,ツール呼び出し時の信頼度を評価するために,モデル内信頼度推定器(MICE)の新たなクラスを提案する。
論文 参考訳(メタデータ) (2025-04-28T18:06:38Z) - SMART: Self-Aware Agent for Tool Overuse Mitigation [58.748554080273585]
現在のLarge Language Model (LLM) エージェントは、強力な推論とツールの使用能力を示すが、しばしば自己認識に欠ける。
この不均衡はツール・オーバーユースにつながり、モデルはパラメトリックな知識を持つタスクに対して、不要に外部ツールに依存する。
SMART(Strategic Model-Aware Reasoning with Tools)は、エージェントの自己認識を高め、タスクハンドリングを最適化し、ツールの過剰使用を減らすパラダイムである。
論文 参考訳(メタデータ) (2025-02-17T04:50:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。