論文の概要: ToolFailBench: Diagnosing Tool-Use Failures in LLM Agents
- arxiv url: http://arxiv.org/abs/2607.04686v1
- Date: Mon, 06 Jul 2026 05:25:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:30.049854
- Title: ToolFailBench: Diagnosing Tool-Use Failures in LLM Agents
- Title(参考訳): ToolFailBench: LLMエージェントのツール使用障害の診断
- Authors: Harsh Soni,
- Abstract要約: ToolFailBenchは、ツール使用障害を測定するための診断ベンチマークである。
それぞれのトレースをTool-Skip、Result-Ignore、Output-Fabrication、Unnecessary-Tool-Useとラベル付けします。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Tool calling is central to modern language model agents, but aggregate benchmark scores often hide where tool use fails. A model that never calls a needed tool and a model that calls the tool but ignores the result can look similar under final task accuracy. We introduce ToolFailBench, a diagnostic benchmark for measuring tool-use failures across 1,000 tasks in finance, medicine, law, cybersecurity, and real estate. Tool-required tasks return values the model wouldn't guess, forcing it to trust the tool while control tasks attach the same tools but should be answered directly. We label each trace with Tool-Skip, Result-Ignore, Output-Fabrication, and Unnecessary-Tool-Use, using a rule classifier and two LLM judges aggregated by majority vote. Across 19 headline models, the best reaches 86.33% Clean Tool-Use Rate, showing that faithful tool use is not saturated. More importantly, models with similar aggregate scores fail in different ways: most stay disciplined on no-tool controls, while Llama-3.1 models show an Always-Call pattern, and at the same parameter scale Llama-3.1-70B and Qwen2.5-72B differ by 89 percentage points on control-task accuracy. Tool-use evaluation should measure not only whether agents call tools, but whether they use tool outputs correctly and avoid tools when none is needed.
- Abstract(参考訳): ツール呼び出しは、モダンな言語モデルエージェントの中心であるが、集計ベンチマークスコアは、ツールの使用が失敗する場所を隠していることが多い。
必要なツールを決して呼び出さないモデルと、ツールを呼び出すが、結果を無視するモデルは、最終タスクの正確さの下で類似しているように見える。
ToolFailBenchは、金融、医療、法律、サイバーセキュリティ、不動産における1000のタスクにわたるツール使用障害を測定するための診断ベンチマークである。
制御タスクは同じツールをアタッチするが、直接答えるべきである。
ルール分類器と2人のLCM審査員を多数決で集計し,各トレースをTool-Skip, Result-Ignore, Output-Fabrication, Unnesary-Tool-Useにラベル付けした。
19本のヘッドラインモデルで、最高は86.33%のクリーンツール使用率に達し、忠実なツールの使用が飽和していないことを示している。
Llama-3.1モデルはAlways-Callパターンを示し、同じパラメータスケールのLlama-3.1-70BとQwen2.5-72Bは制御タスクの精度で89パーセント異なる。
ツール使用評価は、エージェントがツールを呼び出すかどうかを測定するだけでなく、ツールアウトプットを正しく使用するかどうかを測定し、不要な場合にはツールを避ける必要がある。
関連論文リスト
- HyperTool: Beyond Step-Wise Tool Calls for Tool-Augmented Agents [52.33697136670754]
textbfHyperToolは、実行可能なMPPスタイルのツールインターフェースで、ツール実行のモデル可視単位を変更する。
モデルはHyperToolをコードブロックで呼び出し、既存のツールを元のスキーマを通じて呼び出し、返却された値を操作し、中間結果をローカルに渡すことができる。
MCP-Universeでは、HyperToolは平均精度をQwen3-32Bで15.69%から35.29%、Qwen3-8Bで9.93%から33.33%に改善し、GPT-OSSとKimi-k2.5を平均で上回っている。
論文 参考訳(メタデータ) (2026-06-11T17:56:36Z) - Do Multimodal Agents Really Benefit from Tool Use? A Systematic Study of Capability Gains [20.11899219087138]
画像のエージェントであるThymeとDeepEyesV2を用いて、現実世界の理解、OCR、チャート理解、数学的推論の2つの代表的思考について検討する。
ツールアクセスは、一貫した集約的改善がほとんど得られず、生成したコストを確実に削減することができず、小さなツールのみの解決セットのみを残している。
論文 参考訳(メタデータ) (2026-06-01T15:04:25Z) - Model-Adaptive Tool Necessity Reveals the Knowing-Doing Gap in LLM Tool Use [47.29360932085394]
大規模言語モデル(LLM)は、外部ツールを呼び出す時と直接答える時を判断しなければならない自律的なエージェントとして、ますます機能します。
本稿では,各モデルの経験的性能に基づいて,ツール必要度をモデル適応的に定義する。
その結果,26.5~54.0%,30.8~41.8%のミスマッチが認められた。
論文 参考訳(メタデータ) (2026-05-13T18:59:28Z) - When to Trust Tools? Adaptive Tool Trust Calibration For Tool-Integrated Math Reasoning [58.75883713573783]
Tool-Integrated Reasoningは、推論軌道にツール呼び出しと実行を組み込む有望なパラダイムとして登場した。
モデルの推論がツールの結果と矛盾する場合、モデルは自身の推論を信じる傾向にあります。
アダプティブ・ツール・トラスト(ATTC、Adaptive Tool Trust)は、モデルに対して、ツール結果の信頼性や無視を適応的に選択するフレームワークである。
論文 参考訳(メタデータ) (2026-04-09T14:14:37Z) - ToolMATH: A Math Tool Benchmark for Realistic Long-Horizon Multi-Tool Reasoning [11.99927786717109]
ToolMATHは、数学の問題をツールセットによる制御された正当性チェック可能なベンチマークに変換する。
ToolMATHは、ツール拡張されたエージェントの障害モードの実行可能な診断証拠を提供する。
論文 参考訳(メタデータ) (2026-02-24T09:23:12Z) - AdaReasoner: Dynamic Tool Orchestration for Iterative Visual Reasoning [66.24374176797075]
textbfAdaReasonerは、ツール固有の、あるいは明示的な教師付き行動ではなく、一般的な推論スキルとしてツールの使用を学ぶマルチモーダルモデルのファミリーである。
AdaReasonerは、(i)スケーラブルなデータキュレーションパイプラインによって、長期にわたる多段階のツールインタラクションにモデルを公開し、(ii)ツール-GRPO、(ii)ツールの選択とシークエンシングをエンドツーエンドの成功に基づいて優先順位付けする強化学習アルゴリズム、(iii)ツールの使用を動的に規制する適応学習メカニズムによって実現されている。
論文 参考訳(メタデータ) (2026-01-26T16:04:43Z) - Chain-of-Tools: Utilizing Massive Unseen Tools in the CoT Reasoning of Frozen Language Models [8.573278807410507]
ツール学習は、大きな言語モデル(LLM)の使用シナリオをさらに広げることができる。
本稿では,新しいツール学習手法であるChain-of-Toolsを提案する。
CoT推論でツール呼び出しを終了するために、フリーズLDMの強力なセマンティック表現機能をフル活用する。
論文 参考訳(メタデータ) (2025-03-21T01:26:12Z) - Large Language Models as Tool Makers [85.00361145117293]
我々はLLM A s Tool Makers (LATM) と呼ばれるクローズドループフレームワークを導入する。
ツール作成: 1 つのツール作成: LLM がタスクセットのためのツールを作成するツールメーカとして機能する 2 つのツール使用: 別の LLM がツールユーザとして機能し、ツールメーカが問題解決のために構築したツールを適用する。
論文 参考訳(メタデータ) (2023-05-26T17:50:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。