論文の概要: Beyond Function Calling: Benchmarking Tool-Using Agents under Tool-Environment Unreliability
- arxiv url: http://arxiv.org/abs/2606.25819v2
- Date: Sat, 27 Jun 2026 07:38:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 13:45:02.040094
- Title: Beyond Function Calling: Benchmarking Tool-Using Agents under Tool-Environment Unreliability
- Title(参考訳): 関数呼び出しを超えて: ツール環境の信頼性の下でのベンチマークツール使用エージェント
- Authors: Yang Tian, Zhengpeng Shi, Yu Zhou, Bo Zhao,
- Abstract要約: 本稿では,信頼性評価のためのベンチマークであるToolBench-Xを紹介する。
クリーンなツール環境から始めると、ToolBench-Xは5つの構造化ハザードタイプを注入する。
信頼性のあるツールでうまく機能するエージェントは、回復可能なハザードの下で失敗することが多い。
- 参考スコア(独自算出の注目度): 14.862168786900382
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models are increasingly deployed as agents that solve tasks by interacting with external tool environments. Although recent tool-use benchmarks increasingly cover complex task settings, they still largely assume clean, stable, and trustworthy tool environments, leaving tool-environment unreliability insufficiently examined. We introduce ToolBench-X, a benchmark for evaluating agents under recoverable reliability hazards. ToolBench-X contains executable multi-step tasks across diverse domains and sequential, parallel, and mixed workflows, each paired with deterministic tools and a canonical final answer for automatic evaluation. Starting from clean tool environments, ToolBench-X injects five structured hazard types: Specification Drift, Invocation Error, Execution Failure, Output Drift, and Cross-source Conflict. Crucially, each injected instance remains solvable through at least one valid recovery path, such as retrying, fallback, verification, or cross-checking. Experiments reveal a substantial reliability gap: agents that perform well with reliable tools often fail under recoverable hazards. Further analysis shows that failures are driven less by tool-use volume or inference budget than by limited hazard diagnosis and ineffective recovery. Targeted recovery hints recover many failed tasks, while test-time scaling yields more limited gains. These results suggest that tool-use evaluation should move beyond function-call accuracy toward task completion under unreliable tool environments. The code and data is available at https://github.com/Foreverskyou/ToolBench-X.
- Abstract(参考訳): 大規模な言語モデルは、外部ツール環境とのインタラクションによってタスクを解決するエージェントとして、ますます多くデプロイされている。
最近のツール使用ベンチマークでは、複雑なタスク設定をカバーしているが、クリーンで安定しており、信頼できるツール環境を前提としており、ツール環境の信頼性を十分に検証していない。
本稿では,信頼性評価のためのベンチマークであるToolBench-Xを紹介する。
ToolBench-Xには、さまざまなドメインとシーケンシャル、並列、混合ワークフローにわたる実行可能なマルチステップタスクが含まれている。
クリーンなツール環境から始めると、ToolBench-Xは5つの構造化されたハザードタイプを注入する。
重要なことに、各インジェクトされたインスタンスは、リトライ、フォールバック、検証、クロスチェックなど、少なくとも1つの有効なリカバリパスを通じて解決可能である。
信頼性のあるツールでうまく機能するエージェントは、回復可能なハザードの下で失敗することが多い。
さらなる分析により、障害はツール使用量や推論予算によって、限られた危険診断と非効率な回復によって、より少なく駆動されることが示された。
目標とするリカバリのヒントは、多くの失敗したタスクをリカバリする一方で、テストタイムのスケーリングは、より限定的な利得をもたらす。
これらの結果から, ツール使用評価は, 信頼性の低いツール環境下でのタスク完了に向けて, 関数呼び出し精度を超えて進めるべきであることが示唆された。
コードとデータはhttps://github.com/Foreverskyou/ToolBench-X.comで公開されている。
関連論文リスト
- PlanBench-XL: Evaluating Long-Horizon Planning of LLM Tool-Use Agents in Large-Scale Tool Ecosystems [59.730861364166174]
PlanBench-XLは、327の小売タスクを1,665以上のツールでインタラクティブにベンチマークする。
エージェントが使用可能なツールを反復的に検索できるかどうかをテストし、最終目標に対するその後の呼び出しの中間的証拠を明らかにするためにそれらを呼び出す。
論文 参考訳(メタデータ) (2026-06-21T08:29:12Z) - SING: Synthetic Intention Graph for Scalable Active Tool Discovery in LLM Agents [64.59100414726556]
大規模言語モデル(LLM)エージェントは、コンテキスト、ツール、マルチターン実行を管理するハーネスに依存している。
Retrieval-augmented Tool selectionは、自然な代替手段を提供するが、既存のワンショット検索方法は、独立したツール記述とエージェントの真のタスク意図との整合に失敗する。
我々は、ユーザ意図、ツール機能、ツールコラボレーションパターンをリンクするインテントツーオールグラフを構築する、意図認識型のアクティブツール発見フレームワークであるSINGを提案する。
論文 参考訳(メタデータ) (2026-06-15T11:37:37Z) - TRACER: Verifiable Generative Provenance for Multimodal Tool-Using Agents [19.156453695628013]
マルチモーダル・ツール・ユース・エージェントにおけるジェネレーティブ・プロビデンスを検証するためのフレームワークであるTRACERを紹介する。
TraCERは、サポートツールターン、エビデンスユニット、セマンティックサポート関係を識別する構造化された証明レコードとともに、各回答文を生成する。
Qwen3-VL-8Bでは、TRACERは78.23%の回答精度と95.72%の要約精度に達し、最強のクローズドソースツール強化ベースラインを23.80ポイント上回った。
論文 参考訳(メタデータ) (2026-05-11T03:32:55Z) - Beyond the Black Box: Interpretability of Agentic AI Tool Use [0.0]
本稿では,スパースオートエンコーダと線形プローブ上に構築された機械論的・解釈可能性ツールキットを提案する。
フレームワークは各アクションの前にモデル状態を読み出し、ツールが必要かどうか、そして次のツールアクションがいかに適切かの両方を推測する。
我々は、NVIDIA Nemotron関数呼び出しデータセットから多段階の軌道上のプローブをトレーニングし、GPT-OSS 20BとGemma 3 27Bモデルに同じワークフローを適用する。
論文 参考訳(メタデータ) (2026-05-07T19:47:30Z) - Open, Reliable, and Collective: A Community-Driven Framework for Tool-Using AI Agents [22.64138018985385]
我々は、失敗は、ツール使用精度(エージェントがどのようにツールを呼び出すか)と固有のツール精度(ツール自身の正確性)の両方から生じると論じている。
ツールスキーマを標準化するコミュニティ主導のツールボックスであるOpenToolsを紹介します。
OpenToolsには、コアフレームワーク、初期ツールセット、評価パイプライン、コントリビューションプロトコルが含まれている。
論文 参考訳(メタデータ) (2026-03-31T18:42:36Z) - AgentProcessBench: Diagnosing Step-Level Process Quality in Tool-Using Agents [50.481033105867205]
我々はAgentProcessBenchを紹介した。AgentProcessBenchは、現実的なツール拡張トラジェクトリにおけるステップレベルの有効性を評価するための最初のベンチマークである。
ベンチマークは、1,000の多様な軌跡と8,509の人間ラベル付きステップアノテーションと89.1%のアノテーション間合意で構成されている。
探索をキャプチャする3つのラベリングスキームと、ラベルのあいまいさを減らすためのエラー伝搬ルールを備えている。
論文 参考訳(メタデータ) (2026-03-15T16:13:58Z) - ToolMATH: A Math Tool Benchmark for Realistic Long-Horizon Multi-Tool Reasoning [11.99927786717109]
ToolMATHは、数学の問題をツールセットによる制御された正当性チェック可能なベンチマークに変換する。
ToolMATHは、ツール拡張されたエージェントの障害モードの実行可能な診断証拠を提供する。
論文 参考訳(メタデータ) (2026-02-24T09:23:12Z) - ToolGym: an Open-world Tool-using Environment for Scalable Agent Testing and Data Curation [42.479399507055454]
一般的な204のアプリにまたがって,571フォーマットの統一ツール上に構築された,オープンワールドのツール使用環境を紹介します。
これには、ロングホライゾンを合成するタスク生成エンジン、ワイルド制約付きマルチツール、ストレス-テストの堅牢性に割り込みと失敗を注入するステートコントローラが含まれる。
最先端のLLMの総合評価では、ツール計画と実行能力の相違、既存のLLMの弱点に続く制約、DeepSeek-v3.2の強靭さが明らかにされている。
論文 参考訳(メタデータ) (2026-01-09T21:59:31Z) - DeepAgent: A General Reasoning Agent with Scalable Toolsets [111.6384541877723]
DeepAgentは、自律的な思考、ツール発見、アクション実行を実行するエンドツーエンドのディープ推論エージェントである。
長期にわたる相互作用の課題に対処するために,過去の相互作用を構造化エピソード,動作,ツール記憶に圧縮する自律的メモリ折り畳み機構を導入する。
LLMシミュレートされたAPIを活用し、ツール呼び出しトークンにきめ細かいクレジットを割り当てるツールコールアドバンテージ属性を適用した、エンドツーエンドの強化学習戦略であるToolPOを開発した。
論文 参考訳(メタデータ) (2025-10-24T16:24:01Z) - ToolLibGen: Scalable Automatic Tool Creation and Aggregation for LLM Reasoning [80.10274552177096]
外部ツールを備えたLarge Language Models (LLM) は、複雑な推論タスクにおけるパフォーマンスの向上を実証している。
このツールに強化された推論が広く採用されるのは、ドメイン固有のツールが不足しているためである。
構造化ツールライブラリに非構造化ツールのコレクションを自動的に組み込むための体系的なアプローチを提案する。
論文 参考訳(メタデータ) (2025-10-09T04:11:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。