論文の概要: The Bitter Lesson of Tool Calling
- arxiv url: http://arxiv.org/abs/2608.06370v1
- Date: Thu, 06 Aug 2026 17:58:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-07 15:25:20.999383
- Title: The Bitter Lesson of Tool Calling
- Title(参考訳): ツールコールの微妙な教訓
- Abstract要約: BFCL v4の14言語モデルにわたるネイティブツールコールとプログラムツールコールを比較した。
プログラムツール呼び出しのパラダイムでは、ツールは型付きPythonとして公開され、モデルがコードを通して呼び出し、実行と結果が1つのエージェントターンで処理される。
この結果から,プログラム型ツールコールはツールコールの代替として,リリース世代間でのパフォーマンストラッキングモデル機能を備えた,実用的で堅牢なツールコールであることが示された。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Tool use transforms LLMs into agents that act beyond their training data, and for code-capable models, programmatic tool calling extends this further by replacing rigid JSON calls with scripts that chain and parallelize naturally. However, a systematic evaluation of tools as code on an established benchmark across current and prior model generations under real-world task conditions has not been conducted. In this work, we empirically compare programmatic tool calling (PTC) to native JSON tool calling across 14 language models on BFCL v4. In the programmatic tool calling paradigm, tools are exposed as typed Python stubs that the model invokes through code, with execution and results handled in a single agent turn. Programmatic tool calling matches or exceeds native JSON tool calling in 11 of 14 models on BFCL v4, with the GPT-5.6 family achieving a 10.6% improvement over the JSON tool calling baseline. Further, it matches or outperforms baseline in 13 of 14 models under parallel fan-out, and holds stable under context rot conditions where baseline degrades 2.3% on average. Our results demonstrate that programmatic tool calling is a viable and robust alternative to JSON tool calling, with performance tracking model capability across release generations.
- Abstract(参考訳): ツールの使用は、LSMをトレーニングデータ以外のエージェントに変換し、コード対応モデルでは、プログラム的なツール呼び出しにより、厳格なJSON呼び出しを自然にチェーンし、並列化するスクリプトに置き換えることで、これをさらに拡張する。
しかし、実際のタスク条件下では、現在のモデル世代とそれ以前のモデル世代にまたがる、確立されたベンチマーク上のコードとしてのツールの体系的な評価は行われていない。
本研究では,プログラム型ツールコール(PTC)と,BFCL v4の14言語モデルに対するネイティブJSONツールコールを実証的に比較する。
プログラムツール呼び出しのパラダイムでは、ツールは型付きPythonスタブとして公開され、モデルがコードを通じて呼び出し、実行と結果が1つのエージェントターンで処理される。
プログラムツール呼び出しは、BFCL v4の14モデル中11モデルのネイティブJSONツール呼び出しと一致またはオーバーし、GPT-5.6ファミリーはJSONツール呼び出しベースラインよりも10.6%改善されている。
さらに、並列ファンアウトの下で14モデル中13モデルでベースラインにマッチまたは性能が向上し、ベースラインが平均2.3%低下する状況下で安定に保たれる。
我々の結果は、プログラム的なツール呼び出しがJSONツール呼び出しの代替として実現可能で堅牢であることを示し、リリース世代間でのパフォーマンストラッキングモデルが機能することを示しています。
関連論文リスト
- Joint Optimization of Tool Creation and Use for Large Language Model Agents [69.07066297088187]
SMITH (-grounded Multi-task Iterative Tool Honing) は、単一のポリシー内でツールの作成とツールの使用を訓練する。
SMITHで訓練された4B Qwen3は、正確に検証された13の手続き的推論タスクで、保持されたタスクで平均79.8のマクロ平均精度に達する。
また、TabMWP-Hardでは40.4、ドメイン外のGQAでは42.6に到達している。
論文 参考訳(メタデータ) (2026-08-25T13:59:34Z) - MM-ToolSandBox: A Unified Framework for Evaluating Visual Tool-Calling Agents [50.27505102982638]
本稿では,ツールコールエージェントのベンチマークおよび評価フレームワークであるMM-ToolSandBoxを紹介する。
このフレームワークは16のアプリケーションドメインで500以上のツールにまたがるステートフルな実行環境を提供する。
マルチイメージのマルチターンタスクをサポートしており、エージェントは実行可能ツールコールに徐々に視覚的な入力を入力しなければならない。
論文 参考訳(メタデータ) (2026-07-13T17:13:09Z) - HyperTool: Beyond Step-Wise Tool Calls for Tool-Augmented Agents [52.33697136670754]
textbfHyperToolは、実行可能なMPPスタイルのツールインターフェースで、ツール実行のモデル可視単位を変更する。
モデルはHyperToolをコードブロックで呼び出し、既存のツールを元のスキーマを通じて呼び出し、返却された値を操作し、中間結果をローカルに渡すことができる。
MCP-Universeでは、HyperToolは平均精度をQwen3-32Bで15.69%から35.29%、Qwen3-8Bで9.93%から33.33%に改善し、GPT-OSSとKimi-k2.5を平均で上回っている。
論文 参考訳(メタデータ) (2026-06-11T17:56:36Z) - UniToolCall: Unifying Tool-Use Representation, Data, and Evaluation for LLM Agents [22.52508596251479]
構築とデータセット生成から評価に至るまで,パイプライン全体を標準化するツール学習用統合フレームワークであるUniToolCallを提案する。
我々は、7つの公開ベンチマークを、関数呼び出し、ターン、会話のレベルできめ細かい評価を施した、クエリ-Action--Observation-Answer (QAOA) 表現に変換する。
Anchoror-Heavy Hybrid-20では、1ターンのStrict Precisionを93.0%達成し、GPT、Gemini、Claudeといった商用モデルを上回っている。
論文 参考訳(メタデータ) (2026-04-13T14:43:47Z) - The Tool Decathlon: Benchmarking Language Agents for Diverse, Realistic, and Long-Horizon Task Execution [86.4588675093384]
Toolathlonは、多様なアプリやツール、現実的な環境設定、信頼性の高い実行ベースの評価を提供する言語エージェントのベンチマークである。
このベンチマークには、手動でソースまたはクラフトされたタスクが108つ含まれており、平均20回以上にわたって複数のアプリと対話する必要がある。
Toolathlonは、より有能な言語エージェントを現実の長期タスク実行のために開発することを期待しています。
論文 参考訳(メタデータ) (2025-10-29T17:32:49Z) - Natural Language Tools: A Natural Language Approach to Tool Calling In Large Language Agents [0.0]
我々は,大規模言語モデルにおけるプログラムツール呼び出しを自然言語出力に置き換えるフレームワークであるNatural Language Tools (NLT)を提示する。
NLTはツール呼び出しの精度を18.4ポイント改善し、出力分散を70%削減した。
オープンウェイトモデルは最大の伸びを示し、フラッグシップのクローズドウェイトモデルを上回っている。
論文 参考訳(メタデータ) (2025-10-16T08:52:52Z) - RLFactory: A Plug-and-Play Reinforcement Learning Post-Training Framework for LLM Multi-Turn Tool-Use [50.52940111891476]
大きな言語モデルは基本的な推論では優れているが、外部ツールとのインタラクションを必要とするタスクには苦労する。
マルチラウンドツール用プラグイン・アンド・プレイ強化学習フレームワークであるRLFactoryを提案する。
論文 参考訳(メタデータ) (2025-08-31T16:47:31Z) - ToolHop: A Query-Driven Benchmark for Evaluating Large Language Models in Multi-Hop Tool Use [51.43211624452462]
995のユーザクエリと3,912の関連ツールからなるデータセットであるToolHopを提示する。
ToolHopは、多様なクエリ、意味のある相互依存性、ローカル実行可能なツール、詳細なフィードバック、検証可能な回答を保証する。
5つのモデルファミリーにまたがる14のLSMを評価し、マルチホップツールの使用シナリオを扱う上で重要な課題を明らかにした。
論文 参考訳(メタデータ) (2025-01-05T11:06:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。