論文の概要: API-Bank: A Benchmark for Tool-Augmented LLMs
- arxiv url: http://arxiv.org/abs/2304.08244v1
- Date: Fri, 14 Apr 2023 14:05:32 GMT
- ステータス: 処理完了
- システム内更新日: 2023-04-18 15:18:20.652387
- Title: API-Bank: A Benchmark for Tool-Augmented LLMs
- Title(参考訳): API-Bank: ツール拡張LDMのベンチマーク
- Authors: Minghao Li, Feifan Song, Bowen Yu, Haiyang Yu, Zhoujun Li, Fei Huang,
Yongbin Li
- Abstract要約: 本稿では,Tool-Augmented LLM向けに開発された最初のベンチマークであるAPI-Bankを紹介する。
API-Bankには、53の一般的なAPIツール、完全なツール拡張LLMワークフロー、264の注釈付き対話が含まれている。
実験の結果, GPT-3.5はGPT3に対してツールを使用できるが, GPT-4はプランニング性能が優れていた。
- 参考スコア(独自算出の注目度): 48.65370217884251
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent research has shown that Large Language Models (LLMs) can utilize
external tools to improve their contextual processing abilities, moving away
from the pure language modeling paradigm and paving the way for Artificial
General Intelligence. Despite this, there has been a lack of systematic
evaluation to demonstrate the efficacy of LLMs using tools to respond to human
instructions. This paper presents API-Bank, the first benchmark tailored for
Tool-Augmented LLMs. API-Bank includes 53 commonly used API tools, a complete
Tool-Augmented LLM workflow, and 264 annotated dialogues that encompass a total
of 568 API calls. These resources have been designed to thoroughly evaluate
LLMs' ability to plan step-by-step API calls, retrieve relevant APIs, and
correctly execute API calls to meet human needs. The experimental results show
that GPT-3.5 emerges the ability to use the tools relative to GPT3, while GPT-4
has stronger planning performance. Nevertheless, there remains considerable
scope for further improvement when compared to human performance. Additionally,
detailed error analysis and case studies demonstrate the feasibility of
Tool-Augmented LLMs for daily use, as well as the primary challenges that
future research needs to address.
- Abstract(参考訳): 近年の研究では、LLM(Large Language Models)が、文脈処理能力を改善するために外部ツールを利用することが示されており、純粋な言語モデリングパラダイムから離れ、人工知能への道が開けている。
それにもかかわらず、人間の指示に反応するツールを用いたLCMの有効性を示す体系的な評価が欠如している。
本稿では,Tool-Augmented LLM向けに開発された最初のベンチマークであるAPI-Bankを紹介する。
API-Bankには53の一般的なAPIツール、ツール拡張LLMワークフロー、合計568のAPIコールを含む264の注釈付き対話が含まれている。
これらのリソースは、ステップバイステップのAPI呼び出しを計画し、関連するAPIを検索し、ヒューマンニーズを満たすためのAPI呼び出しを正しく実行するLLMの能力を、徹底的に評価するために設計されている。
実験の結果, GPT-3.5はGPT3に対してツールを使用できるが, GPT-4はプランニング性能が優れていた。
それでも、人間のパフォーマンスと比較すると、さらなる改善の余地がある。
さらに、詳細なエラー分析とケーススタディにより、ツール拡張LDMが日常的に利用可能であること、そして将来の研究が取り組むべき主な課題が示される。
関連論文リスト
- ToolPlanner: A Tool Augmented LLM for Multi Granularity Instructions with Path Planning and Feedback [11.931584529573176]
命令が与えられた後、ツール拡張LDMは複数のラウンドで様々な外部ツールと対話し、最終的な答えを提供する。
以前のLLMは、API名やパラメータを含む、過剰に詳細な命令でトレーニングされていたが、実際のユーザはこれらのAPIの詳細を明示的に言及しなかった。
これらの問題に対処するため、MGToolBenchというトレーニングデータセットを構築しました。
論文 参考訳(メタデータ) (2024-09-23T08:58:48Z) - Efficient and Scalable Estimation of Tool Representations in Vector Space [34.767193045989515]
ツール検索のための合成データを生成するためのフレームワークと,小型エンコーダモデルを用いた効率的なデータ駆動型ツール検索戦略を提案する。
ToolBankは、実際のユーザ利用を反映した、新しいツール検索データセットです。
これらの新しい方法により、ToolBenchデータセット上のRecall@Kで最大27.28、ToolBank上のRecall@Kで30.5の改善を実現しています。
論文 参考訳(メタデータ) (2024-09-02T19:39:24Z) - Chain of Tools: Large Language Model is an Automatic Multi-tool Learner [54.992464510992605]
Automatic Tool Chain(ATC)は、大規模言語モデル(LLM)がマルチツールユーザとして機能することを可能にするフレームワークである。
次に,ツールの範囲を拡大するために,ブラックボックス探索法を提案する。
包括的な評価のために、ToolFlowという挑戦的なベンチマークを構築しました。
論文 参考訳(メタデータ) (2024-05-26T11:40:58Z) - LLMs in the Imaginarium: Tool Learning through Simulated Trial and Error [54.954211216847135]
既存の大規模言語モデル(LLM)は30%から60%の範囲でしか正当性に至らない。
試行錯誤(STE)を模擬したツール拡張LDMの生物学的なインスピレーション法を提案する。
STEは、試行錯誤、想像力、記憶という、生物学的システムにおけるツール使用行動の成功のための3つの重要なメカニズムを編成する。
論文 参考訳(メタデータ) (2024-03-07T18:50:51Z) - Efficient Tool Use with Chain-of-Abstraction Reasoning [65.18096363216574]
大規模言語モデル(LLM)は、現実世界の知識に対する推論の基礎となる必要がある。
マルチステップ推論問題におけるツールの実行には,微調整LDMエージェントの課題が残されている。
マルチステップ推論におけるツールの活用方法として, LLM の新しい手法を提案する。
論文 参考訳(メタデータ) (2024-01-30T21:53:30Z) - CRAFT: Customizing LLMs by Creating and Retrieving from Specialized
Toolsets [75.64181719386497]
大規模言語モデル(LLM)のためのツール作成・検索フレームワークであるCRAFTを提案する。
タスク用に特別にキュレートされたツールセットを作成し、複雑なタスクを解決する能力を高めるためにこれらのセットからツールを取得するコンポーネントをLLMに装備する。
本手法はフレキシブルに設計されており,既製のLCMを細かな調整なしに未確認領域やモダリティに適応するためのプラグアンドプレイ方式を提供する。
論文 参考訳(メタデータ) (2023-09-29T17:40:26Z) - ToolLLM: Facilitating Large Language Models to Master 16000+ Real-world
APIs [104.37772295581088]
オープンソースの大規模言語モデル(LLM)、例えばLLaMAは、ツール使用能力に大きく制限されている。
データ構築、モデルトレーニング、評価を含む汎用ツールであるToolLLMを紹介する。
ツール使用のためのインストラクションチューニングフレームワークであるToolBenchを,ChatGPTを使って自動構築する。
論文 参考訳(メタデータ) (2023-07-31T15:56:53Z) - ToolQA: A Dataset for LLM Question Answering with External Tools [14.408707186450899]
大規模言語モデル (LLM) は様々なNLPタスクにおいて顕著な性能を示した。
彼らはまだ幻覚や弱い数値推論のような困難に悩まされている。
これらの課題を克服するために、LLMの質問応答能力を高めるために外部ツールを使用することができる。
論文 参考訳(メタデータ) (2023-06-23T05:43:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。