論文の概要: Getting the Parameters Right: A Difficulty-Graded Benchmark and Probe-Guided Training for LLM Tool Calls
- arxiv url: http://arxiv.org/abs/2608.03071v1
- Date: Tue, 04 Aug 2026 03:36:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.020278
- Title: Getting the Parameters Right: A Difficulty-Graded Benchmark and Probe-Guided Training for LLM Tool Calls
- Title(参考訳): パラメータを正しくする: LLMツールコールのための難解なベンチマークとプローブガイドによるトレーニング
- Authors: Guoyao Yu, Xiaoqing Sun, Ziqi Huang, Shaojing Fan, Zhongyi Zhang, Xiaomeng Hu, Xiaobo Xue, Yangyang Shi, Xiong Xiao, Yang Song, Biao Lyu, Rong Wen, Xing Li, Qinming He, Shunming Zhu, Zhenguang Liu,
- Abstract要約: クラウドコンピューティングのようなドメインでは、フロンティアモデルでさえ、ツールコールの半分以下を正しく完了します。
本稿では,2つの相補的なアプローチによるプローブ誘導フレームワークを提案する。
提案手法はパラメータ生成を大幅に改善し,平均一致率19.7%から59.6%に向上した。
- 参考スコア(独自算出の注目度): 43.88014476513854
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language model agents derive much of their capability from tool use. Existing research on tool use has largely focused on selecting the right tool and orchestrating the order of calls. However, correctly filling the parameters of a tool call is equally critical for successful execution and has received far less attention. In domains such as cloud networking, even frontier models correctly complete fewer than half of tool calls. Inspired by recent analyses showing that LLM hidden states encode rich information about model predictions, we discover that while the model generates a parameter value, its hidden state contains a strong correctness signal: a simple linear probe can accurately predict whether the value will be correct. Based on this observation, we propose a unified probe-guided framework with two complementary approaches: probe-filtered bootstrapped training (PBT), which uses the probe to filter reliable self-generated calls for fine-tuning, and probe-guided reranking (PGR), which uses the probe to select better candidates during inference. To support systematic evaluation, we release ParamBench, a benchmark built from real cloud-network APIs that categorizes every instance into five difficulty levels according to parameter nesting depth, cross-parameter dependencies, and the reasoning required to derive values from earlier calls. Extensive experiments across 5 open models on ParamBench and 6 external benchmarks demonstrate that our method substantially improves parameter generation, raising the average exact match from 19.7% to 59.6%.
- Abstract(参考訳): 大きな言語モデルエージェントは、ツールの使用から多くの能力を引き出す。
ツール使用に関する既存の研究は、適切なツールを選択し、呼び出しの順序を調整することに集中しています。
しかし、ツールコールのパラメータを正しく満たすことは、実行を成功させる上でも同様に重要であり、はるかに少ない注意を払っている。
クラウドコンピューティングのようなドメインでは、フロンティアモデルでさえ、ツールコールの半分以下を正しく完了します。
LLM隠蔽状態がモデル予測に関する豊富な情報を符号化していることを示す最近の分析から着想を得た結果、モデルがパラメータ値を生成する一方で、その隠蔽状態が強い正当性信号を含むことが判明した。
そこで本研究では,プローブフィルタを用いたブートストラップドトレーニング(PBT)と,提案手法を用いてより優れた候補を選択するPGR(プローブ誘導再分類)という,2つの補完的なアプローチによるプローブ誘導フレームワークを提案する。
このベンチマークは、すべてのインスタンスをパラメータネスト深さ、パラメータ間の依存関係、および以前の呼び出しから値を引き出すために必要な推論に基づいて5つの難易度に分類します。
ParamBench と 6 の外部ベンチマークによる 5 つのオープンモデルに対する大規模な実験により,本手法はパラメータ生成を大幅に改善し,平均精度が 19.7% から 59.6% に向上した。
関連論文リスト
- Learning Reasoning World Models for Parallel Code [26.139975890051925]
一般的な治療法は、外部ツールと対話するコーディングエージェントを使用することだが、ツールコールはコストがかかり、時には実用的でない場合もある。
並列ソースコードから直接ツールの結果を予測することを目的として,PCWM(Parallel-Code World Models)を提案する。
この結果から,推論モデルが並列符号化エージェントにおける外部ツールコールの代替となる可能性が示唆された。
論文 参考訳(メタデータ) (2026-04-22T07:29:23Z) - TinyLLM: Evaluation and Optimization of Small Language Models for Agentic Tasks on Edge Devices [0.0]
本稿では,エージェントタスク(機能/ツール/API呼び出し)における小言語モデル(SLM)の有効性について検討する。
本稿では、教師付き微調整(SFT)、パラメータ効率の高い微調整(PEFT)、強化学習(RL)、ハイブリッド手法を含むパラメータ駆動最適化戦略について述べる。
その結果,中規模モデル(1-3Bパラメータ)がウルトラコンパクトモデル(1Bパラメータ)を大幅に上回るモデルスケール間での精度差が明らかとなった。
この研究は、エッジデバイス上で、小さな言語モデルが正確で効率的で安定したエージェントAIを提供できるようにするためのハイブリッド最適化戦略の重要性を強調した。
論文 参考訳(メタデータ) (2025-11-27T06:09:54Z) - Maximally-Informative Retrieval for State Space Model Generation [59.954191072042526]
テスト時に特定のクエリに対するモデル不確実性を最小化するために、Retrieval In-Context Optimization (RICO)を導入する。
文書検索に外部に依存した従来の検索強化生成(RAG)とは異なり,本手法はモデルから直接のフィードバックを利用する。
モデル勾配を用いた標準のトップ$kの検索は、最適化手順を近似し、残余損失への接続を提供することを示す。
論文 参考訳(メタデータ) (2025-06-13T18:08:54Z) - SimPER: A Minimalist Approach to Preference Alignment without Hyperparameters [40.64474084442168]
SimPERは言語モデルアライメントのための効果的な選好最適化アルゴリズムである。
SimPERは実装が容易で、高価なハイパーパラメータチューニングと参照モデルを必要としない。
SimPERは、既存のアプローチよりも一貫して、大幅に優れています。
論文 参考訳(メタデータ) (2025-02-02T19:25:41Z) - ToolACE: Winning the Points of LLM Function Calling [139.07157814653638]
ToolACEは、正確で複雑で多様なツール学習データを生成するように設計された自動エージェントパイプラインである。
我々は、合成データに基づいてトレーニングされたモデルが、8Bパラメータだけで、バークレー・ファンクション・カリング・リーダーボード上で最先端のパフォーマンスを達成することを実証した。
論文 参考訳(メタデータ) (2024-09-02T03:19:56Z) - Automating DBSCAN via Deep Reinforcement Learning [73.82740568765279]
本稿では,DBSCANの自動パラメータ検索フレームワークであるDRL-DBSCANを提案する。
このフレームワークは、クラスタリング環境をマルコフ決定プロセスとして知覚することで、パラメータ探索方向を調整する過程をモデル化する。
このフレームワークはDBSCANクラスタリングの精度を最大で26%、25%改善している。
論文 参考訳(メタデータ) (2022-08-09T04:40:11Z) - Efficient Nearest Neighbor Language Models [114.40866461741795]
非パラメトリックニューラルネットワークモデル(NLM)は、外部データストアを用いてテキストの予測分布を学習する。
比較性能を維持しながら、推論速度の最大6倍の高速化を実現する方法を示す。
論文 参考訳(メタデータ) (2021-09-09T12:32:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。