論文の概要: Case-Based Calibration of Adaptive Reasoning and Execution for LLM Tool Use
- arxiv url: http://arxiv.org/abs/2605.15041v1
- Date: Thu, 14 May 2026 16:36:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-15 21:45:34.950688
- Title: Case-Based Calibration of Adaptive Reasoning and Execution for LLM Tool Use
- Title(参考訳): LLMツール利用における適応推論と実行のケースベース校正
- Authors: Renning Pang, Tian Lan, Leyuan Liu, Piao Tong, Sheng Cao, Xiaosong Zhang,
- Abstract要約: 歴史的実行軌跡を構造化ケースとして扱うケース駆動フレームワークであるCASTを提案する。
このフレームワークは、この知識を細かな報酬設計と適応推論に翻訳する。
BFCLv2とToolBenchの実験では、CASTはスキーマフル実行とタスクレベルのツール使用の成功の両方を改善している。
- 参考スコア(独自算出の注目度): 12.603146647076132
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Tool use extends large language models beyond parametric knowledge, but reliable execution requires balancing appropriate reasoning depth with strict structural validity. We approach this problem from a case-based perspective to present CAST, a case-driven framework that treats historical execution trajectories as structured cases. Instead of reusing raw exemplar outputs, CAST extracts case-derived signals to identify complexity profiles for estimating optimal reasoning strategies, alongside failure profiles to map likely structural breakdowns. The framework translates this knowledge into a fine-grained reward design and adaptive reasoning, enabling the model to autonomously internalize case-based strategies during reinforcement learning. Experiments on BFCLv2 and ToolBench demonstrate that CAST improves both schema-faithful execution and task-level tool-use success while reducing unnecessary deliberation. The approach achieves up to 5.85 percentage points gain in overall execution accuracy and reduces average reasoning length by 26%, significantly mitigating high-impact structural errors. Ultimately, this demonstrates how historical execution cases can provide reusable adaptation knowledge for calibrated tool use.
- Abstract(参考訳): ツールの使用は、パラメトリック知識を超えて大きな言語モデルを拡張するが、信頼性の高い実行には、適切な推論深さと厳密な構造的妥当性のバランスが必要である。
我々はケースベースの観点からこの問題にアプローチし、歴史的実行軌跡を構造化ケースとして扱うケース駆動フレームワークであるCASTを提示する。
生の例の出力を再利用する代わりに、CASTはケース由来の信号を抽出して、最適な推論戦略を推定するための複雑性プロファイルを識別する。
このフレームワークは、この知識を微妙な報酬設計と適応推論に変換し、強化学習中にケースベースの戦略を自律的に内部化する。
BFCLv2とToolBenchの実験は、CASTがスキーマ忠実な実行とタスクレベルのツール使用の成功の両方を改善し、不要な検討を減らすことを実証している。
この手法は、全体の実行精度が最大5.85ポイント向上し、平均推論長を26%削減し、高い衝撃構造誤差を著しく軽減する。
最終的にこれは、過去の実行ケースが、調整済みツールの使用に対して再利用可能な適応知識を提供する方法を示している。
関連論文リスト
- Teaching Thinking Models to Reason with Tools: A Full-Pipeline Recipe for Tool-Integrated Reasoning [59.74608632210439]
そこで本研究では,ツール使用の自然な動作を,ツールなし推論能力を犠牲にすることなく,強力な思考モデルに注入する方法を示す。
提案手法は,オープンソースモデル間のベンチマークにおいて,最先端のパフォーマンスを実現するモデルを生成する。
論文 参考訳(メタデータ) (2026-05-07T14:23:21Z) - VLA-ATTC: Adaptive Test-Time Compute for VLA Models with Relative Action Critic Model [54.35791816657227]
適応型テスト時間計算でVLAモデルを実現するフレームワークである textbfVLA-ATTC' を導入する。
VLA-ATTCは、不確実性に基づく認知クラッチ'を用いて、反射的実行からTTC熟考フェーズへ動的に移行する。
LIBERO-LONGベンチマークでは、VLA-ATTCはSOTAモデルPI0.5の故障率を50%以上削減する。
論文 参考訳(メタデータ) (2026-05-02T02:13:11Z) - Structured Uncertainty guided Clarification for LLM Agents [126.26213027785813]
LLMエージェントは、ツールコール機能を備えた大きな言語モデルを拡張するが、曖昧なユーザ命令は、しばしば誤った呼び出しやタスクの失敗につながる。
本稿では,ツールコールパラメータに対する構造的不確かさの定式化,完全情報の期待値(EVPI)を目標としたPOMDPのモデル化,冗長性防止のためのアスペクトベースコストモデルを提案する。
我々のSAGE-Agentは、この構造化された不確実性を活用し、より優れた効率を達成するために、曖昧なタスクのカバレッジを7~39%増加させ、明確な質問を1.5~2.7$times$に減らした。
論文 参考訳(メタデータ) (2025-11-11T21:50:44Z) - Boosting Accuracy and Efficiency of Budget Forcing in LLMs via Reinforcement Learning for Mathematical Reasoning [1.4348015996689416]
本稿では,Regressed Learning(RL)を統合したフレームワークを提案し,トークン効率の向上と数学的推論のための1.5Bモデルの性能向上を図る。
その結果,SFTモデルと比較してトークン使用率を40%以上削減し,全体的な精度が向上した。
論文 参考訳(メタデータ) (2025-10-24T12:39:15Z) - AALC: Large Language Model Efficient Reasoning via Adaptive Accuracy-Length Control [18.273777938294327]
大きな推論モデル(LRM)は、長いチェーン・オブ・シークレットを生成することで印象的な推論能力を達成する。
我々は、強化学習に組み込まれた軽量で精度の高い長さの報酬であるALCを紹介する。
提案手法は,元の精度を維持したり改善したりしながら,応答長を50%以上削減することを示す。
論文 参考訳(メタデータ) (2025-06-25T06:29:18Z) - Accelerated Test-Time Scaling with Model-Free Speculative Sampling [58.69141724095398]
STAND(Stochastic Adaptive N-gram Drafting)は,新しいモデルフリーな投機的デコード手法である。
従来の自己回帰復号法と比較して,STANDは推論遅延を60~65%削減することを示した。
モデルフリーのアプローチとして、STANDは追加のトレーニングなしで既存の言語モデルに適用できる。
論文 参考訳(メタデータ) (2025-06-05T07:31:18Z) - Sample-aware Adaptive Structured Pruning for Large Language Models [14.605017410864583]
本研究では,大規模言語モデル(LLM)のためのサンプル対応型構造化プルーニングフレームワークであるAdaPrunerを紹介する。
特に、AdaPrunerは構造化プルーニング解空間を構築して、LLMから冗長パラメータを効果的に除去する。
20%のプルーニング比で、AdaPrunerでプルーニングされたモデルは、未プルーニングモデルのパフォーマンスの97%を維持している。
論文 参考訳(メタデータ) (2025-03-08T12:00:21Z) - The First Few Tokens Are All You Need: An Efficient and Effective Unsupervised Prefix Fine-Tuning Method for Reasoning Models [69.798277882245]
大規模言語モデルの推論効率を向上させるために,Unsupervised Prefix Fine-Tuning (UPFT)を導入した。
UPFTはラベル付きデータや徹底的なサンプリングの必要性を取り除く。
実験の結果,UPFTは教師付き手法の性能と一致していることがわかった。
論文 参考訳(メタデータ) (2025-03-04T18:56:03Z) - DRAUC: An Instance-wise Distributionally Robust AUC Optimization
Framework [133.26230331320963]
ROC曲線のエリア(AUC)は、長い尾の分類のシナリオにおいて広く用いられている指標である。
本研究では,分散ロバストAUC(DRAUC)のインスタンスワイドサロゲート損失を提案し,その上に最適化フレームワークを構築した。
論文 参考訳(メタデータ) (2023-11-06T12:15:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。