論文の概要: Scores Are Not Decisions: Cost-Aware Stopping for Tool Acquisition in LLM Agents
- arxiv url: http://arxiv.org/abs/2607.27083v1
- Date: Wed, 29 Jul 2026 16:07:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.737231
- Title: Scores Are Not Decisions: Cost-Aware Stopping for Tool Acquisition in LLM Agents
- Title(参考訳): スコアは決定ではない - LLMエージェントにおけるツール獲得のためのコスト意識の停止
- Abstract要約: ツールプレフィックスのランク付けに際し,コストアウェアの限界決定中心の停止(CAM-DF)を開発する。
我々は5つのツール・ユース・ドメインにまたがる1,343のタスクを評価した。
当社のアプローチは、異質なコストと高コストで最先端のアプローチです。
- 参考スコア(独自算出の注目度): 14.413992677258825
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: As LLM agents increasingly depend on diverse external services such as search engines, databases, and connectors, agent harnesses face a fundamental tool-selection challenge: acquiring too few tools leaves the task under-informed, while too many adds cost, context load, and privacy exposure. Routers and retrievers can rank candidate tools by relevance, but a ranking alone does not determine how many are worth selecting. Existing approaches leave acquisition under heterogeneous costs unaddressed. We formulate this decision as cost-aware marginal decision-focused stopping (CAM-DF) over ranked tool prefixes, with CAM-DF-lite as a compact interpretable variant. We train directly on the offline gap between stopping now and the best continuation: its sign labels the decision, its magnitude weights each error by the payoff at stake. We prove this objective is Bayes-aligned with the stopping target and that score-only rules are suboptimal under heterogeneous costs. We evaluate on 1,343 tasks across five tool-use domains. On $τ$-bench Retail, CAM-DF attains the highest payoff among deployable methods, with gains over a predict-then-threshold baseline across all five ranking sources and two cost regimes. Our approach is state-of-the-art under heterogeneous costs and high cost pressure, with larger gains under weaker rankings. In live execution, CAM-DF exposes the agent to 37\% fewer tools than full access while maintaining comparable task success. The CAM-DF family is a lightweight pre-execution plugin that turns existing tool rankings into lower-cost acquisition decisions without fine-tuning the underlying LLM.
- Abstract(参考訳): LLMエージェントは、検索エンジン、データベース、コネクタなどのさまざまな外部サービスに依存しているため、エージェントハーネスは基本的なツール選択の課題に直面している。
ルーターとレトリバーは、関連性によって候補ツールをランク付けできるが、ランキングだけでは、選択する価値のあるツールの数を決定できない。
既存のアプローチは、不均一なコストで買収を放棄する。
我々は、この決定を、CAM-DF-liteをコンパクトな解釈可能な変種として、ランク付けツールプレフィックスよりもコスト対応の限界決定中心の停止(CAM-DF)として定式化する。
私たちは、現在と最高の継続の間にあるオフラインのギャップを直接トレーニングします。そのサインは決定をラベル付けし、その大きさは、利害関係の支払いによって、それぞれのエラーを重み付けします。
我々は、この目的が停止目標とベイズ整合であり、スコアのみのルールが不均一なコストの下で最適であることを証明する。
我々は5つのツール・ユース・ドメインにまたがる1,343のタスクを評価する。
$τ$-bench Retailでは、CAM-DFがデプロイ可能なメソッドの中で最も高い報酬を得ている。
当社のアプローチは、異質なコストと高いコスト圧力の下で最先端であり、より低いランク下では大きな利益が得られます。
ライブ実行では、CAM-DFはエージェントを、同等のタスク成功を維持しながら、フルアクセスよりも37\%少ないツールに公開する。
CAM-DFファミリは軽量な事前実行プラグインで、既存のツールランキングを、基盤となるLLMを微調整することなく、低コストな買収決定に変換する。
関連論文リスト
- GAUGE: When Not to Trust LLM-as-a-Judge in User-Simulated Evaluation of Task-Oriented Agents [5.041247893188969]
GAUGEは,ゲートのランクが確定可能な報酬と一致するかどうかを測定する,再利用可能なオフラインプロトコルである。
満足感は基本的にタスクの成功に関する情報を 含まないのです
そこで我々は,無判定完備ビットをゼロコストトリップワイヤとしてトランニケーションレグレッションを補正するキャリブレート・テイントラストカデンスを提案する。
論文 参考訳(メタデータ) (2026-09-10T20:29:28Z) - One Policy, Any Budget: Internalizing Budget-Aware Search via Reinforcement Learning [41.55260785497756]
我々は,予算制約下での予算対応検索を単一ポリシーで行えるフレームワークであるAnySearchを提案する。
第1フェーズでは、明確な予算状態注入と構造化推論プロンプトでエージェントを訓練する。
第2段階では、足場を除去し、エージェントは適応的にサンプル化された予算制約の下で自律的に操作することを学ぶ。
論文 参考訳(メタデータ) (2026-09-01T07:12:32Z) - TAPO: Tool-Aware Policy Optimization via Credit Transfer for Multimodal Search Agents [54.08846865906602]
ツール強化マルチモーダルサーチエージェントにおいて,クレジットミス割り当てをGRPOの系統的障害モードとして特徴付ける。
本稿では,情報取得ツールのパラメータ決定性を利用したツール・アウェア・ポリシー・オプティマイズ(TAPO)を提案する。
論文 参考訳(メタデータ) (2026-06-04T07:15:43Z) - ZEBRA: Zero-shot Budgeted Resource Allocation for LLM Orchestration [8.226365534099399]
連続非線形クナップサック問題に対する多相予算割当を低減するフレームワークであるZEBRAを提案する。
150ドルのAPPS符号化ベンチマークでは、ZEBRAの2つの変種は全ての集計基準においてLLM-directよりも優れていた。
我々は,自律型マルチエージェントシステムの経済行動を改善するために,推論時の軽量なアルゴリズムガイダンスを提案する。
論文 参考訳(メタデータ) (2026-05-19T20:50:05Z) - ComplexMCP: Evaluation of LLM Agents in Dynamic, Interdependent, and Large-Scale Tool Sandbox [61.862814740220806]
$textbfComplexMCP$は厳格な条件下でエージェントを評価するために設計されたベンチマークである。
Model Context Protocol (MCP)上に構築された$textbfComplexMCP$は300以上の精巧にテストされたツールを提供する。
論文 参考訳(メタデータ) (2026-05-11T16:20:51Z) - When Is Rank-1 Steering Cheap? Geometry, Granularity, and Budgeted Search [61.73232505100331]
アクティベーションステアリングは、再トレーニングせずにLSMを制御する軽量な方法を提供するが、その効果は概念によって大きく異なる。
我々は介入層と係数に対する予算制約付き最適化としてランク1ステアリングを定式化する。
操作困難の原因の診断にアクティベーション幾何を利用するグラニュラリティおよび表現認識概念工学フレームワークである textitGRACE を提案する。
論文 参考訳(メタデータ) (2026-05-09T14:26:49Z) - AgentOpt v0.1 Technical Report: Client-Side Optimization for LLM-Based Agent [18.58248061903799]
AgentOptは、クライアントサイドAI最適化のための最初のフレームワークに依存しないPythonパッケージである。
我々はまず,マルチステップエージェントパイプラインにおける高インパクト最適化レバーであるモデル選択について検討する。
指数関数的に増加する組み合わせ空間を効率的に探索するために、AgentOptは10の検索アルゴリズムを実装している。
論文 参考訳(メタデータ) (2026-04-07T17:13:47Z) - ESearch-R1: Learning Cost-Aware MLLM Agents for Interactive Embodied Search via Reinforcement Learning [40.2017873619555]
ESearch-R1はコスト認識型推論フレームワークである。
対話型対話(Ask)、エピソードメモリ検索(GetMemory)、物理ナビゲーション(Navigate)を単一の決定プロセスに統合する。
総運用コストを約50%削減し、タスク成功率を向上させる。
論文 参考訳(メタデータ) (2025-12-21T02:45:08Z) - A$^2$FM: An Adaptive Agent Foundation Model for Tool-Aware Hybrid Reasoning [40.6234318894435]
大規模言語モデルは、推論中心のLLMとエージェントのLLMの2つのファミリーに分けられた。
この分割は、基本的に異なるトレーニング目標から生じ、単純なクエリに対して不一致の強度と非効率をもたらす。
本稿では,アダプティブ・エージェント・ファンデーション・モデル (A$2$FM) を提案する。
論文 参考訳(メタデータ) (2025-10-13T17:08:25Z) - Learning to Route LLMs from Bandit Feedback: One Policy, Many Trade-offs [69.2486294522259]
BaRPはBandit Routing-feedback with Preferencesアプローチであり、デプロイと同じ部分フィードバック制限の下でトレーニングされる。
提案手法は,学習中のオンラインフィードバック設定をシミュレートし,新たなプロンプトに適応する。
論文 参考訳(メタデータ) (2025-10-08T18:24:59Z) - Multi-Agent Neural Rewriter for Vehicle Routing with Limited Disclosure
of Costs [65.23158435596518]
チームのマルコフゲームとして、部分的に観測可能なコストでマルチサイクルルーティング問題を解く。
我々のマルチエージェント強化学習アプローチである、いわゆるマルチエージェントニューラルリライタは、1エージェントニューラルリライタを利用して、反復的に書き換えるソリューションによって問題を解決する。
論文 参考訳(メタデータ) (2022-06-13T09:17:40Z) - Online Apprenticeship Learning [58.45089581278177]
見習い学習(AL)では、コスト関数にアクセスせずにマルコフ決定プロセス(MDP)が与えられます。
目標は、事前に定義されたコスト関数のセットで専門家のパフォーマンスに一致するポリシーを見つけることです。
ミラー下降型ノンレグレットアルゴリズムを2つ組み合わせることで,OAL問題を効果的に解くことができることを示す。
論文 参考訳(メタデータ) (2021-02-13T12:57:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。