論文の概要: AlloBench: Measuring Online Tool Allocation Capability in LLM Agents
- arxiv url: http://arxiv.org/abs/2607.23332v1
- Date: Sat, 25 Jul 2026 19:05:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.063614
- Title: AlloBench: Measuring Online Tool Allocation Capability in LLM Agents
- Title(参考訳): AlloBench: LLMエージェントのオンラインツール割り当て能力の測定
- Abstract要約: 固定予算下で,エージェントが意識的アロケーション行動を示すかどうかを検査するベンチマークを導入する。
私たちは、テストするすべてのフロンティアモデルが抽象フレーミングにおいてほぼ最適に振る舞うが、この能力をスクリプト記述に転送することができないことに気付きました。
- 参考スコア(独自算出の注目度): 2.3236525323645285
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Creating a reusable tool is an investment: an agent pays a fixed cost now in exchange for the potential of future reuse. Therefore, a user should prefer an agent that creates a small number of highly reusable tools, rather than many one-offs. We introduce a paired benchmark that tests whether LLM agents exhibit conscious allocation behavior under a fixed budget in two contexts: an abstract text-based formulation and a code-construction task. We find that every frontier model we test---Claude Haiku, Claude Opus, GPT-5.4-mini, and GPT-5.6 Sol---acts near-optimally in the abstract framing but fails to transfer this ability to script-writing. Through further experiments, we identify the particular failure modes for each model. Notably, the first three models fail even when the scripts are not evaluated, while GPT-5.6 Sol stays selective under that weaker manipulation and collapses only at full construction. Furthermore, an open-source Qwen model policy-trained for abstract allocation generalizes this ability across held-out lexical variations, but sees no improvement at script allocation. Together, these results establish online tool allocation as a significant capability boundary, even for modern frontier models.
- Abstract(参考訳): 再利用可能なツールを作ることは投資であり、エージェントは将来の再利用の可能性と引き換えに、現在固定費用を支払う。
したがって、ユーザーは、多くのワンオフではなく、少数の高度に再利用可能なツールを作成するエージェントを好むべきである。
我々は,LLMエージェントが2つの文脈において,固定予算下で意識的アロケーション行動を示すか否かを,抽象テキストベースの定式化とコード構築タスクという2つの文脈で検証するベンチマークを提案する。
テストしたすべてのフロンティアモデル – Claude Haiku, Claude Opus, GPT-5.4-mini, GPT-5.6 – が,抽象フレーミングにおいてほぼ最適に動作するが,この機能をスクリプト記述に転送できない。
さらなる実験を通じて、各モデルの特定の障害モードを特定する。
特に、最初の3つのモデルは、スクリプトが評価されていない場合でも失敗するが、GPT-5.6 ソルは、より弱い操作の下で選択的であり、完全な構成でのみ崩壊する。
さらに、抽象アロケーションのために訓練されたオープンソースのQwenモデルポリシーは、保持された語彙のバリエーションにまたがってこれを一般化するが、スクリプトアロケーションでは改善されない。
これらの結果は,現代のフロンティアモデルにおいても,オンラインツールアロケーションを重要な機能境界として確立している。
関連論文リスト
- Inverting the Bellman Equation: From $Q$-Values to World Models [57.827849584133425]
我々は、十分に豊富な報酬関数のセットで訓練された価値に基づくエージェントが、ユニークで正確な世界モデルを暗黙的にエンコードしていることを証明した。
ttReacherエージェントの暗黙の世界モデルにのみ訓練されたポリシーは、位置のみのトレーニングにもかかわらず、分布外、速度に基づく目標に準最適であることがわかった。
論文 参考訳(メタデータ) (2026-06-19T07:26:14Z) - TAPO: Tool-Aware Policy Optimization via Credit Transfer for Multimodal Search Agents [54.08846865906602]
ツール強化マルチモーダルサーチエージェントにおいて,クレジットミス割り当てをGRPOの系統的障害モードとして特徴付ける。
本稿では,情報取得ツールのパラメータ決定性を利用したツール・アウェア・ポリシー・オプティマイズ(TAPO)を提案する。
論文 参考訳(メタデータ) (2026-06-04T07:15:43Z) - A Matter of TASTE: Improving Coverage and Difficulty of Agent Benchmarks [25.713629634281077]
ツール・シークエンス・エボリューションによるタスク・シンセサイザー(TASTE: Task Synthesis from Tool Sequence Evolution)を提案する。
TASTEはクラスタリングを通じてプールから代表シーケンスを選択し、それらを完全なベンチマークタスクにインスタンス化し、難易度進化を通じてそれらを洗練する。
以上の結果から,既存のベンチマークにおける高いスコアは,頑健なタスク解決能力よりも飽和度を反映していることが示唆された。
論文 参考訳(メタデータ) (2026-05-27T14:45:59Z) - PRIMA: Operational Patterns for Resilient Multi-Agent Research with Verifiable Identity and Convergent Feedback [0.0]
PRIMAは、複数時間にわたる協調型マルチエージェント研究システムとして運用されている。
主なコントリビューションは、生存可能な障害モードのための3つの運用パターンである。
グラフ同型ケーススタディは、生成されたアーティファクトのアーキテクチャ的クレームを根拠にしている。
論文 参考訳(メタデータ) (2026-05-23T23:27:46Z) - ComplexMCP: Evaluation of LLM Agents in Dynamic, Interdependent, and Large-Scale Tool Sandbox [61.862814740220806]
$textbfComplexMCP$は厳格な条件下でエージェントを評価するために設計されたベンチマークである。
Model Context Protocol (MCP)上に構築された$textbfComplexMCP$は300以上の精巧にテストされたツールを提供する。
論文 参考訳(メタデータ) (2026-05-11T16:20:51Z) - Terminus-4B: Can a Smaller Model Replace Frontier LLMs at Agentic Execution Tasks? [3.636948650519796]
スモール言語モデル(SLM)はエージェント端末実行のタスクにおいてフロンティアモデルに匹敵する性能を達成できる。
教師付ファインタニング(SFT)と強化学習(RL)による訓練後Qwen3-4BモデルであるTerminus-4Bを提案する。
Terminus-4Bは、No Subagentベースラインと比較して、メインエージェントのトークン使用量を最大30%削減できることがわかった。
論文 参考訳(メタデータ) (2026-05-04T22:24:24Z) - Sponge Tool Attack: Stealthy Denial-of-Efficiency against Tool-Augmented Agentic Reasoning [58.432996881401415]
最近の作業では、エージェント推論を可能にするために、外部ツールで大きな言語モデル(LLM)を拡張している。
本稿では,入力プロンプトを書き換えることのみでエージェント推論を妨害するスポンジツールアタック(STA)を提案する。
STAは、意味的忠実度の高い原文からの良心的な即興的な書き直しを生成する。
論文 参考訳(メタデータ) (2026-01-24T19:36:51Z) - ML-Tool-Bench: Tool-Augmented Planning for ML Tasks [23.54937738755734]
ツール強化機械学習エージェントの評価のためのベンチマークを導入する。
私たちのベンチマークは、インメモリ名のオブジェクト管理を組み込むことで、従来のツール使用の評価を超えています。
我々のアプローチはReActよりも16.2%向上し、すべてのKaggle課題の中央値を取ります。
論文 参考訳(メタデータ) (2025-11-29T23:59:40Z) - MCPVerse: An Expansive, Real-World Benchmark for Agentic Tool Use [72.53177559476704]
我々はエージェントツールの使用を評価するための実世界のベンチマークであるMCPVerseを紹介する。
MCPVerseは550以上の実世界の実行可能なツールを統合し、140kトークンを超える前例のないアクション空間を作成する。
私たちは最先端のLSMを3つのモード(Oracle、Standard、Max-Scale)でベンチマークしました。
論文 参考訳(メタデータ) (2025-08-22T09:47:53Z) - Runaway is Ashamed, But Helpful: On the Early-Exit Behavior of Large Language Model-based Agents in Embodied Environments [54.67512489842682]
大規模言語モデル(LLM)は、複雑な実施環境において、強力な計画と意思決定能力を示す。
LLMをベースとしたエージェントの早期退避行動を探究する第一歩を踏み出す。
論文 参考訳(メタデータ) (2025-05-23T08:23:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。