論文の概要: The Scaffolding Matters More Than the Interface: A Controlled Comparison of MCP and CLI Tool Use Across Seven Agent Scaffoldings, Five Language Models, and One Software Task
- arxiv url: http://arxiv.org/abs/2608.08654v1
- Date: Sun, 09 Aug 2026 11:54:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.909093
- Title: The Scaffolding Matters More Than the Interface: A Controlled Comparison of MCP and CLI Tool Use Across Seven Agent Scaffoldings, Five Language Models, and One Software Task
- Title(参考訳): MCPとCLIツールの比較 : 7つのエージェントシャッフル、5つの言語モデル、ひとつのソフトウェアタスクの比較
- Abstract要約: AIコーディングエージェントの実行コストは、ツールに到達したインターフェースよりも、それを駆動するエージェントの足場に依存する可能性がある。
私たちは、通常のコマンドラインインターフェース(CLI)上でのツール使用に対して、モデルコンテキストプロトコル(MCP)上でのツール使用コストを測定することにしました。
私たちは7つのエージェントの足場と5つの言語モデルで1つの固定されたソフトウェアタスクを実行しました。
- 参考スコア(独自算出の注目度): 1.0499611180329804
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: How much an AI coding agent costs to run can depend more on the agent scaffolding that drives it than on the interface through which it reaches its tools. We set out to measure the cost of tool use over the Model Context Protocol (MCP) against tool use over an ordinary command-line interface (CLI), a difference on which published estimates disagree by more than an order of magnitude while resting on practitioner reports that cannot be reproduced. We ran one fixed software task -- six operations against a private online git repository -- across seven agent scaffoldings and five language models, and we verified completion by inspecting the repository state rather than trusting the agent's self-report. The dominant effect was the scaffolding. Two of the seven ship no MCP support at all; they completed every run using only the CLI, which shows that MCP is unnecessary for this class of work, and they were 5.0x to 28x cheaper than the five scaffoldings that do support MCP, comparing CLI runs alone with no MCP server attached anywhere. The effect was largest for a small 27-billion-parameter model running locally, whose cost varied 139x across scaffoldings while it completed the task under all of them. The comparison we set out to make proved unstable: thirteen strictly paired MCP-to-CLI ratios span 0.43x to 29x, with outliers on both sides. The two interfaces separate on the cost of failure, where 12.9 per cent of the money spent on MCP runs bought no completed work against 2.2 per cent on CLI runs, but not on its frequency: failures were equally common in both, in the original runs and in their repetitions alike. Agents frequently ignored the interface they were assigned, so comparisons that do not verify actual behaviour measure an unknown mixture. The harness, the task, the verification and the complete dataset are released as open source.
- Abstract(参考訳): AIコーディングエージェントの実行コストは、ツールに到達したインターフェースよりも、それを駆動するエージェントの足場に依存する可能性がある。
我々は、通常のコマンドラインインターフェース(CLI)上でのツール使用に対して、モデルコンテキストプロトコル(MCP)上でのツール使用コストを測定することにしました。
私たちは7つのエージェントの足場と5つの言語モデルで6つのプライベートなオンラインgitリポジトリに対する6つの操作という固定されたソフトウェアタスクを実行し、エージェントの自己レポートを信頼するのではなく、リポジトリの状態を調べて完了を確認しました。
主な効果は足場であった。
7隻のうち2隻はMCPをサポートしていないが、CLIのみを使用してすべての実行を完了しており、これはMPPがこの種の作業には不要であり、CMPをサポートする5つの足場よりも5.0倍から28倍安く、CLIは単独で実行され、MPPサーバはどこにも接続されていないことを示している。
この効果は、局所的に走る27ビリオンの小さなモデルで最大であり、全ての作業が完了する間は、足場全体の費用は139倍であった。
13の厳密なMCP-to-CLI比は0.43倍から29倍の範囲であり、両面に外れ値があった。
2つのインターフェースは失敗のコストで分離され、CMPランに費やされたお金の12.9%はCLIランで2.2%の完成品を買わなかったが、その頻度でではなかった。
エージェントは割り当てられたインターフェースを頻繁に無視するため、実際の振る舞いを検証していない比較は未知の混合を測定する。
ハーネス、タスク、検証、完全なデータセットはオープンソースとしてリリースされる。
関連論文リスト
- SkillGLoW: Procedural-Family Skill Consolidation for Self-Improving Agents on Long-Horizon Task Streams [55.90739575113059]
再利用の欠如は、関連するタスクのクラスタによって共有される解決手順であり、その周りでSkillGLoWを構築している、と我々は主張する。
4つのベンチマーク(数学的推論、端末の自動化、ソフトウェア修復、実施制御)と3つのモデルで、前者は平均17.2ポイント(ハード)を獲得している。
論文 参考訳(メタデータ) (2026-09-02T07:31:18Z) - The reach of a verification tool decides its value: A controlled study of verification surface, artifact quality, and cost in AI coding agents [0.0]
本研究は, エージェントが出荷するソフトウェアの品質に一致する成長をもたらすのは, 表面のみである。
条件ブラインドされた人間は、すべてのアプリケーションを凍結したアーティファクトに対してグレードし、自動プローブは、API観測可能な振る舞いをストレステストした。
論文 参考訳(メタデータ) (2026-08-28T18:59:07Z) - Joint Optimization of Tool Creation and Use for Large Language Model Agents [69.07066297088187]
SMITH (-grounded Multi-task Iterative Tool Honing) は、単一のポリシー内でツールの作成とツールの使用を訓練する。
SMITHで訓練された4B Qwen3は、正確に検証された13の手続き的推論タスクで、保持されたタスクで平均79.8のマクロ平均精度に達する。
また、TabMWP-Hardでは40.4、ドメイン外のGQAでは42.6に到達している。
論文 参考訳(メタデータ) (2026-08-25T13:59:34Z) - When Does Restricting a Coding Agent to execute_code Help? A Regime $\times$ Agent-Design Ablation [20.672156968511587]
合成計算タスクとSWE-bench Mini修正タスクにおける3アームアブレーション(ベースライン/bash_only/code_only)の比較を行った。
結果として得られた4つの(登録、エージェント)細胞全体で、エージェントを1つの execute_code MCP ツールに制限することは、最も安価なツールリッチなライバルである -- あるいは統計的に結びついている -- よりも安価である。
唯一の例外はSWE-bench/Claudeである。
論文 参考訳(メタデータ) (2026-07-12T04:52:08Z) - DynamicMCPBench: A Trace-Grounded, Effect-Scored Benchmark for LLM Agents over Live MCP Servers [0.0]
固定データセットではなく再利用可能なフレームワークであるDynamicMCPBenchを紹介する。
現実的な目標を生成し、それぞれの目標を追求し、成功軌道を記録し、その軌跡をパスに依存しない効果チェックポイントに蒸留し、最終的な答えにはない、それらの効果を再現するかどうかをエージェントにスコアする。
最強のエージェントでさえタスクの約半分しか解決せず、タスクの31%はモデル無しで解決され、必要なツールチェーンが長くなるにつれて精度が低下する。
論文 参考訳(メタデータ) (2026-07-10T12:25:57Z) - PairCoder++: Pair Programming as a Universal Paradigm for Verified Code-Driven Multimodal and Structured-Artifact Generation [51.92442051257354]
PairCoderは、実行のみではなく、完全な公式メトリックスイート上で、アーティファクトが検証可能なすべてのベンチマークを本質的に改善する。
TikZのコンパイルレートは、各モデルで10から30ポイント、シングルモデルの2.9から9.2倍である。
論文 参考訳(メタデータ) (2026-07-02T08:36:02Z) - ClawArena-Team: Benchmarking Subagent Orchestration and Dynamic Workflows in Language-Model Agents [61.184954205350984]
ClawArena-Teamは、41のマルチターン、マルチモーダル、マルチエージェントシナリオのベンチマークである。
全体的なスコア -- Subagent-Management Score (SMS) -- は、タスクの正しさを最小限のプライマリとモダリティのルーティング因子によって乗算する。
論文 参考訳(メタデータ) (2026-06-30T06:06:08Z) - GUI vs. CLI: Execution Bottlenecks in Screen-Only and Skill-Mediated Computer-Use Agents [57.03233891304263]
18のアプリケーションと12のワークフローカテゴリにわたる440のデスクトップタスクの一致した実行層ベンチマークを導入する。
最強のGUIエージェントが59.1%のフルパスレートに達し、48.2%で最強のオリジナルスキルCLIエージェントを上回りました。
論文 参考訳(メタデータ) (2026-06-22T17:05:07Z) - CoAgent: Concurrency Control for Multi-Agent Systems [3.127039011380953]
本稿では、古典的なトランザクションに欠ける能力に基づいて制御を構築する。
起動時にシリアライズ順序を修正し、各順序フィルタリングされた値を読み出し、投機的に書き込みを適用する。
オンラインの25ツールライブラリを成長させ、タスクパスレートを45/71から63/71に引き上げる。
論文 参考訳(メタデータ) (2026-06-13T16:15:14Z) - Multi-agent Collaboration with State Management [21.19345862774123]
複数のエージェントが同時に共有を編集すると、その変更は静かに衝突し、一貫性のないビューは統合の失敗につながる。
既存のマルチエージェントシステムはワークスペース分離(エージェント毎に1つのgitワークツリーなど)を通じてこの問題に対処している。
マルチエージェントコラボレーションのためのSTORM,すなわちSTate-Oriented Managementを提案する。
論文 参考訳(メタデータ) (2026-05-19T23:45:33Z) - Covering Human Action Space for Computer Use: Data Synthesis and Benchmark [59.01879944842542]
コンピュータ利用エージェント(CUA)は、GPT-5.4とClaudeによって説明されているように、画面上での作業を自動化する。
しかし、複雑な低周波相互作用に対する信頼性はまだ貧弱であり、ユーザの信頼を制限している。
複雑な相互作用におけるモデルの能力を評価するための新しいベンチマークCUActSpotを提案する。
論文 参考訳(メタデータ) (2026-05-12T17:59:58Z) - WildClawBench: A Benchmark for Real-World, Long-Horizon Agent Evaluation [88.10947115397971]
この研究でWildClawBenchは、6つのテーマのカテゴリにまたがる60の人間によるバイリンガルなマルチモーダルタスクのネイティブランタイムベンチマークである。
各タスクは、約8分間のウォールクロック時間と20以上のツールコールで実行されます。
グラディングはハイブリッドであり、決定論的ルールベースのチェック、副作用の環境状態監査、意味的検証のためのLLM/VLM判定を組み合わせている。
論文 参考訳(メタデータ) (2026-05-11T17:49:43Z) - Beyond Max Tokens: Stealthy Resource Amplification via Tool Calling Chains in LLM Agents [31.789859492703016]
エージェント・ツール通信ループは、Large Language Model (LLM)エージェントにおけるクリティカルアタックサーフェスである。
既存のDoS(DoS)攻撃は、この新しいパラダイムには効果がない。
正常に完了したタスクのヒントのもと、ツール層で機能するステルスで多ターンの経済DoS攻撃を導入する。
論文 参考訳(メタデータ) (2026-01-16T02:47:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。