論文の概要: Compression, structure, and executor capability: a controlled real-cost decomposition of language-model agent skill optimisation
- arxiv url: http://arxiv.org/abs/2607.03048v1
- Date: Fri, 03 Jul 2026 07:37:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 13:06:45.349524
- Title: Compression, structure, and executor capability: a controlled real-cost decomposition of language-model agent skill optimisation
- Title(参考訳): 圧縮・構造・実行能力:言語モデルエージェントスキル最適化のリアルタイム分解制御
- Authors: Xiaonan Xu, Wenjing Wu,
- Abstract要約: ツールを使用する言語モデルに提供された再利用可能な命令アーチファクトであるエージェントスキルは、短縮、構造的書き換え、より強力なモデルコンパイル、スコープローディングによって、ますます最適化されている。
本研究では,10のスキルデリバリ条件,40のソフトウェアエンジニアリングタスク,3つのセル毎の繰り返し(1,200ロールアウト)に対して,制御された分解を報告した。
スキルなしの実行、生スキル、決定論的短縮、線形で構造化されたレンダリングと共有セマンティック台帳、スコープローディング、コンパイラと実行モデル層を分離する。
- 参考スコア(独自算出の注目度): 1.6787220460106658
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Agent skills, reusable instruction artefacts supplied to a tool-using language model, are increasingly optimised by shortening, structural rewriting, stronger-model compilation, and scoped loading, on the assumption that a smaller or better-organised skill lowers cost while preserving success. That assumption is rarely tested with quality and real monetary cost measured on the same runs and the contributing factors separated. This study reports a controlled decomposition over ten skill-delivery conditions, 40 software-engineering tasks, and three repetitions per cell (1,200 rollouts), separating no-skill execution, raw skills, deterministic shortening, linear and structured rendering from a shared semantic ledger, scoped loading, and the compiler and executor model tiers. Quality is the verifier pass rate at task level; cost is solve-stage token cost at standard provider prices, with a token-volume-normalised view for robustness and compilation cost amortised separately. The task is the unit of inference, intervals are task-clustered, and the contrast family is multiplicity-controlled. Deterministic shortening is close to the raw baseline but does not establish non-inferiority within the preset margin. Structured rendering and scoped loading lower pass rate on the compact executor without lowering cost, and structured rendering is indistinguishable from linear text at matched content. The only contrast surviving correction is executor capability, which raises pass rate by 27 percentage points at roughly five times the real cost, with compiler tier showing no robust effect. Under real prices no optimised representation reaches a practical break-even. The evidence indicates that executor capability is the dominant lever and that no representation strategy improves over the raw skill on either executor tier.
- Abstract(参考訳): ツール使用言語モデルに供給される再利用可能な命令アーチファクトであるエージェントスキルは、成功を保ちながら、より小さく、より優れた組織化されたスキルがコストを低下させるという前提で、短縮、構造的書き換え、より強力なモデルコンパイル、スコープローディングによって最適化される。
この仮定は、同じランで測定された品質と実際の金銭的コストと、寄与要因を分離してテストされることはめったにない。
本研究では,10のスキルデリバリ条件,40のソフトウェアエンジニアリングタスク,3つのセル毎の繰り返し(1,200のロールアウト),非スキル実行,生スキル,決定論的ショートニング,共有セマンティック台帳からの線形および構造的レンダリング,スコープローディング,コンパイラと実行モデル層を分離した。
品質はタスクレベルでの検証パスレートであり、コストは標準提供者価格における解決段階のトークンコストであり、堅牢性とコンパイルコストは別々に補正されるトークン量正規化ビューである。
タスクは推論の単位であり、インターバルはタスククラスタ化され、コントラストファミリーは多重性制御される。
決定論的短縮は原ベースラインに近いが、予め設定されたマージン内では非負性を確立しない。
コンパクトエグゼキュータにおける構造化レンダリングとスコープローディングの低パスレートはコストを下げることなく実現し、構造化レンダリングは一致した内容の線形テキストと区別できない。
唯一のコントラスト補正はエグゼキュータ能力であり、パスレートが27ポイント上昇し、実際のコストの約5倍になる。
実際の価格では、最適化された表現は実質的なブレークスルーに達しない。
この証拠は、実行能力が支配的なレバーであり、どちらの実行能力層においても、表現戦略が生のスキルよりも改善されることを示唆している。
関連論文リスト
- A Stackelberg Framework for Resource-Aware LLM Agents: Learning, Repair, and Conditional Guarantees [1.9381445674403615]
大規模言語モデル(LLM)エージェントは、マルチターンシステムがコンテキストを割り当て、冗長性を促し、有限の計算予算の下でツールアクセスを行なわなければならないため、ますます運用されるようになっている。
コントローラは品質目標とコストインセンティブにコミットし、エグゼキュータはコンテキスト、プロンプト、ツール使用に関するリソースアクションに応答します。
我々は条件付き応答モデルを学び、そのモデルに対してリーダーポリシーを最適化し、実際のAPIキャリブレーションとプロジェクションを用いて結果のポリシーを修復する。
論文 参考訳(メタデータ) (2026-06-22T08:38:22Z) - What Should a Skill Remember? Quality--Cost Trade-offs in Cost-Aware Skill Rewriting for Language Model Agents [58.87681796862133]
我々は経済的なレンズを通してスキルの書き直しを勉強する。
我々のフレームワークは、情報保存戦略を用いて、スキル構造をプロファイルし、スキルを書き換える。
SkillsBenchの実験は、戦略間の異なる品質とコストのトレードオフを明らかにしている。
論文 参考訳(メタデータ) (2026-06-08T12:36:51Z) - Scaling Laws for Agent Harnesses via Effective Feedback Compute [53.68149869349268]
emphEffective Feedback Compute (EFC)は、情報的、有効、非冗長な場合にのみフィードバックを信用し、その後の決定のために保持するトレースレベルのスケーリング座標である。
EFCベースの座標は、生の計算ベースラインよりも失敗率を常に予測する。
論文 参考訳(メタデータ) (2026-05-28T09:45:47Z) - A Resource Comparison of Logical T-State Preparation [5.4190091415164]
我々は,マジックステート蒸留,マジックステート栽培,コードスイッチングの3つの代表的な準備経路を比較した。
ソースのネイティブコスト単位を保持し、出力エラーを記録し、単一試行コスト、承認されたアウトプット毎の期待コスト、フットプリント、レイテンシ、各構成に対するレポート完全性を保持します。
論文 参考訳(メタデータ) (2026-05-26T04:09:50Z) - Context, Reasoning, and Hierarchy: A Cost-Performance Study of Compound LLM Agent Design in an Adversarial POMDP [3.774094352572544]
プログラム状態抽象化は、使用されるトークン当たりの最大のリターンを提供する。
階層をまたいだ議論ツールの配布は、階層のみに対するパフォーマンスを低下させる。
議論のない階層分解は、ほとんどのモデルにとって最高の絶対的な性能を達成する。
論文 参考訳(メタデータ) (2026-05-15T17:23:08Z) - IMPACT-CYCLE: A Contract-Based Multi-Agent System for Claim-Level Supervisory Correction of Long-Video Semantic Memory [73.22944697933603]
既存のパイプラインは不透明でエンドツーエンドの出力を生成し、検査の中間状態は公開しない。
IMPACT-Cycleは,マルチモーダル反復クレームレベルのメンテナンスとして,長時間ビデオ理解を再構築するマルチエージェントシステムである。
論文 参考訳(メタデータ) (2026-04-22T03:03:33Z) - CADMAS-CTX: Contextual Capability Calibration for Multi-Agent Delegation [0.0]
CADMAS-CTXはコンテキストキャリブレーションのためのフレームワークである。
階層的なコンテキスト能力プロファイルは、静的なスキルレベルの信頼性をコンテキスト条件の後方に置き換える。
GAIAとSWE-benchベンチマークを用いて,本手法の有効性を実証的に検証した。
論文 参考訳(メタデータ) (2026-04-20T08:30:28Z) - Token-Efficient Multimodal Reasoning via Image Prompt Packaging [0.6465251961564605]
我々は、構造化されたテキストを直接イメージに埋め込んで、テキストトークンのオーバーヘッドを減らすプロンプトパラダイムであるImage Prompt Packagingを紹介する。
5つのデータセット、3つのフロンティアモデル、2つのタスクファミリでベンチマークします。
我々はトークン型で貯蓄を分解するコストを導出し、IPPgが35.8~91.0%の推論コスト削減を達成することを示す。
論文 参考訳(メタデータ) (2026-04-02T19:50:59Z) - Cost-Aware Contrastive Routing for LLMs [57.30288453580456]
我々は、プロンプトとモデルの両方を共有埋め込み空間にマッピングする軽量フレームワークであるコストスペクトルコントラストルーティング(CSCR)を紹介します。
CSCRはベースラインを一貫して上回り、精度とコストのトレードオフを最大25%改善した。
論文 参考訳(メタデータ) (2025-08-17T20:16:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。