論文の概要: Harnessing LLMs as Agents: What Does It Cost?
- arxiv url: http://arxiv.org/abs/2610.02488v2
- Date: Tue, 06 Oct 2026 18:59:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 21:58:22.329806
- Title: Harnessing LLMs as Agents: What Does It Cost?
- Title(参考訳): エージェントとしてのLLMのハーネス:何のコストか?
- Abstract要約: 言語モデルエージェントは、コンテキスト、永続メモリ、検証、繰り返し実行を管理するハーネスにますます依存している。
本稿では,言語モデルエージェントマシン(Language Model Agent Machine,LAM)を紹介する。
- 参考スコア(独自算出の注目度): 34.501638251435715
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Language-model agents increasingly rely on harnesses that manage bounded context, persistent memory, tools, verification, and repeated execution, yet existing notions of model capability do not quantify the computational resources these mechanisms consume. We introduce the Language Model Agent Machine (LAM), a resource-bounded abstraction that fixes the underlying semantic model while explicitly charging harness-level resources. We establish four classes of results. Communication: LAM execution is instancewise equivalent to red--blue pebbling under simultaneous call--transfer budgets, transferring classical I/O lower bounds to context--memory traffic. Access: memory interfaces induce asymptotic separations, including a $Θ(n)$ gap between random and non-speculative sequential access on pointer chasing. Recomputation: bit-reversal DAGs require $Θ(n^2/(C+S)+n)$ model calls with context capacity $C$ and persistent-memory capacity $S$, quantifying when stored intermediate state avoids repeated semantic computation. Reliability: we derive tight stage-local sampling bounds, exact imperfect-verification costs, and a Young--Daly-type checkpoint law with a closed-form optimal verification interval. Controlled and held-out experiments on GPT-6 Astra test communication and reliability predictions, including checkpoint optima, policy selection under programmatic checking, and tradeoffs among call granularity, logical input traffic, and reliability on chained MATH tasks. Together, these results provide a resource theory for the computational cost of language-model agent harnesses.
- Abstract(参考訳): 言語モデルエージェントは、コンテキスト境界、永続メモリ、ツール、検証、繰り返し実行を管理するハーネスにますます依存していますが、既存のモデル能力の概念は、これらのメカニズムが消費する計算リソースを定量化しません。
本稿では,言語モデルエージェントマシン(Language Model Agent Machine,LAM)を紹介する。
結果のクラスは4つです。
通信: LAMの実行は、例外的に、同時呼び出し-転送の予算の下で赤青のペブリングと等価であり、古典的なI/Oローバウンドをコンテキストメモリトラフィックに転送する。
アクセス: メモリインターフェースは、ポインタ追跡におけるランダムアクセスと非投機的なシーケンシャルアクセスのギャップを含む、漸近的な分離を誘導する。
再計算:bit-reversal DAGは、コンテキストキャパシティ$C$と永続メモリキャパシティ$S$のモデルコールを必要とする。
信頼性: 厳密なステージ局所サンプリング境界, 正確な不完全検証コスト, および閉形式最適検証区間を有するヤングデイリー型チェックポイント法を導出する。
GPT-6におけるテスト通信と信頼性予測の制御および維持実験には、チェックポイント最適化、プログラムチェックによるポリシー選択、呼び出し粒度間のトレードオフ、論理入力トラフィック、連鎖MATHタスクの信頼性が含まれる。
これらの結果は、言語モデルエージェントハーネスの計算コストに関するリソース理論を提供する。
関連論文リスト
- clifford qc: A Python Toolkit for Quantum Simulation [0.0]
clifford_qcは、量子モデルを構築するためのPythonリサーチツールキットである。
ハミルトン、密度演算子、ゲート、および候補選択オブザーバブルを接続する。
専用インタフェースは、回路プログラム、実行、統計的推定を扱う。
論文 参考訳(メタデータ) (2026-09-19T14:45:38Z) - From Sequence to Structure: Relational Uncertainty Propagation for LLM Agents [75.69180947909148]
大規模言語モデル(LLM)エージェントのためのトラジェクトリレベルのUQフレームワークを提案する。
RuPAは、推論状態、ツールインタラクション、環境フィードバックが時間的およびセマンティックな依存関係エッジで接続されたノードである、指向的なトラジェクトリグラフとして実行履歴を表現している。
我々は,複数のモデルファミリにまたがる6つのオープンソースLCMを用いて,代用エージェントベンチマーク($2, Terminal-Bench-2, GAIA)でRUPAを評価した。
論文 参考訳(メタデータ) (2026-08-17T01:40:14Z) - Scaling Laws for Agent Harnesses via Effective Feedback Compute [53.68149869349268]
emphEffective Feedback Compute (EFC)は、情報的、有効、非冗長な場合にのみフィードバックを信用し、その後の決定のために保持するトレースレベルのスケーリング座標である。
EFCベースの座標は、生の計算ベースラインよりも失敗率を常に予測する。
論文 参考訳(メタデータ) (2026-05-28T09:45:47Z) - Adaptive Test-Time Compute Allocation for Reasoning LLMs via Constrained Policy Optimization [18.737087162461563]
テストタイムの計算スケーリングは、大規模言語モデルのパフォーマンスを向上させるための強力なレバーとなっている。
しかし、これらのテクニックを有限の推論予算の下で展開するには、現在のシステムがほとんど無視する決定が必要である。
我々はこれを制約付き最適化問題(平均計算予算の予測精度を最大化する)として定式化し、2段階のソルベ・テン・ラーンパイプラインで解いた。
論文 参考訳(メタデータ) (2026-04-16T10:39:22Z) - Phase Transition for Budgeted Multi-Agent Synergy [41.486076708302456]
マルチエージェントシステムは信頼性を向上させることができるが、固定された推論予算の下では、しばしば役立つか、飽和するか、崩壊するかさえある。
我々は、現代のエージェントスタックの3つの束縛制約からこれらの状態を予測する最小限の校正可能な理論を開発する。
論文 参考訳(メタデータ) (2026-01-24T05:32:50Z) - Tractable Asymmetric Verification for Large Language Models via Deterministic Replicability [0.6117371161379209]
大規模言語モデル(LLM)の展望は、動的でマルチエージェントなシステムへと急速にシフトします。
本稿では, トラクタブルな非対称な作業を実現するための検証フレームワークを提案する。
対象検定は全再生の12倍以上の速さで行うことができる。
論文 参考訳(メタデータ) (2025-09-14T03:30:06Z) - Are You Getting What You Pay For? Auditing Model Substitution in LLM APIs [71.7892165868749]
LLM(Commercial Large Language Model) APIは基本的な信頼の問題を生み出します。
ユーザーは特定のモデルに課金するが、プロバイダが忠実に提供できることを保証することはない。
我々は,このモデル置換問題を定式化し,現実的な逆条件下での検出方法を評価する。
我々は,信頼された実行環境(TEE)を実用的で堅牢なソリューションとして使用し,評価する。
論文 参考訳(メタデータ) (2025-04-07T03:57:41Z) - COrAL: Order-Agnostic Language Modeling for Efficient Iterative Refinement [80.18490952057125]
反復改良は、複雑なタスクにおける大規模言語モデル(LLM)の能力を高める効果的なパラダイムとして登場した。
我々はこれらの課題を克服するために、コンテキストワイズ順序非依存言語モデリング(COrAL)を提案する。
当社のアプローチでは、管理可能なコンテキストウィンドウ内で複数のトークン依存関係をモデル化しています。
論文 参考訳(メタデータ) (2024-10-12T23:56:19Z) - Coded Stochastic ADMM for Decentralized Consensus Optimization with Edge
Computing [113.52575069030192]
セキュリティ要件の高いアプリケーションを含むビッグデータは、モバイルデバイスやドローン、車両など、複数の異種デバイスに収集され、格納されることが多い。
通信コストとセキュリティ要件の制限のため、核融合センターにデータを集約するのではなく、分散的に情報を抽出することが最重要となる。
分散エッジノードを介してデータを局所的に処理するマルチエージェントシステムにおいて,モデルパラメータを学習する問題を考える。
分散学習モデルを開発するために,乗算器アルゴリズムの最小バッチ交互方向法(ADMM)のクラスについて検討した。
論文 参考訳(メタデータ) (2020-10-02T10:41:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。