論文の概要: The Harness Effect: How Orchestration Design Sets the Token Economics of Enterprise Agentic AI
- arxiv url: http://arxiv.org/abs/2607.06906v1
- Date: Wed, 08 Jul 2026 01:58:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 22:50:30.248671
- Title: The Harness Effect: How Orchestration Design Sets the Token Economics of Enterprise Agentic AI
- Title(参考訳): ハーネス効果: オーケストレーション設計がエンタープライズエージェントAIのトーケン経済をいかに構築するか
- Authors: Muayad Sayed Ali, Aliaksandra Novik, Anji Boddupally, Artem Yavorskyi, Chris Nickerson, Daniel Rica, Emily DuGranrut, Felix Leung, Garrett Prince, Grace Barnett, Heath Robinson, Hosain Al Ahmad, Jesse Resnick, Juan Carlos Farah, Jyothi Swaroop Meruga, Leonid Kuznetsov, Luke Gorham, Marie Schmoll, Michael Paciullo, Saumya Das, Sharath Sheripally, Tommy Griscom, Mykyta Osadchyi, Neha Mantri, Nick Westrum, Olivia Benowitz, Parikshith Kulkarni, Radik Chernyshov, Rakshith Vasudev, Rohith Nadimpally, Vikas Gangadevi, Waseem AlShikh,
- Abstract要約: 今日のエージェントAI開発はトークンの最大化で動作する。
単価の下落はパターンを覆しており、いずれにせよ総支出は増加する。
我々はトークンの最大化に対する決定的なレバーがハーネスであると主張している。
- 参考スコア(独自算出の注目度): 8.387065289628376
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Agentic AI development today runs on token maxing: buying capability with tokens -- longer reasoning traces, more turns, wider tool payloads, bigger replayed contexts -- so tokens per task grow faster than task value. Falling per-token prices mask the pattern; total spend rises anyway. We argue the decisive lever against token maxing is the harness: the orchestration layer that assembles context, exposes tools, sequences turns, delegates work, and carries enterprise observability and governance. We isolate it with a controlled swap: 22 locked evaluation tasks, six foundation models (Claude Sonnet 4.6, Gemini 3.1, Gemini Flash 3.5, Qwen 3.6, GLM 5.1, Palmyra X6), changing only the orchestration layer -- a frozen conventional production loop versus the Writer Agent Harness. Holding models constant, the harness cuts blended cost per task 41% ($0.21->$0.12), median wall-clock 44% (48s->27s), and tokens per task 38% (14.2k->8.8k), with task-completion quality at parity (0.78->0.81, directional at this sample size). Efficiency is model-invariant -- every model gets cheaper (33-61%) -- while quality gains are capability-dependent: a model's gain correlates almost perfectly with its baseline strength (r=0.99, n=6), a phenomenon we term harness leverage. Quality per dollar rises 82%; task-completions per million tokens rise from 54.9 to 92.0. On this workload the orchestration layer moved cost per task more than the full spread of the model menu did. We formalize token economics at the orchestration layer (including effective input price under prompt caching), detail the six mechanism families behind the effect -- cache-shape discipline to failure-spend governance -- compare six widely used agent systems on the same axes, and argue the harness is the one component whose efficiency multiplies across every model an organization runs -- present and future.
- Abstract(参考訳): 今日のエージェントAI開発ではトークンの最大化が実現している。トークン -- 長い推論トレース、より多くのターン、より広いツールペイロード、より大きなリプレイコンテキスト – によって、タスク単位のトークンはタスク値よりも高速に成長する。
単価の下落はパターンを覆しており、いずれにせよ総支出は増加する。
コンテキストを組み立て、ツールを公開し、シークエンスをターンし、仕事を委譲し、エンタープライズの可観測性とガバナンスを行うオーケストレーション層です。
22のロックされた評価タスク、6つの基礎モデル(Claude Sonnet 4.6, Gemini 3.1, Gemini Flash 3.5, Qwen 3.6, GLM 5.1, Palmyra X6)で分離し、オーケストレーション層のみを変更しました。
モデルが一定であれば、ハーネスはタスク毎のコストを41%(0.21->$0.12)、中央壁時計44%(48s->27s)、タスク毎のトークンを38%(14.2k->8.8k)、タスク補完品質を同等に(0.78->0.81、このサンプルサイズの方向)ブレンドする。
効率性はモデル不変であり、全てのモデルがより安く(33-61%)なり、品質の上昇は能力に依存します。
1ドルあたりの品質は82%上昇し、タスク・コンプリート当たりのトークン数は54.9から92.0に増加した。
このワークロードにおいて、オーケストレーションレイヤは、モデルメニューのフルスプレッドよりも、タスク毎のコストを削減した。
私たちは、オーケストレーション層(即時キャッシュによる効果的な入力価格を含む)でのトークン経済を形式化し、その効果の背後にある6つのメカニズムファミリー -- キャッシュ形状の規律から障害分散ガバナンス -- を同じ軸上の6つの広く使用されているエージェントシステムと比較します。
関連論文リスト
- SciOrch: Learning to Orchestrate Expert LLMs for Solving Frontier Multimodal Scientific Reasoning Tasks [65.14594927081983]
SciOrchは、科学的な推論のためにフロンティアLSMを編成する軽量8Bモデルを訓練するフレームワークである。
SGI-ReasoningとScientificsの最初の試験にまたがる240回の試験セットでは、SciOrchの平均精度は56.66%に達した。
また、一般的なマルチエージェントメソッドのAPIコストの半分未満で、SGIとSFEの両方で最高の精度を実現する。
論文 参考訳(メタデータ) (2026-06-14T15:45:34Z) - The Deterministic Horizon: When Extended Reasoning Fails and Tool Delegation Becomes Necessary [13.891522069967507]
拡張連鎖推論は決定論的状態追跡タスクのパフォーマンスを低下させる。
ツール統合推論がニューラル・チェーン・オブ・シントを一貫して上回ることを示す。
本研究は, エージェントシステムにおいて, 純粋なニューラル推論がハイブリッドアプローチにいつ適用されるべきかについて, 基本的ガイダンスを提供する。
論文 参考訳(メタデータ) (2026-05-29T21:35:23Z) - The Capability Paradox: How Smarter Auditors Make Multi-Agent Systems Less Secure [11.822284421559814]
これは、有害な要求がドメイン固有の物語の中に隠され、Workerレポートを通じてマネージャに伝達される攻撃である。
労働者の能力が増加するにつれて、平均的なシステムレベルの攻撃成功率(ASR)は18.4%から63.9%に増加し、94.4%がピークである。
非対称なドメイン能力とWorkersのペアを組み合わさった異種アンサンブル検証を提案する。
論文 参考訳(メタデータ) (2026-05-17T14:42:44Z) - Not All Tokens Need 40 Steps: Heterogeneous Step Allocation in Diffusion Transformers for Efficient Video Generation [53.176242285107485]
速度のダイナミクスに基づいて異なる冗長トークンに様々なステップ予算を割り当てる動き自由推論を導入する。
結果として生じるシーケンス長ミスマッチを解決するため、HSAはKV-cache機構を導入し、アクティブトークンが全シーケンスに参加することができる。
We evaluate HSA on the Wan-2 and LTX-2 models for both text-to-video (T2V) and image-to-video (2V) generation。
論文 参考訳(メタデータ) (2026-05-07T19:49:47Z) - Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses [57.20181537213498]
Agentic Harness Engineering (AHE)は、ハーネスエンジニアリングを自動化するクローズドループである。
AHEは3つの一致した可観測性柱を通じて課題に対処する。
10 AHE lift pass@1 on Terminal-Bench 2 from 69.7% to 77.0%。
SWE-bench-verifiedでは、種子よりも12%少ないトークンで合計成功率を上回り、ターミナルベンチ2では+5.1から+10.1ppのクロスファミリーゲインを得る。
論文 参考訳(メタデータ) (2026-04-28T16:55:02Z) - Three Roles, One Model: Role Orchestration at Inference Time to Close the Performance Gap Between Small and Large Agents [0.4666493857924357]
複雑なマルチステップ環境において,推論時足場のみに追加のトレーニング計算を使わずに,小さなモデルの性能を向上させることができるかどうかを検討した。
我々は,AppWorldベンチマークのQwen3-8Bを,完全精度と4ビット量子化構成の両方で評価した。
本格的な推測では、私たちの足場付き8Bモデルは、オリジナルのAppWorld評価からDeepSeek-Coder 33Bインストラクション(7.1%)を上回っています。
論文 参考訳(メタデータ) (2026-04-13T13:40:33Z) - LLMOrbit: A Circular Taxonomy of Large Language Models -From Scaling Walls to Agentic AI Systems [3.183924309596046]
この調査では、8つの相互接続軌道次元を通して、15の組織にわたる50以上のモデルを調査した。
1)データ不足(2026-2028年までに減少する9-27Tトークン)、(2)指数的なコスト増加(5年間で3M~3M+)、(3)持続不可能なエネルギー消費(22倍)の3つの重大な危機を識別する。
トレーニング後ゲイン(RLHF, GRPO, pure RL)、DeepSeek-R1(79.8% MATH)、効率革命(MoEルーティング18x効率、マルチヘッド遅延注意8xKVキャッシュ圧縮)により、GPT-4レベルのパフォーマンスを$で実現している。
論文 参考訳(メタデータ) (2026-01-20T15:06:19Z) - Towards a Science of Scaling Agent Systems [79.64446272302287]
エージェント評価の定義を定式化し,エージェント量,コーディネーション構造,モデル,タスク特性の相互作用として,スケーリング法則を特徴付ける。
協調指標を用いて予測モデルを導出し,R2=0をクロスバリデーションし,未知のタスク領域の予測を可能にする。
ツールコーディネーショントレードオフ: 固定的な計算予算の下では, ツールヘビータスクはマルチエージェントのオーバーヘッドから不均衡に悩まされ, 2) 能力飽和: 調整が減少または負のリターンを, 単一エージェントのベースラインが45%を超えると達成できる。
論文 参考訳(メタデータ) (2025-12-09T06:52:21Z) - Robust and Performance Incentivizing Algorithms for Multi-Armed Bandits with Strategic Agents [52.75161794035767]
性能インセンティブとロバストネスの2つの目的を同時に満たすバンディットアルゴリズムのクラスを導入する。
そこで本研究では,第2価格オークションのアイデアをアルゴリズムと組み合わせることで,プリンシパルが腕の性能特性に関する情報を持たないような設定が可能であることを示す。
論文 参考訳(メタデータ) (2023-12-13T06:54:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。