論文の概要: Harness Tokenomics: A Router for the Enterprise Agentic Control Plane
- arxiv url: http://arxiv.org/abs/2609.28919v2
- Date: Sat, 26 Sep 2026 20:27:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-29 21:31:51.759382
- Title: Harness Tokenomics: A Router for the Enterprise Agentic Control Plane
- Title(参考訳): Harness Tokenomics: エンタープライズエージェントコントロールプレーンのルータ
- Abstract要約: 数百席のパイロットとして始まったのは、今では数万人に拡大している。
ハーネスは、どのモデル答え、モデルが何を読んだか、プロンプトキャッシュの使用方法、どのサブエージェントが実行されるかを決定する。
我々は、Jevがすべてのプロンプトをエージェント要求の所有する分類に対してラベル付けするカスタマイズ可能なルータを構築します。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Harnesses, the products that run AI coding agents, are multiplying, and enterprises are rolling them out to their employees. What started as pilots with a few hundred seats is now scaling to tens of thousands. Enterprises rarely build these harnesses and usually adopt the ones model vendors bundle with their seats and APIs, such as Anthropic's Claude Code or OpenAI's Codex. A harness decides which model answers, what the model reads, how the prompt cache is used and which subagents run, so it picks the rate on the price sheet and sets the volume bought at it. Enterprises that keep a proprietary or untuned harness at its defaults inherit these choices and their bill. We build a fast, customisable router in which Jev, a classifier with calibrated probabilities, labels every prompt against a bring-your-own taxonomy of agentic requests. One user turn is many requests over a prompt cache that belongs to one model, so the router moves work only where no running conversation has to rebuild its cache. It routes at session start, in side lanes and at subagent launch. From the price sheet we derive when a mid-task switch pays back. We also find a crossover, in which the highest-priced model costs less than the next tier on long tool-heavy sessions, and repricing about 10,000 real sessions from public datasets confirms it. In an emulated enterprise of 10,000 seats with user behaviour taken from these datasets, the router recovers 13 to 21% of model spend at Anthropic's list prices of 21 September 2026, \$3.3M to \$5.1M a year. The paper also maps the risks across twenty-one harnesses, prices the dependence on one vendor's models, and proposes a control plane that enterprises can run from within, starting now, with a ladder for deciding later whether to own the harness.
- Abstract(参考訳): AIコーディングエージェントを運用しているHarnessesは乗っ取り、企業はそれを従業員に展開している。
数百席のパイロットとして始まったのは、今では数万人に拡大している。
企業がこれらのハーネスを構築することはめったになく、一般的には、AnthropicのClaude CodeやOpenAIのCodexのような、シートとAPIをバンドルするモデルベンダを採用する。
ハーネスは、どのモデル回答、モデルが何を読んだか、プロンプトキャッシュがどのように使われ、どのサブエージェントが実行されるかを決定し、価格表のレートを選択し、購入したボリュームを設定する。
プロプライエタリあるいは未チューニングのハーネスをデフォルトに保持している企業は、これらの選択と請求を継承する。
我々は、キャリブレーションされた確率を持つ分類器であるJevが、エージェント要求の持ち込み可能な分類に対してすべてのプロンプトをラベル付けする高速でカスタマイズ可能なルータを構築します。
1人のユーザーは1つのモデルに属するプロンプトキャッシュに対して多くのリクエストを要求するので、ルータはキャッシュを再構築する必要のない場合にのみ動作する。
セッション開始時、横線、サブエージェント発射時に運行される。
価格表から、タスク中のスイッチが返却されるときに導かれる。
また、高い価格のモデルが長いツールを多用するセッションでは次のティアよりも安くなり、公開データセットから約1万の実際のセッションをリプリケートする、というクロスオーバーもある。
これらのデータセットから取得したユーザ行動を持つ1万席のエミュレートされた企業では、2026年9月21日のAnthropicのリスト価格で13~21%のモデル費用を回収し、年間3.3Mから5.1Mに値下げした。
この論文は、21台のハーネスにまたがるリスクをマップし、あるベンダーのモデルへの依存を価格設定し、企業が現在、そのハーネスを所有するかを後から決定するためのラグと共に、内部から実行可能なコントロールプレーンを提案する。
関連論文リスト
- AI Research Preference Models [87.14303218008381]
研究エージェントは、独自の機械学習実験を提案し、実装し、評価することができる。
フロンティア作業の進行は コストで妨げられています
我々は、複数の候補ソリューションのどれが実行価値が最も高いかを予測するAI Research Preference Models(RPM)を紹介する。
論文 参考訳(メタデータ) (2026-08-14T04:20:37Z) - Scrouting: Cost-Aware Routing of Coding Agents by Scouting the Repository First [0.15293427903448023]
リポジトリをスカウトした後にルートするSuperScoutを紹介します。
7B検索エンジンであるSuperScout-7Bは、まずリポジトリを探索し、構造化されたハンドオフを生成する。
検索者の隠された状態とタスクテキストは、履歴ベースのルータを送信し、4つのフロンティアフィクスラーのうちの1つにタスクをディスパッチする。
論文 参考訳(メタデータ) (2026-08-05T13:11:31Z) - Agentic Routing: The Harness-Native Data Flywheel [35.444792826526]
DRACOやPinchBenchなどのエージェントベンチマークにおけるシングルトンおよびマルチモデルルーティングに関する研究
エージェントルーティングは単なるコストコントロールではなく、エージェントネイティブなトレーニングのためのデータエンジンである、と氏は主張する。
論文 参考訳(メタデータ) (2026-07-13T11:05:55Z) - Adoption and Impact of Command-Line AI Coding Agents: A Study of Microsoft's Early 2026 Rollout of Claude Code and GitHub Copilot CLI [42.251213138623456]
AnthropicのClaude CodeやGitHubのCopilot CLIのようなエージェントコマンドラインツールをロールアウトする組織は、誰が試すか、誰が使い続けるか、ツールがコストを正当化するのに十分なアウトプットを生成するかどうかを知る必要がある。
組織規模では、トークンの支出は年間数百万ドルに膨らむ可能性があるため、採用や維持、影響の誤読は、エンジニアリングのベロシティを変えることなく、ロールアウトコストを高くする可能性がある。
最初の使用はソーシャルネットワークを通じて広まり、保持は人口統計学よりもエンジニアのコーディング活動と関連付けられ、採用者はそれ以外の場合よりもおよそ24%のプルリクエストをマージした。
論文 参考訳(メタデータ) (2026-07-01T19:24:27Z) - SWE-Router: Routing in Multi-turn Agentic Software Engineering Tasks [11.50404356970464]
マルチターンエージェントハーネスに埋め込まれた大規模言語モデル(LLM)は、ソフトウェア工学(SWE)を再構築している
しかし、多くの問題が安い修正を認めると、すべてのタスクをフロンティアモデルにルーティングするのは無駄です。
SWEは,探索的なターン数回で安価なモデルを実行し,結果として生じる部分軌道を読み取る,価値に基づく時間的アプローチである。
本稿では,SWEタスクのコスト効率を大幅に向上すると同時に,より強力なモデルの性能の大部分を維持しながら,SWEタスクのコスト効率を大幅に向上させることを示す。
論文 参考訳(メタデータ) (2026-06-30T01:46:26Z) - Cluster, Route, Escalate: Cascaded Framework for Cost-Aware LLM Serving [69.5155152169752]
大規模言語モデル(LLM)のための2段階カスケードソリューションを提案する。
ステージ1は、受信するクエリをクラスタ化し、各クラスタを最もコスト効率の良いモデルに割り当てる。
ステージ2は品質推定(QE)カスケードを追加し、ステージ1からの出力が低品質であると判断されると、クエリはより強力なモデルにエスカレーションされる。
テストデータセットでは、カスケードシステムは最強モデルの精度の97-99%を保持し、TPOT(Time Per Output Token)を削減している。
タスクの正確性ラベルのみを必要とし、手動で再構成することなくモデルプールの変更に適応する。
論文 参考訳(メタデータ) (2026-06-25T18:29:24Z) - The Scaffold Effect in Coding Agents: Harness Choice as a Hidden Variable in Coding-Agent Evaluation [0.0]
Qwen 3.6 PlusとMiniMax M2.5を3つのオープンソースハーネスで評価した。
ハーネスの選択は、解決されたタスク毎のトークンの最大40倍の違いを誘導する。
トークン/レイテンシー予算の下で、パスレートでハーネスモデルペアを選択することを推奨する。
論文 参考訳(メタデータ) (2026-06-08T20:27:06Z) - Holistic Agent Leaderboard: The Missing Infrastructure for AI Agent Evaluation [87.47155146067962]
数百のタスクで並列評価をオーケストレーションする,標準化された評価ハーネスを提供する。
モデル、足場、ベンチマークにまたがる3次元解析を行う。
私たちの分析では、ほとんどのランで精度を低下させる高い推論努力など、驚くべき洞察が示されています。
論文 参考訳(メタデータ) (2025-10-13T22:22:28Z) - Cost-Aware Contrastive Routing for LLMs [57.30288453580456]
我々は、プロンプトとモデルの両方を共有埋め込み空間にマッピングする軽量フレームワークであるコストスペクトルコントラストルーティング(CSCR)を紹介します。
CSCRはベースラインを一貫して上回り、精度とコストのトレードオフを最大25%改善した。
論文 参考訳(メタデータ) (2025-08-17T20:16:44Z) - Pre-train and Search: Efficient Embedding Table Sharding with
Pre-trained Neural Cost Models [56.65200574282804]
効率的なシャーディングのための「事前訓練・探索」パラダイムを提案する。
NeuroShardは、さまざまなシャーディングシナリオをカバーするために、拡張テーブル上のニューラルコストモデルをトレーニングする。
NeuroShardは、ベンチマークシャーディングデータセットの最先端を著しく、一貫して上回る。
論文 参考訳(メタデータ) (2023-05-03T02:52:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。