論文の概要: What Does a Harness Buy? Tokens, Mostly
- arxiv url: http://arxiv.org/abs/2610.04433v1
- Date: Sat, 03 Oct 2026 10:47:10 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 20:24:05.858151
- Title: What Does a Harness Buy? Tokens, Mostly
- Title(参考訳): ハーネスは何を買うのか?
- Abstract要約: 生産ハーネスは毎日出荷され、ベンダーはハーネスの変更によるパスレートの上昇を宣伝している。
ほとんど測定されないのは、モデルが固定されたときにハーネス自身がどれだけスコアを動かすかである。
私たちはClaude Code、mini-SWE-agent、OpenCodeという3つのプロダクションハーネスで5つのモデルを実行しています。
- 参考スコア(独自算出の注目度): 9.563027159959587
- License:
- Abstract: A coding agent is a language model wrapped in a harness: the system prompt, the tool set, and the context management that turn a chat model into something that can work inside a repository. Production harnesses ship releases daily, vendors advertise pass-rate gains from harness changes, and leaderboards mix harnesses freely. What is rarely measured is how much the harness itself moves the score when the model is held fixed. We run five models through three production harnesses, Claude Code, mini-SWE-agent, and OpenCode, on SWE-bench Verified, and rerun the same configurations to calibrate how much a score moves when nothing changes but the run. On 447 tasks and the two models we ran there, Claude Code and mini-SWE-agent, the heaviest and the lightest harness, are equivalent within five points. On a 45-task hard subset and five models, swapping the harness flips as many tasks as rerunning the same harness, 13% in both cases, and the tasks a harness wins in one run are not the tasks it wins in the next. The one harness effect that clears the noise is a loss, not a gain: OpenCode trails by up to 9 points on the large pool, and on one model half of that gap sits in runs its output cap cut short. What the harness does decide is the bill. With the same model, the same tasks, and one price list, cost per task differs by up to 3x across harnesses. The gap is set at the first call, by the preamble of system prompt and tool schemas each harness sends with every step, and scaled by the number of steps; per-step growth and per-call tool output differ far less. The provider's price for cached input scales the bill and does not reorder it. The rerun data also give the resolution a harness comparison needs: at the discordance we observe, 45 tasks catch a 13-point gap only half the time and no gap with 80% power, and 447 tasks resolve 5 points, still coarser than the gains many harness changes claim.
- Abstract(参考訳): コーディングエージェントは、システムプロンプト、ツールセット、チャットモデルをリポジトリ内で動作可能なものに変換するコンテキスト管理など、ハーネスでラップされた言語モデルである。
生産ハーネスは毎日出荷され、ベンダーはハーネスの変更によるパスレートゲインを宣伝し、リーダーボードはハーネスを自由に混ぜる。
ほとんど測定されないのは、モデルが固定されたときにハーネス自身がどれだけスコアを動かすかである。
私たちは、SWE-bench Verified上で、Claude Code、mini-SWE-agent、OpenCodeの3つのプロダクションハーネスを通じて5つのモデルを実行し、同じ設定を実行して、何も変更されていない場合にスコアがどれだけ動くかを調整します。
447のタスクとそこで実行した2つのモデル、Claude CodeとMini-SWE-agentでは、最も重いハーネスと軽いハーネスが5ポイント以内で同等です。
45タスクのハードサブセットと5つのモデルでは、ハーネスは同じハーネスを再走させるのと同じくらい多くのタスクを切り替える。
OpenCodeは、大きなプールで最大9ポイントまでパスし、そのギャップの1つのモデルでは、そのギャップの半分がアウトプットキャップを短くしている。
ハーネスが決めるのは法案です。
同じモデル、同じタスク、ひとつの価格リストで、タスク毎のコストはハーネス毎に最大3倍まで異なる。
ギャップは最初の呼び出しで設定され、システムプロンプトとツールスキーマのプリアンブルによって各ハーネスが各ステップで送信され、ステップ数によってスケールされる。
キャッシュされた入力に対するプロバイダの価格は、請求書をスケールし、それを再注文しない。
45のタスクが13ポイントのギャップをわずかに捉え、80%のパワーでギャップをなくし、447のタスクが5ポイントを解決します。
関連論文リスト
- MedicalHarness: A Controlled Evaluation of LLMs and Agent Harnesses on Medical Tasks [31.961716768954236]
医療エージェントのハーネスでどれだけの結果が変わるかは、めったに測定されていない。
医療タスクにおけるモデルとエージェントハーネスの制御された研究であるメディカルハーネスについて紹介する。
我々は、ハーネスとそのモデルとの相互作用が結果のばらつきの約4分の1を占めることを発見した。
論文 参考訳(メタデータ) (2026-10-05T04:22:28Z) - SHarP: Saliency-based Pruning of Agent Harnesses [55.076331468597594]
Agentは、モデル呼び出し、ツールの使用、タスクの実行を調整することで、大規模な言語モデルが複雑なタスクを完了するのを助ける。
結果として、いくつかのハーネスモジュールが冗長であるかどうかは不明である。
ニューラルネットワークのプルーニングにインスパイアされた我々は、タスクパフォーマンスとトークンコストのバランスを改善する手段として、ハーネスプルーニングを研究した。
論文 参考訳(メタデータ) (2026-10-03T00:41:14Z) - Finding the Right Fit: Model-Harness Interactions across Agent Tasks [27.66428507366024]
4つのハーネス(OpenHands, DeepSeek Harness, PI, openJiuwen)とTUA-Bench, ALE-CLI, Terminal-Bench 4の5つのモデルを組み合わせた66の構成を評価した。
5つのモデルのうち4つのモデルでは、最高のハーネスが1つのベンチマークから別のベンチマークに変更されるが、いくつかのペアリングは保持される。
論文 参考訳(メタデータ) (2026-10-01T01:49:59Z) - Self-Evolving Harness on Multiple Tasks with the Agent as Its Own Optimizer [0.0]
ハーネスとは、プロンプトを整理し、ツールを呼び出し、コンテキストを管理し、実行を制御する言語モデルエージェントを取り巻くコードである。
既存のほとんどの手法では、人間によって設計されたハーネス上で実行される別のプロポーザがソルバのハーネスを変更し、ベンチマーク毎に別のハーネスが進化する。
再帰的自己改善に近いフレームワークを提案する: 同じフリーズモデルであるハーネスの同じバージョンにおいて、まず解法としてタスクを解き、続いて提案者として、完全な実行レコードを読み出し、実行中のハーネスを直接編集する。
進化過程を2段階の深層学習訓練として捉えた。
論文 参考訳(メタデータ) (2026-09-29T18:33:27Z) - HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness? [61.02699867449589]
評価単位をタスク出力から実行インフラストラクチャにシフトするベンチマークであるHarnessDevを紹介します。
Creationでは、エージェントは最小限のシードと少数のケースから始まり、完全な実行システムを構築する。
Evolutionでは、独自のハーネスから始まり、ベンチマークのパフォーマンス向上を目標として、下流の実行フィードバックを使用して反復的に修正する。
論文 参考訳(メタデータ) (2026-09-01T15:45:33Z) - WHALE: A Simple Recipe for Joint Harness-Weight Optimization [48.550149284101536]
WHALE(Weight-Harness Alternating LEarning)は、2つのフェーズを切り替えるレシピである。
3つの領域にわたるQwen3.5-2B/4Bエージェント(質問応答、数学的推論、チェスパズル)を使用して、WHALEは重量のみ、ハーネスのみ、Fast-Slow Trainingの4.15-24.38ポイントを最高の平均@8の精度で上回る。
論文 参考訳(メタデータ) (2026-08-31T18:12:55Z) - JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution [74.58840188662151]
JIT-Agentは、タスク適応エージェントハーネスをオンザフライで合成するために訓練されたハーネスインテリジェンスモデルである。
JIT-Agentは、ジャスト・イン・タイムのハーネス生成のために構築された最初のモデルである。
論文 参考訳(メタデータ) (2026-08-26T10:05:33Z) - There Is No Neutral Harness: Modern LLM Leaderboards Are Manufactured by Config-Fragile Items [1.14219428942199]
複数選択ベンチマークは、質問と正しい答えを修正しますが、ハーネスではありません。
スコアのばらつきを報告し、そのばらつきがどの項目に該当するかを未検討のままにし、それらが次のモデルから切り離した項目であるかどうかを報告する。
12のオープンウェイト命令チューニングLDMが4つのベンチマークから同じ3,679の項目に回答する。
論文 参考訳(メタデータ) (2026-07-17T00:28:29Z) - The Scaffold Effect in Coding Agents: Harness Choice as a Hidden Variable in Coding-Agent Evaluation [0.0]
Qwen 3.6 PlusとMiniMax M2.5を3つのオープンソースハーネスで評価した。
ハーネスの選択は、解決されたタスク毎のトークンの最大40倍の違いを誘導する。
トークン/レイテンシー予算の下で、パスレートでハーネスモデルペアを選択することを推奨する。
論文 参考訳(メタデータ) (2026-06-08T20:27:06Z) - Harness Updating Is Not Harness Benefit: Disentangling Evolution Capabilities in Self-Evolving LLM Agents [82.27610290890475]
i) ハーネス更新、(i) 実行証拠から有用な永続的ハーネス更新を生成する能力、(ii) ハーネスベネフィット、タスク解決時に更新されたハーネスの恩恵を受ける能力の2つのハーネス自己進化能力を分析した。
まず、ハーネス更新は基本能力において平坦である:異なる能力階層のモデルがハーネス更新を生成し、驚くほど類似したゲインをもたらす。
第二に、ハーネスベネフィットは基本能力において単調ではない:弱い層モデルは更新されたハーネスからほとんど恩恵を受けず、中層モデルは最も恩恵を受け、強い層モデルは中層より利益が低い。
論文 参考訳(メタデータ) (2026-05-28T22:16:14Z) - Meta-Harness: End-to-End Optimization of Model Harnesses [52.31507076660471]
本稿では,大規模言語モデル(LLM)アプリケーションのためのコード検索を行う外部ループシステムであるMeta-Harnessを紹介する。
オンラインテキスト分類では、Meta-Harnessは4倍少ないコンテキストトークンを使用しながら、最先端のコンテキスト管理システムを7.7ポイント改善する。
検索強化数学推論では、200 IMOレベルの問題の精度を5つの保留モデルの平均4.7ポイント向上する。
論文 参考訳(メタデータ) (2026-03-30T05:33:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。