論文の概要: The Scaffold Effect in Coding Agents: Harness Choice as a Hidden Variable in Coding-Agent Evaluation
- arxiv url: http://arxiv.org/abs/2607.22585v1
- Date: Mon, 08 Jun 2026 20:27:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-02 22:55:38.977867
- Title: The Scaffold Effect in Coding Agents: Harness Choice as a Hidden Variable in Coding-Agent Evaluation
- Title(参考訳): 符号化剤のしゃがみ効果:符号化エージェント評価における隠れた選択性
- Abstract要約: Qwen 3.6 PlusとMiniMax M2.5を3つのオープンソースハーネスで評価した。
ハーネスの選択は、解決されたタスク毎のトークンの最大40倍の違いを誘導する。
トークン/レイテンシー予算の下で、パスレートでハーネスモデルペアを選択することを推奨する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Public leaderboards for coding agents typically rank systems by model name and pass rate, while the surrounding harness (the scaffold that issues tools, manages context, and decides when to stop) is often under-specified. Model-to-model comparison is valid when the harness is fixed; when it varies, performance and efficiency conflate model and scaffold effects. We evaluate Qwen 3.6 Plus and MiniMax M2.5 across three open-source harnesses (Goose, OpenCode, OpenHands-SDK) on a stratified 50-task subset of Terminal-Bench Pro. Harness choice induces up to a 40x difference in tokens per solved task, while paired within-model pass-rate differences remain 0-8 percentage points (95% paired-task bootstrap CIs include zero except for the largest gap). Failure fingerprints replicate across models (REASON for Goose, VERIFY/MAX_TURNS for OpenHands-SDK, idle-loop/TIME for OpenCode), indicating harness-level biases that are largely model-independent. For human-centered coding-agent evaluation, model name alone is an incomplete comparison unit: harness-model pairs determine real-world cost, latency, and oversight burden; no-action turns are a per-task wait tax, not just a token tax. We therefore recommend selecting harness-model pairs by pass rate under token/latency budgets, and reporting token usage, latency, and full harness specifications alongside any model comparison. We release anonymized configs, raw trial logs, aggregated snapshots, and analysis scripts.
- Abstract(参考訳): コーディングエージェントのための公開リーダーボードは、通常、システムにモデル名とパスレートでランク付けするが、周囲のハーネス(ツールを発行し、コンテキストを管理し、いつ停止するかを決める足場)はしばしば不特定である。
モデルとモデルの比較は、ハーネスが固定されたときに有効である。
オープンソースハーネス(Goose, OpenCode, OpenHands-SDK)にまたがるQwen 3.6 PlusとMiniMax M2.5を, Terminal-Bench Proの50タスクサブセットで評価した。
ハーネス選択は、解決されたタスク毎のトークンの最大40倍の違いを誘導する一方、モデル内のパスレート差は0-8ポイントのままである(95%のペアタスクブートストラップCIは、最大のギャップを除いてゼロを含む)。
失敗指紋はモデル間で複製される(GooseのREASON、OpenHands-SDKのVERIFY/MAX_TURNS、OpenCodeのアイドルループ/TIME)。
人間中心のコーディングエージェント評価では、モデル名だけでは不完全な比較単位である: ハーネスモデルペアは実際のコスト、レイテンシ、監視上の負担を決定する。
したがって、トークン/レイテンシ予算のパスレートによるハーネスモデルペアの選択や、トークンの使用率、レイテンシ、フルハーネス仕様の報告をモデル比較と合わせて推奨する。
匿名設定、生のトライアルログ、集計スナップショット、分析スクリプトをリリースしています。
関連論文リスト
- HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness? [61.02699867449589]
評価単位をタスク出力から実行インフラストラクチャにシフトするベンチマークであるHarnessDevを紹介します。
Creationでは、エージェントは最小限のシードと少数のケースから始まり、完全な実行システムを構築する。
Evolutionでは、独自のハーネスから始まり、ベンチマークのパフォーマンス向上を目標として、下流の実行フィードバックを使用して反復的に修正する。
論文 参考訳(メタデータ) (2026-09-01T15:45:33Z) - Same Model, Different Harness: Different Coding-Agent Results [0.0]
3つのベンチマークで同じハーネスの2つの構成を比較した。
コントロールは時間順に完全な会話を供給し、処理は同一の記録を保持するが、機械的には古いツールの結果を短縮する。
厳密な状況下では、この処理は3つの圧力比較で平均1タスク当たりのフェール・ツー・パス分率(F2PF)を上昇させる。
論文 参考訳(メタデータ) (2026-08-26T11:55:44Z) - Agent Behavioral Contracts II: Certifying Compositional Reliability Without Assuming Independence [0.0]
1つのモデルの2つの例は、2つのエージェントのハンドオフにおいて、ミッションの90.0%で共失敗する。
異なるモデルの置換は、6つのコントラストのうち6つのコントラストの関連を減少させる。
論文 参考訳(メタデータ) (2026-08-13T07:25:05Z) - Surrogate Fidelity: When Can Open LLMs Explain Closed Ones? [6.786301369955054]
予測,属性,表現レベルでの代理的忠実度を評価する。
注意パターンや大きさのようなホワイトボックス信号は、モデル間で非常に安定しているが、因果属性の弱い予測しかできない。
論文 参考訳(メタデータ) (2026-06-30T17:43:44Z) - Cluster, Route, Escalate: Cascaded Framework for Cost-Aware LLM Serving [69.5155152169752]
大規模言語モデル(LLM)のための2段階カスケードソリューションを提案する。
ステージ1は、受信するクエリをクラスタ化し、各クラスタを最もコスト効率の良いモデルに割り当てる。
ステージ2は品質推定(QE)カスケードを追加し、ステージ1からの出力が低品質であると判断されると、クエリはより強力なモデルにエスカレーションされる。
テストデータセットでは、カスケードシステムは最強モデルの精度の97-99%を保持し、TPOT(Time Per Output Token)を削減している。
タスクの正確性ラベルのみを必要とし、手動で再構成することなくモデルプールの変更に適応する。
論文 参考訳(メタデータ) (2026-06-25T18:29:24Z) - Dissecting model behavior through agent trajectories [15.811597127775812]
私たちはインテント・エグゼクティブのギャップを形式化し、モデルが意図するものと、ハーネスが実行しているものとのミスマッチと、その逆です。
このハーネスモデルアライメントの効果を説明するために,SSA(Simple Strands Agent)と呼ばれるシンプルでカスタマイズ可能なハーネスを開発した。
i) 一般的なエージェントベンチマークにおいて,多種多様なモデルプロジェクタファミリーが報告したpass@1のパフォーマンスを再現または改善し, (ii) SSAが生成した128k軌道の解析に基づいて構築する。
論文 参考訳(メタデータ) (2026-06-16T03:17:03Z) - Catch Your Breath: Adaptive Computation for Self-Paced Sequence Production [55.76222360698305]
我々は,言語モデルが入力トークン毎に使用する計算ステップの数を動的かつ自律的に拡張できるような,教師付きトレーニング目標のクラスを探索する。
任意のトークンに対して、モデルは don't know> 出力を出力することで、追加の計算ステップを要求できる。
CYBモデルでは精度が向上し,トークンレベルの複雑性とコンテキストに処理時間を適用することができる。
論文 参考訳(メタデータ) (2025-10-13T21:07:05Z) - Every Step Counts: Decoding Trajectories as Authorship Fingerprints of dLLMs [63.82840470917859]
本稿では,dLLMの復号化機構をモデル属性の強力なツールとして利用できることを示す。
本稿では、デコードステップ間の構造的関係を捉え、モデル固有の振る舞いをよりよく明らかにする、DDM(Directed Decoding Map)と呼ばれる新しい情報抽出手法を提案する。
論文 参考訳(メタデータ) (2025-10-02T06:25:10Z) - Ranked from Within: Ranking Large Multimodal Models Without Labels [73.96543593298426]
ソフトマックス分布から導かれる不確実性スコアは,様々なタスクにまたがるランキングモデルに対して,ロバストな基礎となることを示す。
これにより、ラベルのないデータに対するLMMのランク付けが容易になり、手動のアノテーションを必要とせずに、多様なターゲットドメインのモデルを選択するための実践的なアプローチを提供する。
論文 参考訳(メタデータ) (2024-12-09T13:05:43Z) - When Liebig's Barrel Meets Facial Landmark Detection: A Practical Model [87.25037167380522]
正確で、堅牢で、効率的で、一般化可能で、エンドツーエンドのトレーニングが可能なモデルを提案する。
精度を向上させるために,2つの軽量モジュールを提案する。
DQInitは、インプットからデコーダのクエリを動的に初期化し、複数のデコーダ層を持つものと同じ精度でモデルを実現する。
QAMemは、共有するクエリではなく、それぞれのクエリに別々のメモリ値を割り当てることで、低解像度のフィーチャーマップ上のクエリの識別能力を高めるように設計されている。
論文 参考訳(メタデータ) (2021-05-27T13:51:42Z) - AvgOut: A Simple Output-Probability Measure to Eliminate Dull Responses [97.50616524350123]
機能エンジニアリングなしで、どの発話やトークンが退屈であるかを動的に認識する対話モデルを構築します。
最初のモデルMinAvgOutは、各バッチの出力分布を通して、ダイバーシティスコアを直接最大化する。
第2のモデルであるラベルファインチューニング(LFT)は、多様性スコアによって連続的にスケールされたラベルをソースシーケンスにプリペイドし、多様性レベルを制御する。
3つ目のモデルであるRLは強化学習を採用し、多様性スコアを報奨信号として扱う。
論文 参考訳(メタデータ) (2020-01-15T18:32:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。