論文の概要: EarlyEval: Cheaper Agent Evaluation via Early Outcome Prediction
- arxiv url: http://arxiv.org/abs/2609.02783v1
- Date: Wed, 02 Sep 2026 16:15:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 17:53:18.468431
- Title: EarlyEval: Cheaper Agent Evaluation via Early Outcome Prediction
- Title(参考訳): EarlyEval: 早期アウトカム予測によるチーパエージェントの評価
- Authors: Yuling Shi, Zhensu Sun, Junsen Dong, Chengcheng Wan, David Lo, Xiaodong Gu,
- Abstract要約: 我々は,各タスクのコストを削減するために,効率の相補軸である早期結果予測を導入する。
EarlyEvalはエージェントステップの13%-26%、入力トークン44.1%、出力トークン29.4%を89%~97%の精度で除去できる。
- 参考スコア(独自算出の注目度): 14.50182233464472
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Evaluating LLM agents is essential for guiding their development, yet it has grown prohibitively expensive: a single pass of a frontier model over an agentic benchmark can cost hundreds to thousands of dollars, a price paid repeatedly across iterative development cycles. Prior efforts, centered on benchmark distillation, reduce the number of evaluation tasks but leave the cost of executing each retained task untouched. In this work, we introduce early outcome prediction, a complementary axis of efficiency that instead cuts cost within each task. Our key insight is that an agent's final outcome is often evident from its intermediate behavior well before execution completes. We instantiate this idea in EarlyEval, a lightweight framework that trains a pair of LightGBM success and failure classifiers over behavioral, textual, and reference-solution features, and halts an agent run the moment either classifier crosses a calibrated confidence threshold, adding negligible per-step overhead. Across three benchmarks, SWE-bench Verified, TerminalBench, and Toolathlon, EarlyEval can eliminate 13%-26% of agent steps and up to 44.1% input tokens and 29.4% output tokens at 89%-97% prediction accuracy, while perturbing per-agent resolve rates by only one to two percentage points on average.
- Abstract(参考訳): エージェントベンチマークよりもフロンティアモデルの単一パスは、反復的な開発サイクルを通じて繰り返し支払われる数百~数千ドルである。
以前の取り組みは、ベンチマークの蒸留を中心に、評価タスクの数を削減したが、保持された各タスクを実行するコストは未変更のままである。
本研究では,各作業におけるコスト削減を図り,効率の相補軸である早期結果予測を導入する。
我々の重要な洞察は、エージェントの最終結果は、実行が完了するずっと前に中間的な振る舞いから明らかになることが多いということです。
このアイデアは、LightGBMの成功と失敗の分類器を振る舞い、テキスト、参照-解決機能に対してトレーニングする軽量フレームワークであるEarlyEvalでインスタンス化されます。
3つのベンチマーク(SWE-bench Verified, TerminalBench, Toolathlon)で、EarlyEvalはエージェントステップの13%-26%、最大44.1%の入力トークンと29.4%の出力トークンを89%-97%の精度で除去できる。
関連論文リスト
- Not Worth Another Token: Marginal Value Estimation for Efficient Deep Research Agents [69.57766200248706]
深層研究エージェントの文脈管理における限界値推定について検討する。
我々は, 検索前, 検索後, 合成前において, 軽量な基準と学習価値モデルを評価する。
ライトウェイトは、少ない品質劣化でトークンの使用量を最大73%削減し、学習されたプルーニングは、選択されたトレードオフにおいて競争力を持ち、品質、効率、忠実性で1つの方法が支配することはない。
論文 参考訳(メタデータ) (2026-08-09T00:56:37Z) - To Run or Not to Run: Analyzing the Cost-Effectiveness of Code Execution in LLM-Based Program Repair [18.653708704742353]
実行には時間がかかり費用もかかるが、プログラム修復エージェントへの影響は未調査のままである。
コード実行は分析されたすべてのエージェントとモデルで使用され、タスク毎に平均8.8のテスト実行が実行される。
現在のエージェントは実行を無差別に適用し、ほとんど利益が得られないインスタンスにコストを支払う。
論文 参考訳(メタデータ) (2026-06-25T12:49:59Z) - ESPO: Early-Stopping Proximal Policy Optimization [78.79610718910628]
ESPO(Early-Stopping Proximal Policy Optimization)は、軌道上の障害を検出し、ロールアウトを早期に終了する。
DeepSeek-R1-Distill-Qwen-7Bでは、ESPOはAIME2024(46.28%対45.25%)、AMC2023(85.83%対82.94%)、MATH-500(87.42%対85.43%)でPPOを上回っている。
論文 参考訳(メタデータ) (2026-05-28T12:40:22Z) - A1: A Fully Transparent Open-Source, Adaptive and Efficient Truncated Vision-Language-Action Model [112.9420001646428]
VLA(Vision-Language-Action)モデルは、オープンワールドロボット操作の強力なパラダイムとして登場したが、実際の展開はコストに制約されることが多い。
我々は、低コストで高スループットな推論のために設計された、完全にオープンソースで透明なVLAフレームワークであるA1を提示する。
A1は最先端の成功率を達成すると同時に、推論コストを大幅に削減する。
論文 参考訳(メタデータ) (2026-04-07T10:18:40Z) - Efficient Benchmarking of AI Agents [0.0]
小型タスクサブセットがエージェントランキングを極めて低コストで維持できるかどうかを検討する。
絶対スコア予測は足場駆動の分布シフトで低下することがわかった。
本稿では,中間的履歴パス率を持つタスクに対してのみ,新しいエージェントを評価できる最適化フリープロトコルを提案する。
論文 参考訳(メタデータ) (2026-03-24T22:17:11Z) - EET: Experience-Driven Early Termination for Cost-Efficient Software Engineering Agents [22.98266662213199]
EETは、ソフトウェアエンジニアリングエージェントのエクスペリエンス駆動の早期終了アプローチである。
タスクパフォーマンスを維持しながら、SEエージェントのコストを削減する。
EETは総コストを19%-55%削減し、解決率の低下は無視できる。
論文 参考訳(メタデータ) (2026-01-09T13:01:49Z) - ZIP-RC: Optimizing Test-Time Compute via Zero-Overhead Joint Reward-Cost Prediction [57.799425838564]
ZIP-RCは、モデルに報酬とコストのゼロオーバーヘッド推論時間予測を持たせる適応推論手法である。
ZIP-RCは、同じまたはより低い平均コストで過半数投票よりも最大12%精度が向上する。
論文 参考訳(メタデータ) (2025-12-01T09:44:31Z) - Forecasting Frontier Language Model Agent Capabilities [0.7499722271664147]
言語モデル(LM)の下流能力を予測する6つの予測手法を評価する。
計算やモデルリリース日などの入力メトリクスからベンチマークスコアを直接予測する"ワンステップ"アプローチや、クロスベンチマークパフォーマンス(PC-1)や人間による競争力のあるElo評価といった中間メトリックを最初に予測する"ツーステップ"アプローチを採用しています。
当社の予測では,2026年初めまでに,能力の低い非特殊化LMエージェントがSWE-Bench Verifiedで54%,最先端LMエージェントが87%の成功率に達すると予測されている。
論文 参考訳(メタデータ) (2025-02-21T02:34:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。