論文の概要: Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading
- arxiv url: http://arxiv.org/abs/2607.08964v2
- Date: Mon, 13 Jul 2026 06:00:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.273244
- Title: Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading
- Title(参考訳): 縦-縦-縦-縦-縦-横-縦-横-縦-縦-横-縦-縦-縦-横-横-縦-縦-横-横-縦-横-縦-横-縦-横-横-縦-横-横-縦-横-横-縦-横-横-縦-横-横-横-横-横-縦-横-横-横-縦-横-横-横-横-横-横-横-縦-横-横-横-縦-縦
- Authors: Zongxia Li, Zhongzhi Li, Yucheng Shi, Ruhan Wang, Junyao Yang, Zhichao Liu, Xiyang Wu, Anhao Li, Yue Yu, Ninghao Liu, Lichao Sun, Haotao Mi, Leowei Liang,
- Abstract要約: Long-Horizon-Terminal-Benchは、9つのカテゴリにまたがる46の長距離タスクの終端ベンチマークである。
各タスクは、参照ソリューションまたはシミュレーションエンジンを備えたターミナルベンチスタイルのセットアップに従うが、さらにきめ細かいサブタスクに格付けされる。
我々は15のフロンティアモデルを評価し、エージェントがタスク毎に平均9.9Mトークンを消費していることを発見した。
- 参考スコア(独自算出の注目度): 46.911171278867585
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: AI agents have become capable of autonomously completing short, well-specified tasks. However, existing terminal benchmarks largely focus on simple problems that finish within minutes and are evaluated only by their final outcome. This setup overlooks intermediate progress and partial solutions, yielding sparse reward signals and an incomplete picture of agent capability. We introduce Long-Horizon-Terminal-Bench, a terminal benchmark of 46 long-horizon tasks spanning nine categories, including experiment reproduction, software engineering, multimodal analysis, interactive games, and scientific computing. Each task follows a Terminal-Bench-style setup with a reference solution or simulation engine, but is further decomposed into fine-grained graded subtasks. This design enables dense intermediate rewards and partial credit, allowing evaluation to capture not only whether an agent reaches the final goal, but also how far it progresses on open-ended workflows. Tasks in Long-Horizon-Terminal-Bench typically require hundreds of episodes and minutes to hours of execution, stressing long-horizon planning, long-context management, and iterative debugging rather than one-shot problem solving. We evaluate 15 frontier models and find that agents consume on average 9.9M tokens per task, with roughly 231 episodes and 85.3 minutes of execution time per run, making Long-Horizon-Terminal-Bench more demanding than prior terminal-based benchmarks. Even the strongest tested model achieves 15.2% pass@1 at a partial-reward threshold of 0.95 and 10.9% at a perfect-reward threshold of 1.0, while the mean pass rate across models is 4.3% and 1.7% under the two thresholds, respectively. These results reveal headroom for improvement. We further analyze failure modes and error patterns, and release Long-Horizon-Terminal-Bench to support future progress on long-horizon terminal agents.
- Abstract(参考訳): AIエージェントは、短時間で明確に特定されたタスクを自律的に完了することができるようになった。
しかし、既存の端末ベンチマークは主に数分で終了し、最終的な結果によってのみ評価される単純な問題に焦点を当てている。
このセットアップは中間進行と部分解を見落とし、スパース報酬信号とエージェント能力の不完全な図を生成する。
実験再現,ソフトウェア工学,マルチモーダル解析,インタラクティブゲーム,科学計算など,9つのカテゴリにまたがる46の長期タスクの端末ベンチマークであるLong-Horizon-Terminal-Benchを紹介する。
各タスクは、参照ソリューションまたはシミュレーションエンジンを備えたターミナルベンチスタイルのセットアップに従うが、さらにきめ細かいグレードのサブタスクに分解される。
この設計は、密集した中間報酬と部分クレジットを可能にし、エージェントが最終ゴールに達するかどうかだけでなく、オープンなワークフローでどこまで進歩するかを評価できる。
Long-Horizon-Terminal-Benchのタスクは通常、数百のエピソードと数分から数時間の実行を必要とする。
我々は15のフロンティアモデルを評価し、エージェントがタスクあたり平均9.9Mトークンを消費し、約231回、実行時間85.3分を1ラン当たりで実行し、従来の端末ベースのベンチマークよりも要求されるロングホライゾン・ターミナル・ベンチを実現する。
最も強いテストモデルでさえ、パーシャルリワード閾値0.95で15.2%、完全リワード閾値1.0で10.9%、モデルの平均パスレートが2つのしきい値以下で4.3%、平均パスレート1.7%に達する。
これらの結果は、改善のためのヘッドルームを明らかにします。
さらに、障害モードとエラーパターンを分析し、ロングホライズン端末エージェントの今後の進歩をサポートするためにロングホライズン端末ベンチをリリースする。
関連論文リスト
- OSWorld2.0: Benchmarking Computer Use Agents on Long-Horizon Real-World Tasks [98.07146747892239]
OSWorld 2.0は、日常的および専門的なタスクにまたがる108の長い水平コンピュータ使用のベンチマークである。
各タスクは現実的なエンド・ツー・エンドのワークフローを表しており、人間のユーザーの中央値は1.6時間である。
論文 参考訳(メタデータ) (2026-06-28T17:59:17Z) - SWE-Marathon: Can Agents Autonomously Complete Ultra-Long-Horizon Software Work? [11.093716663660203]
SWE-Marathonは、ソフトウェアエンジニアリングと隣接する技術ドメインにまたがる20の長期タスクのベンチマークである。
各タスクは、ユニークな実行環境、人間による参照ソリューション、多層検証スイートで構成される。
ログエージェントは平均27.2Mのトークンを試み、SWE-Marathonは既存のSWEやコマンドラインエージェントのベンチマークよりもかなり長くなる。
論文 参考訳(メタデータ) (2026-06-05T00:39:44Z) - Odysseys: Benchmarking Web Agents on Realistic Long Horizon Tasks [67.44219836008348]
我々はOdysseysについて紹介する。Odysseysは、ライブインターネット上で評価された実世界のブラウジングセッションから得られた200のロングホライゾンWebタスクのベンチマークである。
その結果,2進パス/フェイル評価は長距離設定では不十分であり,各Odysseysタスクに平均6.1グレードのルーリックをアノテートするルーリックに基づく評価が導入された。
最強のモデルは44.5%の成功率に達しており、将来の改善の余地は十分にある。
論文 参考訳(メタデータ) (2026-04-27T20:05:41Z) - Scaling Test-Time Compute for Agentic Coding [126.72747643609274]
本稿では,ロールアウト軌跡のコンパクトな表現に基づくエージェントコーディングのためのテスト時間スケーリングフレームワークを提案する。
当社のフレームワークは,各ロールアウトを,その健全な仮説,進捗,障害モードを保存する構造的な要約に変換する。
提案手法は,SWE-Bench Verified および Terminal-Bench v2.0 におけるフロンティア符号化エージェントの性能を一貫して改善する。
論文 参考訳(メタデータ) (2026-04-16T17:39:33Z) - LongCLI-Bench: A Preliminary Benchmark and Study for Long-horizon Agentic Programming in Command-Line Interfaces [65.11019654023978]
LongCLI-Benchは、長期にわたる現実的なタスクにまたがるエージェント能力を評価するために設計されたベンチマークである。
私たちは、1000以上のコンピュータサイエンスの課題と現実世界のタスクから、20の高品質で長い水平タスクをキュレートしました。
実験によると、最先端のエージェントでさえLongCLI-Benchの20%未満のパスレートを達成する。
論文 参考訳(メタデータ) (2026-02-15T23:12:57Z) - Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces [126.23612941699565]
Terminal-Bench 2.0は、現実世界の問題に触発されたコンピュータ端末環境における89のタスクからなるベンチマークである。
ベンチマークでは、フロンティアモデルとエージェントのスコアが65%未満であることが示されています。
将来的にはhttps://www.tbench.ai/で開発者や研究者を支援するために、データセットと評価ハーネスを公開しています。
論文 参考訳(メタデータ) (2026-01-17T01:29:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。