論文の概要: TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents
- arxiv url: http://arxiv.org/abs/2606.28480v1
- Date: Fri, 26 Jun 2026 17:59:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:15.582262
- Title: TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents
- Title(参考訳): TUA-Bench:汎用端末エージェントのベンチマーク
- Abstract要約: 本稿では,端末利用エージェントの汎用ベンチマークであるTUA-Benchを紹介する。
TUA-Benchには5つのタスクファミリーにわたる120の現実世界タスクが含まれている。
我々は最強のフロンティア・エージェントが65.8%の総合的なパフォーマンスを達成することを発見した。
- 参考スコア(独自算出の注目度): 37.00898251261264
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: As large language models and harness frameworks continue to advance, agents operating in terminals are increasingly capable of performing a broader range of general computer-use tasks beyond coding. However, existing benchmarks do not adequately evaluate general-purpose terminal computer-use agents (TUAs): general computer-use benchmarks primarily target graphical user interfaces (GUIs), whereas terminal-based benchmarks largely emphasize technical and programming-centric workflows historically native to the shell. We introduce TUA-Bench, a general-purpose benchmark for terminal-use agents. TUA-Bench includes 120 real-world tasks across five task families, covering routine digital activities-including document editing, email management, and live-web information seeking-as well as scientific and engineering workflows co-designed with PhD-level domain experts that require specialized software. This breadth distinguishes TUA-Bench from prior shell-focused or domain-specific benchmarks. Each task is manually designed, runs in a real terminal with a deterministic setup script, and is evaluated by an execution-based scoring protocol. We find that the strongest frontier agent, Claude Code with Claude Opus 4.8 max reasoning effort, achieves 65.8% overall performance, with substantial gaps across both tracks. By providing a broad and realistic evaluation of terminal-use capabilities, TUA-Bench aims to accelerate the transition from narrow, task-specific assistants to general-purpose agents capable of operating reliably across diverse digital environments.
- Abstract(参考訳): 大規模言語モデルとハーネスフレームワークが進歩を続けるにつれて、端末で操作するエージェントは、コーディングを超えて幅広い汎用的なコンピュータタスクを実行できるようになる。
しかし、既存のベンチマークは汎用端末コンピュータ利用エージェント(TUA)を適切に評価していない:汎用コンピュータ利用ベンチマークは主にグラフィカルユーザインタフェース(GUI)をターゲットにしているが、ターミナルベースのベンチマークは歴史的にシェルに固有の技術的およびプログラミング中心のワークフローを主に重視している。
本稿では,端末利用エージェントの汎用ベンチマークであるTUA-Benchを紹介する。
TUA-Benchは5つのタスクファミリにまたがる120の現実世界のタスクが含まれており、ドキュメント編集、Eメール管理、ライブウェブ情報検索などの定期的なデジタル活動や、専門ソフトウェアを必要とする博士レベルのドメインエキスパートと共同で設計された科学および工学のワークフローをカバーしている。
この幅は、TUA-Benchと、以前のシェルやドメイン固有のベンチマークとを区別する。
各タスクは手動で設計され、決定論的セットアップスクリプトを備えた実際の端末で実行され、実行ベースのスコアリングプロトコルによって評価される。
最強のフロンティアエージェントであるClaude Codeは、Claude Opus 4.8max推論の努力により、総合的なパフォーマンスを65.8%達成し、両トラック間に大きなギャップがあることがわかった。
端末利用能力の広範かつ現実的な評価を提供することにより、TUA-Benchは、狭義のタスク特化アシスタントから、多様なデジタル環境を確実に操作できる汎用エージェントへの移行を加速することを目指している。
関連論文リスト
- OSWorld2.0: Benchmarking Computer Use Agents on Long-Horizon Real-World Tasks [98.07146747892239]
OSWorld 2.0は、日常的および専門的なタスクにまたがる108の長い水平コンピュータ使用のベンチマークである。
各タスクは現実的なエンド・ツー・エンドのワークフローを表しており、人間のユーザーの中央値は1.6時間である。
論文 参考訳(メタデータ) (2026-06-28T17:59:17Z) - WeaveBench: A Long-Horizon, Real-World Benchmark for Computer-Use Agents with Hybrid Interfaces [27.11445886768225]
WeaveBenchは,8つの実世界の作業領域に114のタスクを持つ,長期にわたるハイブリッドインターフェースベンチマークである。
デプロイされたCLIエージェントランタイム内の実際のUbuntuデスクトップ上でこれらのタスクを評価し、最小限のデスクトップコントロールプラグインで拡張します。
フロンティアのモデルと実行時のペアリング全体では、最高のPassRateは41.2%にしか達せず、ベンチマークは飽和状態には程遠い。
論文 参考訳(メタデータ) (2026-06-08T12:39:23Z) - TerminalWorld: Benchmarking Agents on Real-World Terminal Tasks [23.863417507169697]
TerminalWorldはスケーラブルなデータエンジンで、"in-the-wild"端末からの高忠実度評価タスクを自動的にリバースエンジニアリングする。
エンジンは1,530の検証されたタスクの完全なベンチマークを取得し、18の現実世界のカテゴリにまたがる。
TerminalWorldは、既存のExpert-Verifiedベンチマークとは異なる現実世界の端末機能をキャプチャする。
論文 参考訳(メタデータ) (2026-05-21T14:24:43Z) - WindowsWorld: A Process-Centric Benchmark of Autonomous GUI Agents in Professional Cross-Application Environments [34.06270058972]
WindowsWorldは、現実世界のプロのアクティビティを反映した複雑なマルチステップタスクでGUIエージェントを評価するように設計されている。
本手法では,16の職業によって構成されたマルチエージェント・フレームワークを用いて,4つの困難レベルタスクを生成する。
ベンチマークには181のタスクが含まれ、17の一般的なデスクトップアプリケーションで平均5.0のサブゴールがある。
論文 参考訳(メタデータ) (2026-04-30T12:13:27Z) - Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces [126.23612941699565]
Terminal-Bench 2.0は、現実世界の問題に触発されたコンピュータ端末環境における89のタスクからなるベンチマークである。
ベンチマークでは、フロンティアモデルとエージェントのスコアが65%未満であることが示されています。
将来的にはhttps://www.tbench.ai/で開発者や研究者を支援するために、データセットと評価ハーネスを公開しています。
論文 参考訳(メタデータ) (2026-01-17T01:29:30Z) - DeepAgent: A General Reasoning Agent with Scalable Toolsets [111.6384541877723]
DeepAgentは、自律的な思考、ツール発見、アクション実行を実行するエンドツーエンドのディープ推論エージェントである。
長期にわたる相互作用の課題に対処するために,過去の相互作用を構造化エピソード,動作,ツール記憶に圧縮する自律的メモリ折り畳み機構を導入する。
LLMシミュレートされたAPIを活用し、ツール呼び出しトークンにきめ細かいクレジットを割り当てるツールコールアドバンテージ属性を適用した、エンドツーエンドの強化学習戦略であるToolPOを開発した。
論文 参考訳(メタデータ) (2025-10-24T16:24:01Z) - Scaling Computer-Use Grounding via User Interface Decomposition and Synthesis [57.371814877372515]
グラフィカルユーザインタフェース(GUI)の基盤は、コンピュータ利用エージェント開発において依然として重要なボトルネックとなっている。
多様なタスクタイプにまたがる564の細かな注釈付きサンプルからなる総合ベンチマークであるOSWorld-Gを紹介する。
我々は、400万のサンプルを含む、最大のコンピュータ利用基盤データセットであるJediを合成してリリースする。
論文 参考訳(メタデータ) (2025-05-19T15:09:23Z) - Programming with Pixels: Can Computer-Use Agents do Software Engineering? [24.011063667060792]
$textttProgramming with Pixels$ (PwP)は、ソフトウェアエンジニアリングのための初めての総合的なコンピュータ利用環境である。
PwPは、一般のコンピュータ利用エージェントがスペシャリストレベルのパフォーマンスに達するかどうかをベンチマークするための自然なドメインとしてソフトウェア工学を確立している。
論文 参考訳(メタデータ) (2025-02-24T18:41:33Z) - CRAB: Cross-environment Agent Benchmark for Multimodal Language Model Agents [49.68117560675367]
Crabは、クロス環境タスクをサポートするように設計された最初のベンチマークフレームワークである。
私たちのフレームワークは複数のデバイスをサポートし、Pythonインターフェースで簡単に任意の環境に拡張できます。
実験の結果、GPT-4oの1剤が38.01%の最高完成率を達成することが示された。
論文 参考訳(メタデータ) (2024-07-01T17:55:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。