論文の概要: StateAct: Program State, before Pixels, for Long-Horizon Computer-Use Agents
- arxiv url: http://arxiv.org/abs/2607.22798v1
- Date: Fri, 24 Jul 2026 14:17:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:14.881187
- Title: StateAct: Program State, before Pixels, for Long-Horizon Computer-Use Agents
- Title(参考訳): StateAct: 長距離コンピュータ利用エージェントのためのPixel以前のプログラム状態
- Abstract要約: StateActはコードファーストでマルチエージェントのハーネスであり、この区別に基づいて構築されている。
そのメインエージェントは、コードを使用してプログラム状態と直接連携する。
専用のGUIサブエージェントは、必要ないくつかのサブゴールでスクリーンショットとクリックのインタラクションを処理する。
- 参考スコア(独自算出の注目度): 55.650871465979066
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Computer-use agents are usually improved by strengthening perception: better models for reading a screenshot and choosing where to click. Yet a screenshot is only a lossy rendering of the underlying program state, e.g., the files, application backends, and DOM that hold the task data. Different states can produce the same pixels, while code can inspect and modify that state directly. StateAct is a code-first, multi-agent harness built around this distinction. Its main agent works directly with program state by using code, while a dedicated GUI subagent handles screenshot-and-click interaction on the few subgoals that need it, just 28 of 108 tasks and 1.1% of main-agent steps. The same direct access to program state also supports verification: an independent finish gate double-checks the saved result for structural failures, e.g., output that is missing, unsaved, or written to the wrong path. To stay on track over hundreds of steps, the main agent hands subgoals to fresh subagents, keeping its own context focused. On OSWorld 2.0, StateAct lifts Claude Opus 4.8 from 20.6% to 26.9% on binary success, and from 54.8% to 61.6% on partial success, at ~ 9x lower cost per task than the same model driven by screenshots alone; a code-only variant with no GUI subagent reaches only 45.9% partial, below that screenshot-based baseline's 54.8%. In general, grounding action, verification, and memory in state, what we call state-grounding, shifts the main bottleneck from perception toward reasoning: failures depend more on what the agent thinks than on what it sees.
- Abstract(参考訳): コンピュータ利用エージェントは通常、認識を強化することで改善される。
しかし、スクリーンショットは、例えば、タスクデータを保持するファイル、アプリケーションバックエンド、DOMといった、基礎となるプログラム状態の欠落したレンダリングに過ぎない。
異なる状態は同じピクセルを生成でき、コードがその状態を直接検査して修正することができる。
StateActはコードファーストでマルチエージェントのハーネスであり、この区別に基づいて構築されている。
メインエージェントはコードを使用してプログラム状態と直接動作し、専用のGUIサブエージェントは必要ないくつかのサブゴールでスクリーンショットとクリックのインタラクションを処理し、108タスクのうち28とメインエージェントステップの1.1%しか処理しない。
独立したフィニッシュゲートは、構造上の障害に対して保存された結果をダブルチェックする。
数百歩以上の歩留まるために、メインエージェントはサブゴールを新鮮なサブエージェントに手渡し、独自のコンテキストを集中させる。
OSWorld 2.0では、StateActはClaude Opus 4.8を20.6%から26.9%に、部分的な成功では54.8%から61.6%に、スクリーンショットだけで駆動される同じモデルよりもタスク当たりのコストが約9倍低い。
一般的に、状態のグラウンディングアクション、検証、メモリは、状態のグラウンド(state-grounding)と呼ばれ、主要なボトルネックを認識から推論へとシフトさせます。
関連論文リスト
- SkillGLoW: Procedural-Family Skill Consolidation for Self-Improving Agents on Long-Horizon Task Streams [55.90739575113059]
再利用の欠如は、関連するタスクのクラスタによって共有される解決手順であり、その周りでSkillGLoWを構築している、と我々は主張する。
4つのベンチマーク(数学的推論、端末の自動化、ソフトウェア修復、実施制御)と3つのモデルで、前者は平均17.2ポイント(ハード)を獲得している。
論文 参考訳(メタデータ) (2026-09-02T07:31:18Z) - Turning Interaction History into Execution State: A Runtime Layer for Long-Horizon Coding Agents [48.967927222079965]
Ledgerは、エージェントの完了したインタラクションを明示的な実行状態に蒸留するランタイム層である。
Ledgerはこの状態をオンライン実行台帳に保持し、各ステップの2つのバウンダリに適用される。
500のSWE-bench検証インスタンス全体で、LedgerはPass@1を56.2%から64.2%に、GPT-5 miniを75.8%から81.0%に、MiniMax M2.5を81.0%に引き上げている。
論文 参考訳(メタデータ) (2026-08-01T18:25:00Z) - Desktop-Delta Bench: Do Computer-Use Models Understand Desktop GUI Transitions? [3.9561795512466413]
現在のベンチマークは、主にエンドタスクの成功または単一フレームグラウンドを測定する。
推論、リモート入力、アプリのレンダリング、スクリーンショットキャプチャが非同期であるため、これは難しい。
オフラインのステップレベルベンチマークであるDesktop-Delta Bench (DDB)を紹介した。
論文 参考訳(メタデータ) (2026-07-28T17:49:51Z) - Tactile: Giving Computer-Using Agents Hands and Feet [9.655595397922488]
私たちはTactileというオープンソースのツールレイヤを紹介します。
Tactileは異種UIエビデンスに適応したオペレーティングシステムアクセシビリティセマンティクス、OCRテキスト、ビジュアルフォールバックリージョンを、アクショングラウンドのインターフェース状態に変換する。
エージェントは、利用可能な時にネイティブなセマンティックアクションを好むオブザーブ・グラウンド・アクト・バリデーション・ループを介して動作し、可視テキストが最良の証拠であるときにOCRのグラウンドド座標にフォールバックし、リプレイと失敗帰属の完全な証明を保持する。
論文 参考訳(メタデータ) (2026-07-16T00:35:25Z) - ClawArena-Team: Benchmarking Subagent Orchestration and Dynamic Workflows in Language-Model Agents [61.184954205350984]
ClawArena-Teamは、41のマルチターン、マルチモーダル、マルチエージェントシナリオのベンチマークである。
全体的なスコア -- Subagent-Management Score (SMS) -- は、タスクの正しさを最小限のプライマリとモダリティのルーティング因子によって乗算する。
論文 参考訳(メタデータ) (2026-06-30T06:06:08Z) - Understanding and Evaluating Claw-like Agent Security Through a Computer-Systems Lens [65.53494487819053]
クローのようなAIエージェント(OpenClawなど)は、認証情報、ファイル、ツール、外部サービスへの永続的なアクセスを伴う、常にオンのプロセスである。
我々はClawのようなエージェントをエージェントコンピュータシステムとして扱い、そのゲートウェイランタイムがOSのような仲介の役割を担っている。
我々は、4つの攻撃面にわたる406の敵タスクのベンチマークであるSafeClawArenaを開発した。
論文 参考訳(メタデータ) (2026-06-29T18:00:45Z) - GUI vs. CLI: Execution Bottlenecks in Screen-Only and Skill-Mediated Computer-Use Agents [57.03233891304263]
18のアプリケーションと12のワークフローカテゴリにわたる440のデスクトップタスクの一致した実行層ベンチマークを導入する。
最強のGUIエージェントが59.1%のフルパスレートに達し、48.2%で最強のオリジナルスキルCLIエージェントを上回りました。
論文 参考訳(メタデータ) (2026-06-22T17:05:07Z) - AgentLens: Revealing The Lucky Pass Problem in SWE-Agent Evaluation [11.272830796781925]
8つのモデルバックエンドから60個のSWEベンチ検証タスクの2,614個のOpenHandsトラジェクトリを評価した。
このサブセットで通過する軌道の中で、10.7%はラッキーパスと呼ばれる振る舞いを示す。
本稿では,SWEエージェント軌道のプロセスレベル評価フレームワークであるAgentLensを紹介する。
論文 参考訳(メタデータ) (2026-05-13T03:00:57Z) - WildClawBench: A Benchmark for Real-World, Long-Horizon Agent Evaluation [88.10947115397971]
この研究でWildClawBenchは、6つのテーマのカテゴリにまたがる60の人間によるバイリンガルなマルチモーダルタスクのネイティブランタイムベンチマークである。
各タスクは、約8分間のウォールクロック時間と20以上のツールコールで実行されます。
グラディングはハイブリッドであり、決定論的ルールベースのチェック、副作用の環境状態監査、意味的検証のためのLLM/VLM判定を組み合わせている。
論文 参考訳(メタデータ) (2026-05-11T17:49:43Z) - The Amazing Agent Race: Strong Tool Users, Weak Navigators [27.24330141815882]
LLMエージェントの既存のツール使用ベンチマークは圧倒的に線形である。
The Amazing Agent Race (AAR) は、有向非巡回グラフパズル(または「レッグ」)とフォークマージツールチェーンを特徴付けるベンチマークである。
シーケンシャル(800脚)とコンポジション(600DAG脚)の2つの変種にまたがる1,400のインスタンスをリリースする。
論文 参考訳(メタデータ) (2026-04-11T15:58:29Z) - Visual Confused Deputy: Exploiting and Defending Perception Failures in Computer-Using Agents [9.457255218406333]
コンピュータ利用エージェント(CUA)はグラフィカルユーザインタフェースに直接作用するが、画面に対する認識は信頼できないことが多い。
我々は、エージェントが誤認識された画面状態に基づいてアクションを認可する障害モードである視覚的混乱副産物を形式化する。
この脅威を軽減するため,エージェントの知覚ループ外で動作する最初のガードレールを提案する。
論文 参考訳(メタデータ) (2026-03-16T01:31:32Z) - VideoAgentTrek: Computer Use Pretraining from Unlabeled Videos [62.29924199978745]
VideoAgentTrekは、Webスケールで公開されているスクリーン録画ビデオからトレーニングデータを自動的にマイニングするスケーラブルなパイプラインである。
生のビデオには暗黙のデモが含まれているが、明示的なアクションラベルがない。
39,000のYouTubeチュートリアルビデオに適用されたパイプラインは、自動的に1250万のインタラクションステップを生成します。
論文 参考訳(メタデータ) (2025-10-22T11:25:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。