論文の概要: DashAct: A Progressive Diagnostic Benchmark for GUI Agents in Interactive Dashboard Analysis
- arxiv url: http://arxiv.org/abs/2609.32385v1
- Date: Sat, 26 Sep 2026 08:58:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-07 17:17:06.316294
- Title: DashAct: A Progressive Diagnostic Benchmark for GUI Agents in Interactive Dashboard Analysis
- Title(参考訳): DashAct: インタラクティブダッシュボード分析におけるGUIエージェントのプログレッシブ診断ベンチマーク
- Abstract要約: 私たちが知る限りでは、DashActは、障害を同じダッシュボードタスク内のきめ細かいレベルで診断する最初のベンチマークです。
DashActには,マイルストン依存性と階層的ターゲットアノテーションを備えた,357の人間検証されたインタラクショントラジェクトリが含まれている。
その進歩的な診断カスケードは、エンドツーエンドの実行を評価し、検証済みコンテキストを次のアクション予測に復元し、ターゲットセマンティクスと視覚的接地のためのローカルビューを提供する。
- 参考スコア(独自算出の注目度): 37.722409440590276
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Interactive dashboards require users to reveal and connect evidence across stateful interactions. Although graphical user interface (GUI) agents could automate this process, existing dashboard benchmarks primarily report final answers or task success. They provide limited insight into whether failures arise from maintaining the analytical process, selecting actions, or grounding visual targets. We introduce DashAct, to our knowledge the first benchmark to diagnose these failures at a fine-grained level within the same dashboard task. DashAct contains 357 human-verified interaction trajectories with milestone dependencies and hierarchical target annotations. Its progressive diagnostic cascade evaluates end-to-end execution, restores verified context for next-action prediction, and provides target semantics and a local view for visual grounding. By progressively restoring the conditions for success, DashAct measures the minimum support an agent needs to recover rather than scoring isolated skills. Experiments show that current models struggle even as support is added. The cascade outcomes reveal bottlenecks hidden by end-to-end scores and provide actionable guidance for improving GUI agents.
- Abstract(参考訳): インタラクティブダッシュボードでは、ステートフルなインタラクションを通じてエビデンスを明らかにし、接続する必要がある。
グラフィカルユーザインタフェース(GUI)エージェントはこのプロセスを自動化できるが、既存のダッシュボードベンチマークでは最終回答やタスクの成功を主に報告している。
分析プロセスの維持、アクションの選択、あるいは視覚的ターゲットの接地から失敗が発生するかどうかについて、限定的な洞察を提供する。
私たちが知る限りでは、DashActは、これらの障害を同じダッシュボードタスク内のきめ細かいレベルで診断する最初のベンチマークです。
DashActには,マイルストン依存性と階層的ターゲットアノテーションを備えた,357の人間検証されたインタラクショントラジェクトリが含まれている。
その進歩的な診断カスケードは、エンドツーエンドの実行を評価し、検証済みコンテキストを次のアクション予測に復元し、ターゲットセマンティクスと視覚的接地のためのローカルビューを提供する。
成功の条件を徐々に回復させることで、DashActは、孤立したスキルを評価するのではなく、回復するために必要な最小の支援を測定する。
実験によると、現在のモデルはサポートが追加されても苦労している。
カスケードの結果は、エンドツーエンドのスコアによって隠されたボトルネックを明らかにし、GUIエージェントを改善するための実用的なガイダンスを提供する。
関連論文リスト
- GUITAR: Structured Failure Diagnosis of GUI Agents via State Transitions [46.051182109000315]
状態と遷移の両方で構造化された故障解析を行う状態中心診断フレームワークである textbfGUITAR を提案する。
AndroidControlとMind2Webの8つのエージェントと6つのタスクを通じて、GUITARは、障害の60.4%が20%の州で発生していることを明らかにした。
ボトルネックを標的とした誘導はSRを2.8%改善し、7つのエージェントの平均1.88%の上昇を維持している。
論文 参考訳(メタデータ) (2026-09-28T01:48:48Z) - DashArena: Benchmarking LLMs on Interactive Analytic Dashboard Generation [8.452268647068166]
私たちはDashArenaを紹介し、オープンエンドのタスクグラウンドでインタラクティブな分析ダッシュボードを生成するための最初のベンチマークを紹介します。
DashArenaでは、ダッシュボードと再生可能なインタラクショントラジェクトリの両方を生成するために、各システムが必要である。
ブラウザは軌道を再生し、システムの意図した分析ワークフローを再現可能な視覚的および実行証拠に変換する。
論文 参考訳(メタデータ) (2026-08-11T06:54:37Z) - A History-Aware Visually Grounded Critic for Computer Use Agents [70.50900668601969]
HiViGは、実際のGUIトラジェクトリで訓練されたマルチモーダル批評家を中心に構築されたテストタイムフレームワークである。
テスト時には、HiViGは批判者をポリシー決定ループに統合し、マクロアクション履歴を提供する。
Visually Grounded critiqueは、現在のスクリーンショットに対する生の実行座標を検証して、実行前にエラーをインターセプトする。
論文 参考訳(メタデータ) (2026-06-09T16:39:10Z) - GUIDE: Interpretable GUI Agent Evaluation via Hierarchical Diagnosis [17.279226216630065]
軌道評価を3段階に分解するGUIDE(GUI Understanding and Interpretable Assessment Evaluation)を導入する。
サブタスク診断は、各ユニットを文脈で評価し、完了判定を割り当て、修正レコメンデーションで構造化されたエラー解析を生成する。
我々はGUIDEを,932トラジェクトリの産業用Eコマースデータセット,1302トラジェクトリの5つのWebエージェントタスクを対象としたAgentREWARDBENCH,モバイルデバイス制御用のAndroidBenchの3つのベンチマークで検証した。
論文 参考訳(メタデータ) (2026-04-06T03:58:43Z) - AgentProcessBench: Diagnosing Step-Level Process Quality in Tool-Using Agents [50.481033105867205]
我々はAgentProcessBenchを紹介した。AgentProcessBenchは、現実的なツール拡張トラジェクトリにおけるステップレベルの有効性を評価するための最初のベンチマークである。
ベンチマークは、1,000の多様な軌跡と8,509の人間ラベル付きステップアノテーションと89.1%のアノテーション間合意で構成されている。
探索をキャプチャする3つのラベリングスキームと、ラベルのあいまいさを減らすためのエラー伝搬ルールを備えている。
論文 参考訳(メタデータ) (2026-03-15T16:13:58Z) - Agentic Reward Modeling: Verifying GUI Agent via Online Proactive Interaction [7.731207237810125]
VAGENは、対話ツールを備えた検証エージェントを使用して、自律的に検証戦略を計画するフレームワークである。
VAGEN は LLM-as-a-Judge ベースラインと比較して評価精度が有意に向上することを示す。
論文 参考訳(メタデータ) (2026-01-31T07:36:54Z) - DashboardQA: Benchmarking Multimodal Agents for Question Answering on Interactive Dashboards [44.69783955774917]
DashboardQAは、ビジュアル言語GUIエージェントが現実世界のダッシュボードをどのように理解し、相互作用するかを評価するために設計されたベンチマークである。
Tableau Publicから112のインタラクティブダッシュボードと、マルチ選択、ファクトイド、仮説、マルチダッシュボード、会話という5つのカテゴリにまたがる対話型ダッシュボードを備えた405の質問応答ペアが含まれている。
この結果から, インタラクティブなダッシュボード推論は, 総合的に評価されるすべてのVLMにおいて難しい課題であることがわかった。
論文 参考訳(メタデータ) (2025-08-24T15:11:44Z) - GTA1: GUI Test-time Scaling Agent [97.58177633084915]
グラフィカルユーザインタフェース(GUI)は、ユーザ命令をアクションプロポーザルに順次分解することで、プラットフォーム(例えばLinux)間で自律的にタスクを完了させる。
本稿では,前述の textbfGUI textbfTest-time Scaling textbfAgent,すなわち GTA1 の課題について検討する。
論文 参考訳(メタデータ) (2025-07-08T08:52:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。