論文の概要: DashArena: Benchmarking LLMs on Interactive Analytic Dashboard Generation
- arxiv url: http://arxiv.org/abs/2608.10567v1
- Date: Tue, 11 Aug 2026 06:54:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-12 19:14:45.932194
- Title: DashArena: Benchmarking LLMs on Interactive Analytic Dashboard Generation
- Title(参考訳): DashArena: インタラクティブなダッシュボード生成のためのLLMのベンチマーク
- Authors: Xiaotong Wang, Dazhen Deng,
- Abstract要約: 私たちはDashArenaを紹介し、オープンエンドのタスクグラウンドでインタラクティブな分析ダッシュボードを生成するための最初のベンチマークを紹介します。
DashArenaでは、ダッシュボードと再生可能なインタラクショントラジェクトリの両方を生成するために、各システムが必要である。
ブラウザは軌道を再生し、システムの意図した分析ワークフローを再現可能な視覚的および実行証拠に変換する。
- 参考スコア(独自算出の注目度): 8.452268647068166
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Analytic dashboards combine coordinated views and interactions for data exploration and decision-making. Recent models can generate them from data and natural-language goals, but evaluating their usefulness remains difficult. Dashboard generation is open-ended, and neither static appearance nor successful execution alone captures analytical support and interaction quality. We introduce DashArena, to our knowledge the first benchmark for open-ended, task-grounded generation of interactive analytic dashboards. Its key innovation is to require each system to generate both a dashboard and a replayable interaction trajectory. A browser executor replays the trajectory and turns the system's intended analytical workflow into reproducible visual and execution evidence. A VLM judge compares candidates using this evidence, and Bradley--Terry aggregation produces the leaderboard. We further distill the judge into the open-weight DashJudge-8B. Human evaluations show that DashJudge-8B effectively reproduces human judgments and ablations show that interaction evidence improves judge agreement. Experiments with frontier models reveal persistent rendering, analytical, and interaction failures. Together, these results show that realistic dashboard generation remains challenging and that interaction-aware evaluation captures failures missed by static or execution-only checks.
- Abstract(参考訳): 分析ダッシュボードは、データ探索と意思決定のための協調ビューとインタラクションを組み合わせたものだ。
最近のモデルでは、データと自然言語の目標からそれらを生成することができるが、それらの有用性を評価することは依然として困難である。
ダッシュボード生成はオープンで、静的な外観も実行の成功も、分析サポートとインタラクション品質をキャプチャする。
私たちはDashArenaを紹介し、オープンエンドのタスクグラウンドでインタラクティブな分析ダッシュボードを生成するための最初のベンチマークを紹介します。
その重要な革新は、各システムがダッシュボードと再生可能なインタラクション軌跡の両方を生成する必要があることである。
ブラウザのエグゼキュータが軌道をリプレイし、システムの意図する分析ワークフローを再現可能な視覚的および実行証拠に変換する。
VLM判事は、この証拠を用いて候補者を比較し、ブラッドリー=テリー集約はリーダーボードを生成する。
さらに、審査員をオープンウェイトDashJudge-8Bに蒸留する。
人的評価は、DashJudge-8Bが人間の判断を効果的に再現していることを示している。
フロンティアモデルによる実験では、永続的なレンダリング、分析、相互作用の失敗が明らかになった。
これらの結果から、現実的なダッシュボード生成は依然として困難であり、インタラクションアウェア評価は、静的または実行のみのチェックで欠落した障害をキャプチャすることを示している。
関連論文リスト
- Dashboard2Code: Evaluating Multimodal Models on Reconstructing Interactive Dashboards [50.38481199112112]
Dashboard2Codeは、インタラクティブなダッシュボードを積極的に探索し、自身のインタラクションからフィードバックを取得し、統合し、ターゲットダッシュボードを再生するコードを生成するための、新しいタスクである。
Dashboard2Codeの最初のPlotly+DashベンチマークであるDashboardMimicを紹介します。
視覚的およびインタラクションの整合性を評価するために,コードセマンティック分析と動的インタラクションベースのテストを組み合わせたダッシュボードに適した自動評価フレームワークを提案する。
論文 参考訳(メタデータ) (2026-07-06T06:58:43Z) - Cookie-Bench: Continuous On-screen Key Interaction Evaluation for Web Generation [24.920344869492066]
textbfdatanameは11ドメイン、54リーフ、1000キューのWebDevベンチマークで、静的表現とインタラクティブアプリケーションの両方にまたがる。
textbfframenameはフラヴェルのメタ認知モニタリングに基づいており、3段階にわたる判断から証拠の蓄積を分離している。
論文 参考訳(メタデータ) (2026-05-28T14:30:33Z) - Interactive Tracking: A Human-in-the-Loop Paradigm with Memory-Augmented Adaptation [60.96010213186819]
自然言語コマンドを使用していつでもトラッカーをガイドできる新しいパラダイムであるInteractive Trackingを導入する。
対話型トラッキングのための最初の大規模ベンチマークであるInteractTrackについて紹介する。
第3に,ユーザからのフィードバックから学習し,トラッキング動作を更新するために動的メモリ機構を利用する新しいベースラインであるInteractive Memory-Augmented Tracking (IMAT)を導入する。
論文 参考訳(メタデータ) (2026-04-02T12:33:27Z) - DashboardQA: Benchmarking Multimodal Agents for Question Answering on Interactive Dashboards [44.69783955774917]
DashboardQAは、ビジュアル言語GUIエージェントが現実世界のダッシュボードをどのように理解し、相互作用するかを評価するために設計されたベンチマークである。
Tableau Publicから112のインタラクティブダッシュボードと、マルチ選択、ファクトイド、仮説、マルチダッシュボード、会話という5つのカテゴリにまたがる対話型ダッシュボードを備えた405の質問応答ペアが含まれている。
この結果から, インタラクティブなダッシュボード推論は, 総合的に評価されるすべてのVLMにおいて難しい課題であることがわかった。
論文 参考訳(メタデータ) (2025-08-24T15:11:44Z) - ArtifactsBench: Bridging the Visual-Interactive Gap in LLM Code Generation Evaluation [51.297873393639456]
ArtifactsBenchは自動ビジュアルコード生成評価のためのフレームワークである。
我々のフレームワークは、生成した各アーティファクトをレンダリングし、時間的スクリーンショットを通してその動的な振る舞いをキャプチャする。
我々は1,825の多様なタスクの新しいベンチマークを構築し、30以上の主要な大規模言語モデルを評価する。
論文 参考訳(メタデータ) (2025-07-07T12:53:00Z) - Self-Training with Pseudo-Label Scorer for Aspect Sentiment Quad Prediction [54.23208041792073]
Aspect Sentiment Quad Prediction (ASQP) は、与えられたレビューに対して全てのクワッド(アスペクト項、アスペクトカテゴリー、意見項、感情極性)を予測することを目的としている。
ASQPタスクにおける重要な課題はラベル付きデータの不足であり、既存のメソッドのパフォーマンスを制限している。
そこで我々は,擬似ラベルスコアラーを用いた自己学習フレームワークを提案し,レビューと擬似ラベルの一致をスコアラーが評価する。
論文 参考訳(メタデータ) (2024-06-26T05:30:21Z) - Visual Auditor: Interactive Visualization for Detection and
Summarization of Model Biases [18.434430375939755]
機械学習(ML)システムがますます普及するにつれて、これらのシステムをデプロイ前にバイアスとして監査する必要がある。
近年の研究では、データのサブセット(またはスライス)を解釈可能で過小評価する形で、交差点バイアスを効果的に識別するアルゴリズムが開発されている。
モデルバイアスを監査・要約するための対話型可視化ツールであるVisual Auditorを提案する。
論文 参考訳(メタデータ) (2022-06-25T02:48:27Z) - ConsNet: Learning Consistency Graph for Zero-Shot Human-Object
Interaction Detection [101.56529337489417]
画像中のHuman, Action, Object>の形のHOIインスタンスを検出・認識することを目的としたHuman-Object Interaction (HOI) Detectionの問題点を考察する。
我々は、オブジェクト、アクション、インタラクション間の多レベルコンパレンシーは、稀な、あるいは以前には見られなかったHOIのセマンティック表現を生成するための強力な手がかりであると主張している。
提案モデルでは,人-対象のペアの視覚的特徴とHOIラベルの単語埋め込みを入力とし,それらを視覚-意味的関節埋め込み空間にマッピングし,類似度を計測して検出結果を得る。
論文 参考訳(メタデータ) (2020-08-14T09:11:18Z) - A Graph-based Interactive Reasoning for Human-Object Interaction
Detection [71.50535113279551]
本稿では,HOIを推論するインタラクティブグラフ(Interactive Graph, in-Graph)という,グラフに基づくインタラクティブ推論モデルを提案する。
In-GraphNet と呼ばれる HOI を検出するための新しいフレームワークを構築した。
私たちのフレームワークはエンドツーエンドのトレーニングが可能で、人間のポーズのような高価なアノテーションはありません。
論文 参考訳(メタデータ) (2020-07-14T09:29:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。