論文の概要: Design Theater: A Benchmark for Generative UI
- arxiv url: http://arxiv.org/abs/2607.22928v1
- Date: Fri, 24 Jul 2026 21:57:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:14.930857
- Title: Design Theater: A Benchmark for Generative UI
- Title(参考訳): デザインシアター: ジェネレーティブUIのベンチマーク
- Abstract要約: ジェネレーティブUIツールは、レイアウト、アクセシビリティ、設計選択を説明する、ユーザ向け設計の合理性を生成する。
実際の実装とはほとんど関係のない、確実で自信のある設計の合理性です。
5つの生成UIツールによって作成された120のインターフェースを評価する。
- 参考スコア(独自算出の注目度): 7.820382633483728
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Generative UI tools promise to democratize UI design by turning natural language descriptions into complete interfaces. Alongside the interface, these tools generate user-facing design rationales that explain their layout, accessibility, and design choices. However, it remains unclear whether these stated rationales are actually reflected in the interfaces they produce. We call this disconnect ``Design Theater'': plausible and confident design rationales that have little relationship to the actual implementation. To study this phenomenon, we introduce a benchmark and three metrics for measuring Design Theater. The benchmark includes 24 UI generation tasks spanning structural, styling, and functional design requirements. Using this benchmark, we evaluate 120 interfaces created by five generative UI tools. On average, over 25\% of user-facing design rationales are not implemented in the generated interface, and the implementation failure increases to 34\% for functional requirements. Tools recognize roughly half of the UX principles embedded in prompts (mean = 0.54), with four of five tools implementing 6\% or fewer functional principles. We also measure interface similarity across tools and find convergence in visual appearance and layout organization, with greater variation in color choices. Overall, we contribute: 1) the concept of Design Theater; 2) a benchmark with metrics for assessing whether the stated reasoning of generative UI tools is reflected in their implementations; 3) and findings from a systematic evaluation of these tools. We discuss what these findings mean for the design and evaluation of generative UI tools.
- Abstract(参考訳): 生成可能なUIツールは、自然言語記述を完全なインターフェースにすることで、UIデザインを民主化する。
インターフェースの他に、これらのツールは、レイアウト、アクセシビリティ、設計選択を説明するユーザ向け設計の根拠を生成する。
しかし、これらの主張された理性が実際にそれらが生成するインターフェースに反映されているかどうかは不明である。
私たちはこれを 'Design Theatre'' と呼びます: 実際の実装とはほとんど関係のない、確実で確実な設計の合理性です。
この現象を研究するために,デザインシアターの測定のためのベンチマークと3つの指標を導入する。
ベンチマークには、構造、スタイリング、機能設計要求にまたがる24のUI生成タスクが含まれている。
このベンチマークを用いて、5つの生成UIツールによって作成された120のインターフェースを評価する。
平均して、ユーザ側の設計根拠の25%以上が生成されたインターフェースに実装されておらず、実装の失敗は機能要件に対して34.5%まで増加する。
ツールはプロンプトに埋め込まれたUX原則の約半分(平均は0.54)を認識し、5つのツールのうち4つは6\%以下の機能原則を実装している。
また、ツール間のインタフェースの類似度を測定し、視覚的な外観やレイアウトの組織に収束し、色選択のバリエーションが大きくなっています。
全体として、私たちは貢献します。
1) デザインシアターのコンセプト
2) 生成的UIツールの推論が実装に反映されているかどうかを評価するための指標付きベンチマーク。
3)これらのツールの体系的評価から得られた知見。
これらの発見が生成UIツールの設計と評価にどのような意味を持つかについて議論する。
関連論文リスト
- Reasoning for Mobile User Experience with Multimodal LLMs: Task, Benchmark, and Approach [14.935343848369486]
本稿では,Qwen3-VL-4B-Thinking基盤モデルに基づくMLLMのUI-UXを提案する。
UX-UXはUXBench上での最先端(SOTA)のパフォーマンスを実現し、精度は0.7963である。
論文 参考訳(メタデータ) (2026-06-11T11:00:16Z) - What's Missing in Screen-to-Action? Towards a UI-in-the-Loop Paradigm for Multimodal GUI Reasoning [58.734995044357845]
UI-in-the-Loop(UILoop)と呼ばれる革新的なGUI推論パラダイムを提案する。
提案手法はGUI推論タスクをサイクリックスクリーンUI要素のアクションプロセスとして扱う。
MLLM(Multimodal Large Language Models)によって、キーUI要素のローカライゼーション、セマンティック関数、実用的な使用法を明示的に学習することで、UILoopは正確な発見を達成し、解釈可能な推論を行う。
論文 参考訳(メタデータ) (2026-04-08T12:12:09Z) - Do MLLMs Capture How Interfaces Guide User Behavior? A Benchmark for Multimodal UI/UX Design Understanding [45.81445929920235]
WeserUI-Benchは、モデルによるUI/UX設計のマルチモーダル理解を評価するための新しいベンチマークである。
現実世界のUIイメージペアは300種類あり、それぞれが実際の企業によって大規模にテストされた2つの設計版A/Bで構成されている。
このベンチマークでは,(1)A/Bテストで検証された勝者を予測することで,より効果的なUI/UX設計を選択すること,(2)モデルの勝者が,専門家の推論に従って,その有効性を説明することができること,の2つのコアタスクをサポートする。
論文 参考訳(メタデータ) (2025-05-08T08:00:32Z) - UI-TARS: Pioneering Automated GUI Interaction with Native Agents [58.18100825673032]
本稿では,GUIエージェントのネイティブモデルであるUI-TARSを紹介する。
OSWorldベンチマークでは、UI-TARSはスコアが24.6、50ステップが22.7、15ステップが22.7でクロード(それぞれ22.0と14.9)を上回っている。
論文 参考訳(メタデータ) (2025-01-21T17:48:10Z) - Tell Me What's Next: Textual Foresight for Generic UI Representations [65.10591722192609]
We propose Textual Foresight, a novel pretraining objective for learn UI screen representations。
Textual Foresightは、現在のUIとローカルアクションを考慮すれば、将来のUI状態のグローバルなテキスト記述を生成する。
新たに構築したモバイルアプリデータセットであるOpenAppでトレーニングを行い、アプリUI表現学習のための最初の公開データセットを作成しました。
論文 参考訳(メタデータ) (2024-06-12T02:43:19Z) - UIClip: A Data-driven Model for Assessing User Interface Design [20.66914084220734]
ユーザインタフェースの設計品質と視覚的関連性を評価するための機械学習モデルUIClipを開発した。
UIClipがUI設計品質の即時評価に依存するダウンストリームアプリケーションをどのように促進するかを示す。
論文 参考訳(メタデータ) (2024-04-18T20:43:08Z) - DEsignBench: Exploring and Benchmarking DALL-E 3 for Imagining Visual
Design [124.56730013968543]
ビジュアルデザインシナリオに適したテキスト・ツー・イメージ(T2I)生成ベンチマークであるDesignBenchを紹介する。
DesignBenchベンチマークでは、画像テキストアライメント、視覚美学、デザインクリエイティビティの基準に対して、生成された画像に対する人間による評価を行う。
GPT-4Vを用いた最初の自動画像生成評価器を提案する。
論文 参考訳(メタデータ) (2023-10-23T17:48:38Z) - EGFE: End-to-end Grouping of Fragmented Elements in UI Designs with
Multimodal Learning [10.885275494978478]
断片化された要素をグループ化することで、生成されたコードの可読性と保守性を大幅に向上させることができる。
現在の手法では、フラグメントされた要素をグループ化する手作りのルールを導入する2段階の戦略を採用している。
UIシークエンス予測によるエンドツーエンドのグルーピングフラグメンテッド要素の自動生成手法EGFEを提案する。
論文 参考訳(メタデータ) (2023-09-18T15:28:12Z) - VINS: Visual Search for Mobile User Interface Design [66.28088601689069]
本稿では、UIイメージを入力として、視覚的に類似したデザイン例を検索するビジュアル検索フレームワークVINSを紹介する。
このフレームワークは、平均平均精度76.39%のUI検出を実現し、類似したUI設計をクエリする際の高いパフォーマンスを実現している。
論文 参考訳(メタデータ) (2021-02-10T01:46:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。