論文の概要: UI2App: Benchmarking Visual Interaction Inference in Executable Web Application Generation
- arxiv url: http://arxiv.org/abs/2607.06306v1
- Date: Tue, 07 Jul 2026 14:08:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.547656
- Title: UI2App: Benchmarking Visual Interaction Inference in Executable Web Application Generation
- Title(参考訳): UI2App: 実行可能なWebアプリケーション生成におけるビジュアルインタラクション推論のベンチマーク
- Abstract要約: インタラクション推論をターゲットとする最初のベンチマーク、スクリーンショットのみからアプリケーションの振る舞いを復元する機能を紹介します。
UI2Appは、実行可能なマルチルートWebアプリケーションのための45のステートコヒーレントスクリーンショットセットにグループ化された327のスクリーンショットで構成されている。
実行可能性、ナビゲーション到達性、視覚的忠実性、相互作用推論の4つの次元に沿って、各アーティファクトを評価するエンドツーエンドパイプラインを設計する。
- 参考スコア(独自算出の注目度): 35.72992007209751
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) have demonstrated growing competence in web page generation. However, existing text-driven approaches rely on complex prompts that impose substantial demands on users and offer limited expressivity for page layout and cross-page visual coherence. Image-driven paradigms, which take UI screenshots as input, align more closely with real development workflows. However, current benchmarks focus primarily on visual fidelity and lack a systematic evaluation of the interaction capabilities in generated artifacts. To address this gap, we introduce UI2App, the first benchmark targeting interaction inference, the ability to recover application behavior from screenshots alone, without any textual or behavioral guidance. UI2App comprises 327 screenshots grouped into 45 state-coherent screenshot sets for runnable multi-route web applications. We design an end-to-end pipeline that evaluates each artifact along four dimensions: executability, navigation reachability, visual fidelity, and interaction inference. The interaction metric (IIS) assesses inferred interactions by functional correctness and state-management complexity, crediting any valid implementation rather than matching a single reference. Experiments on six frontier vision-language models reveal a marked capability mismatch between visual reconstruction and interaction realization: the visual-fidelity leader scores only 7.5 on IIS, ranking fourth and trailing the IIS leader by 5.2x. High-complexity interactions such as cross-page state remain a pervasive bottleneck, with half of the evaluated models scoring exactly zero on this dimension. Overall, the results indicate that inferring complete interaction behavior from static screenshots remains a key challenge for models.
- Abstract(参考訳): 大規模言語モデル(LLM)は、Webページ生成の能力向上を実証している。
しかし、既存のテキスト駆動アプローチは、ユーザに対してかなりの要求を課し、ページレイアウトとページ間の視覚的コヒーレンスに対して限定的な表現力を提供する複雑なプロンプトに依存している。
UIスクリーンショットを入力として取り込むイメージ駆動パラダイムは、実際の開発ワークフローとより密に連携する。
しかし、現在のベンチマークは主に視覚的忠実さに焦点を当てており、生成されたアーティファクトにおける相互作用能力の体系的な評価が欠けている。
このギャップに対処するため、私たちは、対話推論をターゲットとした最初のベンチマークであるUI2Appを導入しました。
UI2Appは、実行可能なマルチルートWebアプリケーションのための45のステートコヒーレントスクリーンショットセットにグループ化された327のスクリーンショットで構成されている。
実行可能性、ナビゲーション到達性、視覚的忠実性、相互作用推論の4つの次元に沿って、各アーティファクトを評価するエンドツーエンドパイプラインを設計する。
相互作用計量(IIS)は、関数的正しさと状態管理の複雑さによって推論された相互作用を評価し、単一の参照と一致するのではなく、有効な実装を信用する。
6つのフロンティア視覚言語モデルの実験では、視覚的再構成と相互作用の実現の間に顕著なミスマッチが示され、視覚的忠実度リーダーはIISで7.5しか得点せず、第4位、第2Sリーダーの5.2倍の成績を示した。
クロスページ状態のような複雑度の高い相互作用は、評価されたモデルの半分が、この次元で正確にゼロであるように、広範にボトルネックとなっている。
全体として、静的スクリーンショットから完全なインタラクションの振る舞いを推測することは、モデルにとって重要な課題である。
関連論文リスト
- Rendering-in-the-Loop: An Execution-Driven Agent for Interactive Web Development [11.314424904357212]
本稿では,ブラウザのレンダリングをループに配置し,実行時のインタラクションフィードバックから生成されたコードを反復的に編集する,実行駆動エージェントRILAを提案する。
IWR-Benchでは、RILAはファンデーションモデル間の相互作用と視覚的忠実度を一貫して改善する。
論文 参考訳(メタデータ) (2026-09-02T04:27:45Z) - Inter-X++: A Comprehensive Benchmark for Multimodal Human-Human Interaction Analysis [55.78822230833247]
We present Inter-X++, a comprehensive and large-scale benchmark designed to empower useful HHI analysis。
インターX++は11,388個の高忠実な相互作用シーケンスと8.1Mフレームを提供する。
インタラクションの再構築と意味理解を協調的に最適化する,単一かつ統一されたHHI表現とモデリングフレームワークOpenHHIを提案する。
論文 参考訳(メタデータ) (2026-08-20T17:51:48Z) - Benchmarking Multimodal LLMs on Code Generation for Complex Interactive Webpages [22.804937497354754]
複雑なインタラクションを伴う対話型Webページのコード生成を評価する最初のベンチマークであるWebIGBenchを紹介する。
手動で設計したインタラクションパスとUI自動化を組み合わせることで、現実世界のWebサイトから103の複雑なWebページを収集しました。
このベンチマークは、851の異なるインタラクティブアクションを含む5つの一般的なインタラクティブアクションタイプ(例えば、クリック、入力)をカバーする。
論文 参考訳(メタデータ) (2026-05-29T05:45:50Z) - Cookie-Bench: Continuous On-screen Key Interaction Evaluation for Web Generation [24.920344869492066]
textbfdatanameは11ドメイン、54リーフ、1000キューのWebDevベンチマークで、静的表現とインタラクティブアプリケーションの両方にまたがる。
textbfframenameはフラヴェルのメタ認知モニタリングに基づいており、3段階にわたる判断から証拠の蓄積を分離している。
論文 参考訳(メタデータ) (2026-05-28T14:30:33Z) - IWR-Bench: Can LVLMs reconstruct interactive webpage from a user interaction video? [56.33950760097989]
IWR-Benchは、ビデオからインタラクティブなWebページ再構築におけるLVLM(Large Vision-Language Models)の機能を評価するための新しいベンチマークである。
IWR-Benchは100の現実世界のウェブサイトから1,001のアクションで1,3の精巧にキュレートされたタスクで構成されている。
このベンチマークは、ビデオとアセットからインタラクションロジックを推論する包括的なマルチモーダル推論と、このロジックを関数コードに変換するための高度なコード生成という、2つの基本的な課題に関するモデルを評価する。
論文 参考訳(メタデータ) (2025-09-29T12:38:06Z) - UI-TARS: Pioneering Automated GUI Interaction with Native Agents [58.18100825673032]
本稿では,GUIエージェントのネイティブモデルであるUI-TARSを紹介する。
OSWorldベンチマークでは、UI-TARSはスコアが24.6、50ステップが22.7、15ステップが22.7でクロード(それぞれ22.0と14.9)を上回っている。
論文 参考訳(メタデータ) (2025-01-21T17:48:10Z) - Interaction2Code: Benchmarking MLLM-based Interactive Webpage Code Generation from Interactive Prototyping [57.024913536420264]
MLLM(Multimodal Large Language Models)は、設計からコードへのタスクにおいて顕著な性能を示す。
本稿では,インタラクティブなWebページを生成する上で,MLLMを初めて体系的に研究する。
論文 参考訳(メタデータ) (2024-11-05T17:40:03Z) - A Graph-based Interactive Reasoning for Human-Object Interaction
Detection [71.50535113279551]
本稿では,HOIを推論するインタラクティブグラフ(Interactive Graph, in-Graph)という,グラフに基づくインタラクティブ推論モデルを提案する。
In-GraphNet と呼ばれる HOI を検出するための新しいフレームワークを構築した。
私たちのフレームワークはエンドツーエンドのトレーニングが可能で、人間のポーズのような高価なアノテーションはありません。
論文 参考訳(メタデータ) (2020-07-14T09:29:03Z) - Cascaded Human-Object Interaction Recognition [175.60439054047043]
マルチステージで粗大なHOI理解のためのカスケードアーキテクチャを提案する。
各段階で、インスタンスローカライゼーションネットワークは、HOI提案を段階的に洗練し、インタラクション認識ネットワークにフィードする。
慎重に設計された人間中心の関係機能により、これらの2つのモジュールは効果的な相互作用理解に向けて協調的に機能する。
論文 参考訳(メタデータ) (2020-03-09T17:05:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。