論文の概要: MV-Bench: Benchmarking Multimodal Large Language Models for Coordinated Multi-View Interface Construction
- arxiv url: http://arxiv.org/abs/2607.19910v1
- Date: Wed, 22 Jul 2026 08:42:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 18:51:38.031576
- Title: MV-Bench: Benchmarking Multimodal Large Language Models for Coordinated Multi-View Interface Construction
- Title(参考訳): MV-Bench: 協調型マルチビューインタフェース構築のためのマルチモーダル大言語モデルのベンチマーク
- Authors: Yue Zhao, Hongxu Liu, Feiyu Wang, Xiaoyu Yang, Tong Ge, Zhen Yang, Chao Wang, Qiong Zeng,
- Abstract要約: 本稿では,協調多視点インタフェース構築におけるMLLMの評価ベンチマークであるMV-Benchを紹介する。
不完全あるいは一貫性のないオープンソース実装に頼る代わりに、ワークブックファイルを基礎的な真実として使用しています。
視覚的忠実度, データバインディングの正確性, インタラクション完全性といった指標を用いて, シングルパス環境での5つの最先端MLLMの評価を行った。
- 参考スコア(独自算出の注目度): 17.735331983621958
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal large language models (MLLMs) are increasingly expected to automate visualization development by generating code directly from visual designs. However, existing evaluations mainly focus on single-chart generation and overlook coordinated multi-view interface construction, which requires joint reasoning about data semantics, view coordination, and interaction logic. Consequently, MLLM capabilities in this setting remain underexplored, and the field lacks a dedicated benchmark for systematic assessment. We introduce MV-Bench, a benchmark for evaluating MLLMs on coordinated multi-view interface construction. Instead of relying on incomplete or inconsistent open-source implementations, we use Tableau workbook files as ground truth because they explicitly encode data bindings, visual mappings, and interactions. We develop a multi-stage pipeline that converts these specifications into executable web interfaces through structured intermediate representations. The benchmark contains 92 base interfaces and 1,048 verified instances created by recombining chart types, datasets, and interaction patterns. Each instance includes executable code, a rendered interface, a dataset, and interaction annotations. We evaluate five state-of-the-art MLLMs in a single-pass setting using metrics for visual fidelity, data binding correctness, and interaction completeness. The strongest model achieves 75.45 percent accuracy in visual layout reproduction, but only 21.71 percent in data binding and 11.68 percent in interaction completeness. These results show that current MLLMs can reproduce visual appearance but remain limited in generating the data semantics and interactive logic required by coordinated multi-view interfaces. Iterative refinement improves code executability but does not substantially reduce the gap in data binding and interaction generation.
- Abstract(参考訳): マルチモーダルな大言語モデル(MLLM)は、視覚的デザインから直接コードを生成することで、可視化開発を自動化することがますます期待されている。
しかし、既存の評価は主に、データセマンティクス、ビューコーディネート、インタラクションロジックに関する共同推論を必要とする、シングルチャート生成とオーバールックコーディネートされたマルチビューインターフェースの構築に焦点を当てている。
その結果、MLLMの能力は未熟であり、その分野は体系的な評価のための専用のベンチマークを欠いている。
本稿では,協調多視点インタフェース構築におけるMLLMの評価ベンチマークであるMV-Benchを紹介する。
データバインディング、ビジュアルマッピング、インタラクションを明示的にエンコードしているので、不完全あるいは一貫性のないオープンソース実装に頼るのではなく、土台としてTableauのワークブックファイルを使用します。
我々は,これらの仕様を構造化中間表現を通じて実行可能なWebインターフェースに変換する多段階パイプラインを開発した。
ベンチマークには92のベースインターフェースと、チャートタイプ、データセット、インタラクションパターンを再組み込んだ1,048の検証インスタンスが含まれている。
各インスタンスには実行可能なコード、レンダリングされたインターフェース、データセット、インタラクションアノテーションが含まれている。
視覚的忠実度, データバインディングの正確性, インタラクション完全性といった指標を用いて, シングルパス環境での5つの最先端MLLMの評価を行った。
最強のモデルは、視覚的なレイアウトの再現において75.45パーセントの精度を達成しているが、データバインディングでは21.71パーセント、インタラクション完全性では11.68パーセントしか達成していない。
これらの結果から、現在のMLLMは視覚的外観を再現できるが、コーディネートされたマルチビューインタフェースが必要とするデータセマンティクスと対話論理の生成には限界があることが示された。
反復的な改善はコードの実行性を改善するが、データバインディングとインタラクション生成のギャップを大幅に減らすことはない。
関連論文リスト
- CrossView Suite: Harnessing Cross-view Spatial Intelligence of MLLMs with Dataset, Model and Benchmark [77.29150285469736]
空間知能は、単一視点の知覚と理性を超えるためにマルチモーダルな大言語モデル(MLLM)を必要とする。
CrossView Suiteは、CrossViewSet、CrossViewBench、CrossViewerの3つの協調コンポーネントで開発しています。
提案手法は, 適応型空間領域トークンーザを備え, 微細なオブジェクト表現をキャプチャし, マルチビューオブジェクトを明示的にアライメントする。
論文 参考訳(メタデータ) (2026-05-18T16:31:31Z) - ATP-Bench: Towards Agentic Tool Planning for MLLM Interleaved Generation [14.85015534787527]
インターリーブされたテキスト・画像生成は、複雑な情報を伝えるためのより直感的な方法を提供する。
現在のパラダイムは、イメージ生成または検索拡張のいずれかに依存しており、クリエイティビティと事実を統一することができない。
この分野での次のマイルストーンはエージェントツールプランニングであり、モデルがいつ、どこで、どのツールを起動して、視覚的にクリティカルなクエリに対してインターリーブされた応答を生成するかを自律的に決定する中心的なコントローラとして機能する。
論文 参考訳(メタデータ) (2026-03-31T15:47:59Z) - Towards Text-Image Interleaved Retrieval [49.96332254241075]
テキスト画像検索(TIIR)タスクを導入し、クエリと文書をインターリーブしたテキスト画像シーケンスとする。
我々は、自然にインターリーブされたwikiHowチュートリアルに基づいてTIIRベンチマークを構築し、インターリーブされたクエリを生成するために特定のパイプラインを設計する。
異なる粒度で視覚トークンの数を圧縮する新しいMMEを提案する。
論文 参考訳(メタデータ) (2025-02-18T12:00:47Z) - Interaction2Code: Benchmarking MLLM-based Interactive Webpage Code Generation from Interactive Prototyping [57.024913536420264]
MLLM(Multimodal Large Language Models)は、設計からコードへのタスクにおいて顕著な性能を示す。
本稿では,インタラクティブなWebページを生成する上で,MLLMを初めて体系的に研究する。
論文 参考訳(メタデータ) (2024-11-05T17:40:03Z) - Matchmaker: Self-Improving Large Language Model Programs for Schema Matching [60.23571456538149]
本稿では,スキーママッチングのための合成言語モデルプログラムを提案する。
Matchmakerは、ラベル付きデモを必要とせずに、ゼロショットで自己改善する。
実証的に、Matchmakerが以前のMLベースのアプローチより優れている実世界の医療スキーママッチングベンチマークを実証する。
論文 参考訳(メタデータ) (2024-10-31T16:34:03Z) - MLS-Track: Multilevel Semantic Interaction in RMOT [31.153018571396206]
本論文では,Unreal Engine 5をベースとした高品質で低コストなデータ生成手法を提案する。
我々は新しいベンチマークデータセット、Refer-UE-Cityを構築し、主に交差点監視ビデオのシーンを含む。
また、MLS-Trackと呼ばれるマルチレベル意味誘導型多目的フレームワークを提案し、モデルとテキスト間の相互作用を層単位で強化する。
論文 参考訳(メタデータ) (2024-04-18T09:31:03Z) - Interfacing Foundation Models' Embeddings [131.0352288172788]
ファウンデーションモデルの埋め込みと、モダリティと粒度にまたがる統合イメージとデータセットレベルの理解を整合させる汎用インターフェースであるFINDを提案する。
インターリーブド埋め込み空間を考慮したFIND-Benchでは,インターリーブドセグメンテーションと検索のためのCOCOデータセットに新たなトレーニングと評価アノテーションを導入している。
論文 参考訳(メタデータ) (2023-12-12T18:58:02Z) - M$^3$Net: Multi-view Encoding, Matching, and Fusion for Few-shot
Fine-grained Action Recognition [80.21796574234287]
M$3$Netは、FS-FGアクション認識のためのマッチングベースのフレームワークである。
textitmulti-view エンコーディング、textitmulti-view matching、textitmulti-view fusion を組み込んで、埋め込みエンコーディング、類似性マッチング、意思決定を容易にする。
説明可能な可視化と実験結果により,M$3$Netの微細な動作の詳細を捉える上での優位性が示された。
論文 参考訳(メタデータ) (2023-08-06T09:15:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。