論文の概要: VideoVIBE: A Video-Grounded Diagnostic Benchmark for One-Shot Interactive Website Generation
- arxiv url: http://arxiv.org/abs/2608.09573v1
- Date: Mon, 10 Aug 2026 13:07:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.281552
- Title: VideoVIBE: A Video-Grounded Diagnostic Benchmark for One-Shot Interactive Website Generation
- Title(参考訳): VideoVIBE: ワンショットインタラクティブWebサイト生成のためのビデオグラウンド診断ベンチマーク
- Authors: Jiajun Xu, Yanghao Zhou, Jingyun Liao, Yu Bai, Jinxing Zhou, Chengliang Liu, Changsen Yuan, Bo Wang, Qian Liu,
- Abstract要約: VideoVIBEは、人間が操作するウェブページの記録をきめ細かな診断タスクに変換するビデオグラウンドのベンチマークである。
V2Lensは、トレーニングのないエビデンスベースのマルチエージェントシステムで、初期ビデオベースの診断に挑戦し、選択的に洗練する。
- 参考スコア(独自算出の注目度): 21.170620211073217
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Natural-language-driven "vibe coding" enables the one-shot generation of visually rich and interactive web applications, yet reliable assessment of their quality has not kept pace. Existing evaluations often score isolated artifacts or final task outcomes, offering limited evidence about which failures occur and why. We introduce VideoVIBE, a video-grounded benchmark that transforms human-operated webpage recordings into fine-grained diagnostic tasks. It contains approximately 1.7K diagnostic Video QA instances derived from 6,338 verified failures across generated webpages, spanning semantic-logical, visual-motion, structural-temporal, and functional failures. Diagnoses are grounded primarily in recorded presentation and behavior, with webpage source code used as complementary context. We further propose V2Lens, a training-free, evidence-grounded multi-agent system that challenges and selectively refines initial video-based diagnoses through targeted visual and source-code verification. Across thirteen closed-source and open-weight Video MLLMs, Gemini-2.5-Flash is the strongest standalone model with a score of 64.54, while V2Lens reaches 71.72, an improvement of 7.18 points. Together, our results show that video-grounded evaluation can move beyond isolated artifacts and aggregate outcomes toward a behaviorally faithful and diagnostically informative account of generated application quality.
- Abstract(参考訳): は、視覚的にリッチでインタラクティブなWebアプリケーションのワンショット生成を可能にします。
既存の評価は、しばしば独立した成果物や最終タスクの結果をスコアし、どの障害が発生したか、なぜかという限られた証拠を提供する。
人間の操作するWebページの記録をきめ細かな診断タスクに変換するビデオグラウンドベンチマークであるVideoVIBEを紹介する。
約1.7Kの診断ビデオQAインスタンスは、生成されたWebページ全体で6,338の検証エラーから派生し、意味論的、視覚的、構造的、機能的障害にまたがる。
診断は主に記録されたプレゼンテーションと振る舞いに基づいており、Webページのソースコードは補完的なコンテキストとして使用される。
さらに,V2Lensを提案する。V2Lensは,目標となる視覚的およびソースコードの検証を通じて,初期映像診断に挑戦し,選択的に改善する,エビデンスに基づくマルチエージェントシステムである。
13のクローズドソースおよびオープンウェイトビデオMLLMで、Gemini-2.5-Flashは64.54のスコアを持つ最強のスタンドアロンモデルであり、V2Lensは71.72に達し、7.18ポイントが改善された。
以上の結果から,ビデオグラウンド評価は孤立した成果物を超えて,行動に忠実で診断に有意なアプリケーション品質評価へと移行できることが示唆された。
関連論文リスト
- HarmVideoBench: Benchmarking Harmful Video Understanding in Large Multimodal Models [28.84235879847985]
大規模視覚言語モデル(LVLM)は、最近、自動コンテンツモデレーションにおいて大きな可能性を示している。
HarmVideoBenchは、1,379の動画と4,137の質問のペアからなる診断ベンチマークである。
BCRは,推論境界を予測し,必要なときにのみ動的にコンテキストを検索するベンチマークアライメント手法である。
論文 参考訳(メタデータ) (2026-06-25T15:50:33Z) - ReVSI: Rebuilding Visual Spatial Intelligence Evaluation for Accurate Assessment of VLM 3D Reasoning [59.558706734431276]
空間知能の現在の評価は、現代の視覚言語モデル(VLM)設定下で体系的に無効にすることができる。
本稿では,各QAペアが実際の入力の下で応答可能で正しいことを保証するためのベンチマークとプロトコルであるReVSIを紹介する。
論文 参考訳(メタデータ) (2026-04-27T10:45:51Z) - Stress Tests REVEAL Fragile Temporal and Visual Grounding in Video-Language Models [18.243585941034116]
Video-Language Models (VidLM) は、ビデオの内容、時間的シーケンス、動きを強く説明する。
本稿では,現代Vidsの基礎的弱点を探索する診断ベンチマークREVEALを紹介する。
これらのモデルでは,映像コンテンツを無視しながら質問に回答し,虚偽の主張に同意し,基本的なカメラの動きに苦しむとともに,時間的スケーラブルな情報を収集することができない。
論文 参考訳(メタデータ) (2026-02-11T17:39:14Z) - VideoScore2: Think before You Score in Generative Video Evaluation [69.43069741467603]
VideoScore2は、視覚的品質、テキスト・ツー・ビデオのアライメント、物理的/常識的一貫性を明確に評価する多次元、解釈可能、そして人間によるアライメントフレームワークである。
我々のモデルは、27,168人の注釈付きビデオを含む大規模なデータセットVideoFeedback2で訓練されている。
論文 参考訳(メタデータ) (2025-09-26T18:09:03Z) - Bridging Video Quality Scoring and Justification via Large Multimodal Models [14.166920184033463]
古典的映像品質評価法(VQA)は、映像の視覚的忠実さと明瞭さを判断する数値スコアを生成する。
しかし、スコアはビデオの複雑な品質の次元を表現できず、適用性を制限する。
言語出力から恩恵を受け、ビデオ大マルチモーダルモデル(LMM)を命令チューニングによりVQAに適応させることは、この問題に対処する可能性がある。
論文 参考訳(メタデータ) (2025-06-26T05:02:25Z) - DAVID-XR1: Detecting AI-Generated Videos with Explainable Reasoning [58.70446237944036]
DAVID-Xは、AI生成ビデオに詳細な欠陥レベル、時間空間アノテーションと有理書を組み合わせた最初のデータセットである。
DAVID-XR1は、視覚的推論の解釈可能な連鎖を提供するために設計されたビデオ言語モデルである。
以上の結果から,AI生成ビデオコンテンツの信頼性確認のための説明可能な検出手法が期待できることを示す。
論文 参考訳(メタデータ) (2025-06-13T13:39:53Z) - ViDRiP-LLaVA: A Dataset and Benchmark for Diagnostic Reasoning from Pathology Videos [2.832420256346882]
計算病理学における最初の大規模マルチモーダルモデル(LMM)であるViDRiP-LLaVAを提案する。
単一のパッチイメージ、自動的に分割された病理ビデオクリップ、手動で分割された病理ビデオを含む3つの異なるイメージシナリオを統合している。
ViDRiP-LLaVAは、詳細な組織学的記述を生成し、確定的なサインアウト診断を達成することによって、診断的推論で視覚的物語を橋渡しする。
論文 参考訳(メタデータ) (2025-05-07T07:41:19Z) - VANE-Bench: Video Anomaly Evaluation Benchmark for Conversational LMMs [64.60035916955837]
VANE-Benchはビデオの異常や矛盾を検出するためのビデオLMMの熟練度を評価するために設計されたベンチマークである。
我々のデータセットは、既存の最先端のテキスト・ビデオ生成モデルを用いて合成された一連のビデオから構成される。
我々は、このベンチマークタスクにおいて、オープンソースとクローズドソースの両方で既存の9つのビデオLMMを評価し、ほとんどのモデルが微妙な異常を効果的に識別するのに困難に直面することを発見した。
論文 参考訳(メタデータ) (2024-06-14T17:59:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。