論文の概要: KeyFrame-Compass: Towards Comprehensive Evaluation of Keyframe-Conditioned Video Generation
- arxiv url: http://arxiv.org/abs/2607.14202v1
- Date: Wed, 15 Jul 2026 17:46:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:32.861971
- Title: KeyFrame-Compass: Towards Comprehensive Evaluation of Keyframe-Conditioned Video Generation
- Title(参考訳): KeyFrame-Compass:Keyframe-Conditioned Video Generationの総合的評価に向けて
- Abstract要約: ビデオ生成は、より粒度の細かい合成に基づく合成に依存しており、クリエーターは参照画像のシーケンスをガイド生成に指定する。
近年のモデルはマルチキー・コンディショニングをサポートしているが、ビデオ全体の品質を維持しながら、規定を忠実に再現できるかどうかは不明だ。
我々は、合成に基づくビデオ生成を評価するための、最初の総合的なベンチマークであるKeyFrameを紹介する。
- 参考スコア(独自算出の注目度): 25.29345016590953
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Video generation increasingly relies on keyframe-based workflows, where creators specify a sequence of reference images to guide generation. Although recent models support multi-keyframe conditioning, it remains unclear whether they can faithfully reproduce the prescribed keyframes while maintaining overall video quality. We present KeyFrame-Compass, the first comprehensive benchmark for evaluating keyframe-conditioned video generation. The benchmark contains 386 carefully curated samples spanning three application domains, two video structures, two prompt granularities, two conditioning formats, and four keyframe densities, enabling controlled analysis under diverse generation settings. We further introduce an automated evaluation framework that jointly measures keyframe execution and overall video quality. Specifically, we decompose keyframe execution into six complementary metrics covering presence, fidelity, temporal ordering, localization, persistence, and uniqueness, while assessing overall video quality through evidence-grounded MLLM judgments augmented with specialized perception models. Experiments on nine representative video generation systems reveal several fundamental limitations. Current models exhibit a clear trade-off between faithful keyframe execution and natural video synthesis. Their performance further degrades as keyframe constraints become denser and most open-source models also fail to interpret storyboard-grid inputs as temporally ordered keyframe sequences.
- Abstract(参考訳): ビデオ生成はキーフレームベースのワークフローにますます依存しており、作成者は参照画像のシーケンスをガイド生成に指定する。
近年のモデルはマルチキーフレーム・コンディショニングをサポートしているが、ビデオ全体の品質を維持しながら、所定のキーフレームを忠実に再現できるかどうかは不明だ。
我々は、キーフレーム条件付きビデオ生成を評価するための、最初の総合的なベンチマークであるKeyFrame-Compassを紹介する。
ベンチマークには、3つのアプリケーションドメインにまたがる386の慎重にキュレートされたサンプル、2つのビデオ構造、2つの迅速な粒度、2つのコンディショニングフォーマット、4つのキーフレーム密度が含まれており、さまざまな生成設定下で制御された分析を可能にしている。
さらに、キーフレームの実行と全体的なビデオ品質を共同で測定する自動評価フレームワークを導入する。
具体的には、キーフレームの実行を、存在、忠実性、時間的順序付け、局所化、永続性、一意性を含む6つの相補的な指標に分解し、また、特定の知覚モデルで拡張されたエビデンスグラウンドのMLLM判定により、全体の映像品質を評価する。
9つの代表的なビデオ生成システムの実験は、いくつかの基本的な制限を明らかにしている。
現在のモデルは、忠実なキーフレーム実行と自然なビデオ合成の間に明確なトレードオフを示している。
キーフレームの制約がより厳密になり、ほとんどのオープンソースモデルは、ストーリーボードとグリッドの入力を時間順のキーフレームシーケンスとして解釈することができないため、パフォーマンスはさらに低下する。
関連論文リスト
- Controllable Generative Video Compression [11.376749911846302]
我々は,複数の視覚条件でガイドされた詳細を忠実に生成するためのCGVCパラダイムを提案する。
CGVCは、信号の忠実度と知覚品質の両方の観点から、従来の知覚ビデオ圧縮法より優れている。
論文 参考訳(メタデータ) (2026-04-08T04:11:27Z) - AlcheMinT: Fine-grained Temporal Control for Multi-Reference Consistent Video Generation [58.844504598618094]
本稿では、被験者駆動ビデオ生成のための明示的なタイムスタンプ条件付きフレームワークAlcheMinTを提案する。
提案手法では,時間間隔の符号化を解き放つ新しい位置符号化機構を導入する。
我々は、視覚的アイデンティティとビデオキャプションの結合を強化するために、主観記述型テキストトークンを導入し、世代間あいまいさを緩和する。
論文 参考訳(メタデータ) (2025-12-11T18:59:34Z) - K-frames: Scene-Driven Any-k Keyframe Selection for long video understanding [38.06179287702453]
Kフレームは、時間的連続性を保存するシーン駆動の選択のための新しいパラダイムである。
個々のフレームを選択する代わりに、Kフレームは意味的に一貫性のあるクエリ関連クリップを予測する。
Kフレームは、様々なスケールで選択するための効果的な、解釈可能な、プラグアンドプレイソリューションを提供する。
論文 参考訳(メタデータ) (2025-10-14T06:23:22Z) - From Captions to Keyframes: KeyScore for Multimodal Frame Scoring and Video-Language Understanding [1.3856027745141806]
KeyScoreは、キャプションと意味的類似性、時間的代表性、文脈的ドロップインパクトを組み合わせたキャプション対応のフレームスコアリング手法である。
提案手法は効率と性能を両立させ,拡張性とキャプションによる映像理解を可能にする。
論文 参考訳(メタデータ) (2025-10-07T23:02:27Z) - Threading Keyframe with Narratives: MLLMs as Strong Long Video Comprehenders [62.58375366359421]
長いビデオ理解のためのマルチモーダル大言語モデル(MLLM)は依然として難しい問題である。
伝統的な一様サンプリングは、無関係な内容の選択につながる。
数千フレームの訓練後のMLLMは、かなりの計算負担を課す。
本研究では,物語付きスレッディング(Nar-KFC)を提案する。
論文 参考訳(メタデータ) (2025-05-30T03:04:28Z) - Scaling Video-Language Models to 10K Frames via Hierarchical Differential Distillation [20.67434288227437]
ViLAMPは階層型ビデオ言語モデルで、1時間の動画を「混合精度」で処理する
ViLAMPは、非キーフレームを最も健全な特徴に減らしながら、完全な情報を保持し、混合精度のトレーニングに似ている。
特にViLAMPは、単一のNVIDIA A100 GPU上で超長いビデオ(最大10Kフレーム)を処理できる。
論文 参考訳(メタデータ) (2025-04-03T09:55:09Z) - Adaptive Keyframe Sampling for Long Video Understanding [75.7837692594814]
本稿では、適応鍵フレームサンプリング(AKS)という、単純だが効果的なアルゴリズムを提案する。
これはAdaptive Keyframe Sampling (AKS)と呼ばれるプラグインとプレイモジュールを挿入し、ビデオトークンの固定数で有用な情報を最大化することを目的としている。
2つの長いビデオ理解ベンチマークの実験は、AKSが情報的出会いを選択する際にビデオQA精度を改善することを検証する。
論文 参考訳(メタデータ) (2025-02-28T17:46:29Z) - The Devil is in Temporal Token: High Quality Video Reasoning Segmentation [68.33080352141653]
ビデオ推論の方法は、ビデオ内のオブジェクトを表現するために単一の特別なトークンに大きく依存する。
エンドツーエンドの動画推論セグメンテーション手法であるVRS-HQを提案する。
提案手法の強い時間的推論とセグメンテーション能力について検討した。
論文 参考訳(メタデータ) (2025-01-15T03:17:24Z) - M3-CVC: Controllable Video Compression with Multimodal Generative Models [17.49397141459785]
M3-CVCは、生成モデルを組み込んだ制御可能なビデオ圧縮フレームワークである。
以上の結果から,M3-CVCは超低シナリオにおいて最先端のVVCを著しく上回っていることが明らかとなった。
論文 参考訳(メタデータ) (2024-11-24T11:56:59Z) - Let's Think Frame by Frame with VIP: A Video Infilling and Prediction
Dataset for Evaluating Video Chain-of-Thought [62.619076257298204]
我々は、少数のビデオ推論のシーケンシャルな理解として、フレーミングビデオ推論を動機付けている。
VIPは、ビデオチェーンオブ思考を通してモデルの推論能力を調べるために設計された、推論時の課題データセットである。
我々は、VIP上でGPT-4、GPT-3、VICUNAをベンチマークし、複雑なビデオ推論タスクのパフォーマンスギャップを実証し、今後の作業を促進する。
論文 参考訳(メタデータ) (2023-05-23T10:26:42Z) - MHSCNet: A Multimodal Hierarchical Shot-aware Convolutional Network for
Video Summarization [61.69587867308656]
本稿では,MHSCNetと呼ばれるマルチモーダル階層型ショット・アウェア・畳み込みネットワークを提案する。
学習したショット認識表現に基づいて、MHSCNetは、ビデオのローカルおよびグローバルビューにおけるフレームレベルの重要度スコアを予測することができる。
論文 参考訳(メタデータ) (2022-04-18T14:53:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。