論文の概要: TempCloze: Can Video-LLMs Identify the Missing Middle?
- arxiv url: http://arxiv.org/abs/2609.01515v1
- Date: Tue, 01 Sep 2026 16:45:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.837163
- Title: TempCloze: Can Video-LLMs Identify the Missing Middle?
- Title(参考訳): TempCloze:ビデオLLMはミドルミドルを識別できるのか?
- Authors: Wenqi Pei, Henry Hengyuan Zhao, Yilai Liu, Jiahao Meng, Han Chen, Ziyu Wang, Hongyang Du,
- Abstract要約: 我々は,ビデオLLMにおける視覚的時間的推論を評価するためのビデオクローゼベンチマークであるTempClozeを紹介する。
私たちは3次元に沿って同じソースのイントラクタを構築し、セマンティックはイベントの発生を尋ね、アライメントプローブはいつ発生すべきか、どのように展開するかをテストします。
さらに、TempCloze-MixedとTempCloze-Hardのエラーパターンと行動感度分析を行い、エラーの発生場所と、候補順序、コンテキスト方向、可視範囲、フレーム密度、テスト時間スケーリングの影響モデル選択について検討する。
- 参考スコア(独自算出の注目度): 22.984834163801356
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Temporal reasoning benchmarks for Video-LLMs are often mediated by language, leaving room for linguistic shortcuts from option wording, answer correlations, or language priors. To reduce such shortcuts, we introduce TempCloze, a video cloze benchmark for evaluating visual temporal reasoning in Video-LLMs. Given the beginning and ending clips of a video, models must identify the true missing middle from four candidates. TempCloze contains 1,521 carefully filtered videos from seven sources, mainly long-take and egocentric videos. We construct same-source distractors along three dimensions: Semantic asks what event should happen, Alignment probes when it should occur, and Progression tests how it should unfold, while shared scenes and objects reduce appearance cues. Our evaluation of 10 proprietary and 21 open-source Video-LLMs reveals Alignment as the primary bottleneck: models often recognize plausible semantic content and local event progression but struggle with temporal alignment. We further conduct error pattern and behavioral sensitivity analyses on TempCloze-Mixed and TempCloze-Hard with four representative models to examine where errors arise and how candidate order, context direction, visible span, frame density, and test-time scaling influence model choices.
- Abstract(参考訳): Video-LLMの時間的推論ベンチマークは、しばしば言語によって媒介され、オプションのワード、回答の相関、言語優先の言語的ショートカットの余地を残している。
このようなショートカットを減らすため、ビデオLLMにおける視覚的時間的推論を評価するためのビデオクローゼベンチマークであるTempClozeを導入する。
ビデオの始まりと終わりのクリップを考えると、モデルは4人の候補者から真の行方不明者を特定する必要がある。
TempClozeには、7つのソース(主にロングテイクとエゴセントリックなビデオ)から1,521の注意深くフィルタリングされたビデオが含まれている。
セマンティックはイベントの発生を尋ね、アライメントプローブはいつ発生すべきか、プログレッションテストはどのように展開すべきか、共有シーンとオブジェクトは外観の手がかりを減らします。
10のプロプライエタリと21のオープンソースであるVideo-LLMを評価したところ、アライメントが主要なボトルネックであることが判明した。
さらに、TempCloze-MixedとTempCloze-Hardのエラーパターンと行動感度分析を行い、エラーの発生場所と、候補順序、コンテキスト方向、可視範囲、フレーム密度、テスト時間スケーリングの影響モデル選択について検討する。
関連論文リスト
- Stress Tests REVEAL Fragile Temporal and Visual Grounding in Video-Language Models [18.243585941034116]
Video-Language Models (VidLM) は、ビデオの内容、時間的シーケンス、動きを強く説明する。
本稿では,現代Vidsの基礎的弱点を探索する診断ベンチマークREVEALを紹介する。
これらのモデルでは,映像コンテンツを無視しながら質問に回答し,虚偽の主張に同意し,基本的なカメラの動きに苦しむとともに,時間的スケーラブルな情報を収集することができない。
論文 参考訳(メタデータ) (2026-02-11T17:39:14Z) - NOAH: Benchmarking Narrative Prior driven Hallucination and Omission in Video Large Language Models [8.6767620170781]
ビデオ大言語モデル(ビデオLLM)は、最近、キャプション、要約、質問応答といったタスクにおいて、強力なパフォーマンスを実現している。
多くのモデルやトレーニング手法は、物語の一貫性を高めるためにイベント間の連続性を明示的に奨励する。
我々は、このバイアスを、物語を先に呼ぶ2つの誤りの鍵となる要因として挙げる:幻覚(幻覚)、非存在事象、または既存の事象が誤って解釈される場合、そして、事実事象が周囲の状況と不一致しているため抑制される場合である。
論文 参考訳(メタデータ) (2025-11-09T17:41:11Z) - On the Consistency of Video Large Language Models in Temporal Comprehension [57.985769348320616]
ビデオ大言語モデル(Video-LLMs)は、時間的に言語クエリを解析し、ビデオモーメントを検索することができる。
予測整合性 - 時間的根拠の堅牢性と信頼性を示す重要な指標である。
論文 参考訳(メタデータ) (2024-11-20T00:47:17Z) - TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models [75.42002690128486]
TemporalBenchは、ビデオの微細な時間的理解を評価するための新しいベンチマークだ。
ビデオクリップの時間的ダイナミクスを詳述した2Kの高品質な人間のアノテーションから派生した10KのビデオQ&Aペアで構成されている。
GPT-4oのような最先端のモデルは、TemporalBench上で38.5%の質問応答精度しか達成していない。
論文 参考訳(メタデータ) (2024-10-14T17:59:58Z) - Towards Video Anomaly Retrieval from Video Anomaly Detection: New
Benchmarks and Model [70.97446870672069]
ビデオ異常検出(VAD)はその潜在的な応用により注目されている。
Video Anomaly Retrieval (VAR)は、関連のある動画をモダリティによって実用的に検索することを目的としている。
一般的な異常データセットの上に構築されたUCFCrime-ARとXD-Violenceの2つのベンチマークを示す。
論文 参考訳(メタデータ) (2023-07-24T06:22:37Z) - Interventional Video Grounding with Dual Contrastive Learning [16.0734337895897]
ビデオグラウンドティングは、与えられたテキストクエリのために、未編集のビデオから瞬間をローカライズすることを目的としている。
本稿では、因果推論の観点から新しいパラダイムを提案し、モデルとデータの背後にある因果関係を明らかにする。
また、テキストとビデオの整合性を改善するために、二重のコントラスト学習アプローチを導入しています。
論文 参考訳(メタデータ) (2021-06-21T12:11:28Z) - Deconfounded Video Moment Retrieval with Causal Intervention [80.90604360072831]
本研究は,ビデオ中の特定のモーメントをテキストクエリに従ってローカライズすることを目的とした,ビデオモーメント検索(VMR)の課題に取り組む。
既存の手法は主に複雑な相互モーダル相互作用によるクエリとモーメントのマッチング関係をモデル化する。
本稿では,クエリとビデオコンテンツが予測に与える影響を捉えるために,構造因果モデルを構築する因果性に着想を得たVMRフレームワークを提案する。
論文 参考訳(メタデータ) (2021-06-03T01:33:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。