論文の概要: What's the Catch? Evaluating Temporal Consistency in Vision-Language Models
- arxiv url: http://arxiv.org/abs/2608.23474v2
- Date: Tue, 25 Aug 2026 11:47:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-26 14:09:34.311292
- Title: What's the Catch? Evaluating Temporal Consistency in Vision-Language Models
- Title(参考訳): マッチングとは何か?視覚・言語モデルにおける時間的一貫性の評価
- Abstract要約: 視覚言語モデル (VLM) はビデオや画像系列のベンチマークで高い性能を発揮するが、時間構造を捉えているかどうかは不明だ。
連続するフレームとフレームレベルの異常をガウス雑音に置き換えることで、時間的異常を発生させるTimeCatchを導入する。
評価の結果,フレームレベルと時間的異常検出との間にはかなりのギャップがあることが判明した。
- 参考スコア(独自算出の注目度): 0.11121828451787184
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-language models (VLMs) achieve strong performance on video and image-sequence benchmarks, yet it remains unclear whether they capture temporal structure. To study this question, we formulate temporal grounding as an anomaly detection problem, providing a simple and controlled evaluation that directly tests sensitivity to temporal consistency. We introduce TimeCatch, where temporal anomalies are created by swapping consecutive frames and frame-level anomalies by replacing a frame with Gaussian noise. Models are evaluated on anomaly detection and localization tasks across four synthetic and real-world datasets, alongside a human study. Our evaluation reveals a substantial gap between frame-level and temporal anomaly detection. While VLMs consistently detect frame-level anomalies and often localize them accurately, they perform near chance on temporal anomaly detection and only modestly above chance on localization. Humans, in contrast, achieve near-ceiling performance on both tasks. Additional analyses across model scales, prompting strategies, sequence lengths, and visual similarity suggest that these failures cannot be explained solely by limitations in perception or model capacity. Together, these findings indicate that current VLMs can identify anomalies within individual frames but struggle to integrate information across frames to reason about temporal consistency. TimeCatch provides a controlled benchmark for evaluating temporal grounding in vision-language models.
- Abstract(参考訳): 視覚言語モデル (VLM) はビデオや画像系列のベンチマークで高い性能を発揮するが、時間構造を捉えているかどうかは不明だ。
そこで本研究では,時間的安定度を直接検査する簡易かつ制御された評価方法として,時間的接地を異常検出問題として定式化する。
連続するフレームとフレームレベルの異常をガウス雑音に置き換えることで、時間的異常を発生させるTimeCatchを導入する。
モデルは、人間の研究とともに、4つの合成および実世界のデータセットの異常検出と局所化タスクに基づいて評価される。
評価の結果,フレームレベルと時間的異常検出との間にはかなりのギャップがあることが判明した。
VLMはフレームレベルの異常を常に検出し、しばしば正確にローカライズするが、時間的異常検出ではほぼ同じ確率で、ローカライゼーションではわずかに上回っている。
対照的に、人間は両方のタスクでほぼシーリングのパフォーマンスを達成する。
モデルスケール、プロンプト戦略、シーケンス長、視覚的類似性に関するさらなる分析は、これらの失敗は知覚の制限やモデルキャパシティによってのみ説明できないことを示唆している。
これらの結果は、現在のVLMは個々のフレーム内の異常を識別できるが、時間的一貫性を推論するためにフレーム間で情報を統合するのに苦労していることを示している。
TimeCatchは、視覚言語モデルの時間的グラウンドを評価するための制御されたベンチマークを提供する。
関連論文リスト
- Adaptive Multi-Granularity Temporal Modeling for Weakly Supervised Video Anomaly Detection [1.2072875728151518]
弱教師付きビデオ異常検出(WSVAD)が重要な研究フロンティアとして登場した。
既存のほとんどのアプローチは、厳密で手作りの時間的優先順位に依存して異常スコアを監督するMultiple Instance Learning (MIL)フレームワークでWSVADを定式化する。
本稿では,複数の時間的粒度にまたがるビデオダイナミックスの変化を明示的に考慮したWSVADの適応時間的モデリングフレームワークを提案する。
論文 参考訳(メタデータ) (2026-09-04T12:27:43Z) - POST: Prior-Observation Adversarial Learning of Spatio-Temporal Associations for Multivariate Time Series Anomaly Detection [10.26613829763125]
本稿では,先行観測学習パラダイムを統一する新しいフレームワークを提案する。
空間次元において、モデルはトレーニング中に、事前観測とデータ駆動観測の相違を最小限の方法で再構成する。
このような逆最適化は、時間的検出に対するモデルの感度を向上するだけでなく、特定のチャネルに異常をローカライズすることを可能にする。
論文 参考訳(メタデータ) (2026-05-18T09:34:14Z) - Tracking the Truth: Object-Centric Spatio-Temporal Monitoring for Video Large Language Models [154.39583176906893]
大規模言語モデル(ML)は高度な理解を持ち、シーンにおける幻覚の傾向が高い。
これは、時間的モニタリングの失敗、オブジェクトの動的アイデンティティ、状態、そして時間とともに関係を永続的に追跡する能力に起因している、と我々は主張する。
既存のベンチマークでは、局所的な視覚的手がかりや統計的先行によってしばしば解決される1つの最終回答クエリに頼って、この欠陥を曖昧にしている。
論文 参考訳(メタデータ) (2026-05-09T14:32:36Z) - Conditional Attribution for Root Cause Analysis in Time-Series Anomaly Detection [13.555771273974697]
本稿では,文脈的に類似したシステム状態に対する異常を記述した条件属性フレームワークを提案する。
本手法は,異常観測を条件とした代表例を検索し,依存関係の保存と運用上の意味のある説明を可能にする。
SWaTとベンチマークの実験により、提案手法は複数の異常検出モデルにおける根本原因同定精度、時間的局所化、ロバスト性を一貫して改善することを示した。
論文 参考訳(メタデータ) (2026-04-19T21:01:52Z) - TRACES: Temporal Recall with Contextual Embeddings for Real-Time Video Anomaly Detection [0.0]
本稿では,文脈認識型ゼロショット異常検出問題に対処する。
提案手法は,時間的信号と視覚的埋め込みを関連づけたメモリ拡張パイプラインを定義する。
我々は、UCF-Crimeで90.4%のAUC、XD-Violenceで83.67%のAPを達成している。
論文 参考訳(メタデータ) (2025-11-01T14:54:08Z) - CALM: A Framework for Continuous, Adaptive, and LLM-Mediated Anomaly Detection in Time-Series Streams [0.42970700836450476]
本稿では,リアルタイム異常検出のための新しいエンドツーエンドフレームワークであるCALMを紹介する。
CALMはApache Beam分散処理フレームワーク上に構築されている。
クローズドループで連続的な微調整機構を実装し、異常検出モデルがほぼリアルタイムで進化するデータパターンに適応できるようにする。
論文 参考訳(メタデータ) (2025-08-29T00:27:35Z) - Weakly Supervised Video Anomaly Detection and Localization with Spatio-Temporal Prompts [57.01985221057047]
本稿では、事前学習された視覚言語モデル(VLM)に基づく、弱教師付きビデオ異常検出および局所化のための時間的プロンプト埋め込み(WSVADL)を学習する新しい手法を提案する。
提案手法は,WSVADLタスクの3つの公開ベンチマークにおける最先端性能を実現する。
論文 参考訳(メタデータ) (2024-08-12T03:31:29Z) - Graph Spatiotemporal Process for Multivariate Time Series Anomaly
Detection with Missing Values [67.76168547245237]
本稿では,グラフ時間過程と異常スコアラを用いて異常を検出するGST-Proという新しいフレームワークを提案する。
実験結果から,GST-Pro法は時系列データ中の異常を効果的に検出し,最先端の手法より優れていることがわかった。
論文 参考訳(メタデータ) (2024-01-11T10:10:16Z) - Video Anomaly Detection via Spatio-Temporal Pseudo-Anomaly Generation : A Unified Approach [49.995833831087175]
本研究は,画像のマスキング領域にペンキを塗布することにより,汎用的な映像時間PAを生成する手法を提案する。
さらに,OCC設定下での現実世界の異常を検出するための単純な統合フレームワークを提案する。
提案手法は,OCC設定下での既存のPAs生成および再構築手法と同等に動作する。
論文 参考訳(メタデータ) (2023-11-27T13:14:06Z) - CARLA: Self-supervised Contrastive Representation Learning for Time Series Anomaly Detection [53.83593870825628]
時系列異常検出(TSAD)の主な課題は、多くの実生活シナリオにおいてラベル付きデータの欠如である。
既存の異常検出手法の多くは、教師なしの方法で非ラベル時系列の正常な振る舞いを学習することに焦点を当てている。
本稿では,時系列異常検出のためのエンドツーエンドの自己教師型コントラアスティブ表現学習手法を提案する。
論文 参考訳(メタデータ) (2023-08-18T04:45:56Z) - Harnessing Contrastive Learning and Neural Transformation for Time Series Anomaly Detection [0.0]
時系列異常検出(TSAD)は多くの産業応用において重要な役割を担っている。
コントラスト学習は、ラベルのないデータから意味のある表現を抽出する過程において、時系列領域で勢いを増している。
本研究では,学習可能な変換で強化されたウィンドウベースのコントラスト学習戦略を取り入れた新しいアプローチであるCNTを提案する。
論文 参考訳(メタデータ) (2023-04-16T21:36:19Z) - Anomaly Transformer: Time Series Anomaly Detection with Association
Discrepancy [68.86835407617778]
Anomaly Transformerは、6つの教師なし時系列異常検出ベンチマークで最先端のパフォーマンスを達成する。
Anomaly Transformerは、6つの教師なし時系列異常検出ベンチマークで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2021-10-06T10:33:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。