論文の概要: DELTAVID: Enhancing Fine-Grained Spatiotemporal Perception with Cross-Video Differences
- arxiv url: http://arxiv.org/abs/2607.02551v1
- Date: Fri, 26 Jun 2026 16:05:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 07:26:11.075735
- Title: DELTAVID: Enhancing Fine-Grained Spatiotemporal Perception with Cross-Video Differences
- Title(参考訳): DELTAVID: ビデオ間差による細粒度時空間知覚の強化
- Authors: Yankai Yang, Yancheng Long, Bin Wen, Fan Yang, Tingting Gao, Han Li, Shuo Yang,
- Abstract要約: ビデオ間の差異は、きめ細かな認識に有効な方法であるだけでなく、粗いセマンティック理解からきめ細かな推論に移行するスケーラブルなプロキシでもある。
ビデオ間の差異は, 微粒化知覚に有効な方法であるだけでなく, 粗い意味理解から細粒化推論へ移行するスケーラブルなプロキシであることを示す。
- 参考スコア(独自算出の注目度): 19.64446585108392
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Video multimodal large language models have made strong progress on open-ended video understanding, but they still lack precise local spatiotemporal perception. When two videos share almost the same global semantics and differ only in a short time span or a small region, current models often fail to find the change and provide reliable evidence. We propose DELTAVID, a verifiable proxy-task framework that enhances fine-grained spatiotemporal perception with cross-video differences. The key idea is to turn cross-video spot-the-difference into a trainable perception signal, where a model identifies local changes, judges temporal boundaries, and organizes spatial evidence by comparing similar videos. To make this signal scalable to train and reliable to evaluate, we further introduce DELTAVID-10K and DELTAVID-Bench, which convert controllable local differences in real videos into evidence-labeled training and test samples. Experiments show that DELTAVID substantially improves performance on cross-video difference understanding and transfers the learned local evidence ability to general video understanding benchmarks, including MMVU, MLVU, Video-MME, VideoHolmes, VideoMMMU, LVBench, TempCompass, and LongVideoBench. These results show that cross-video differences are not only an effective way to diagnose fine-grained perception failures, but also a scalable proxy supervision that moves Video MLLMs from coarse semantic understanding toward fine-grained spatiotemporal evidence reasoning.
- Abstract(参考訳): ビデオマルチモーダルな大言語モデルは、オープンエンドビデオ理解に大きく進歩しているが、正確な局所時空間知覚はいまだに欠いている。
2つのビデオがほぼ同じグローバルなセマンティクスを共有し、短い時間か小さな領域でのみ異なる場合、現在のモデルは変更を見つけられず、信頼できる証拠が得られないことが多い。
本稿では,ビデオ間差による微細な時空間知覚を高めるための,検証可能なプロキシタスクフレームワークであるDELTAVIDを提案する。
ここでは、モデルが局所的な変化を特定し、時間的境界を判断し、類似したビデオを比較して空間的証拠を整理する。
この信号をトレーニングにスケーラブルにし、評価に信頼性を持たせるために、実ビデオの制御可能なローカル差分をエビデンスラベルのトレーニングとテストサンプルに変換するDELTAVID-10KとDELTAVID-Benchを導入する。
実験の結果,DLTAVIDは,MMVU,MLVU, Video-MME, VideoHolmes, VideoMMMU, LVBench, TempCompass, LongVideoBenchなど,学習したローカルエビデンスを一般的なビデオ理解ベンチマークに転送することで,映像間差分理解の性能を大幅に向上させることがわかった。
これらの結果から,映像間の相違は,微粒な知覚障害の診断に有効な方法であるだけでなく,ビデオMLLMを粗い意味理解から細粒な時空間的証拠推論に移行するためのスケーラブルなプロキシ・インスペクションでもあることが示唆された。
関連論文リスト
- SeViCES: Unifying Semantic-Visual Evidence Consensus for Long Video Understanding [36.30263540665245]
本稿では,効果的で信頼性の高いロングビデオ理解のためのフレームワークを提案する。
SeViCESはトレーニング不要でモデルに依存しない2つの重要なコンポーネントを導入している。
長いビデオ理解ベンチマークの実験によると、SeViCESは精度と堅牢性の両方で最先端の手法を一貫して上回っている。
論文 参考訳(メタデータ) (2025-10-23T14:55:28Z) - Vid-SME: Membership Inference Attacks against Large Video Understanding Models [56.31088116526825]
ビデオ理解モデル(VULLM)で使用されるビデオデータに適した,最初の会員推論手法であるVid-SMEを紹介する。
自然なビデオフレームと時間的に反転したビデオフレームのSME差を利用して、Vid-SMEは、与えられたビデオがモデルのトレーニングセットの一部であるかどうかを判断するロバストなメンバーシップスコアを導出する。
様々な自己学習およびオープンソースVULLMの実験は、Vid-SMEの強力な有効性を示している。
論文 参考訳(メタデータ) (2025-05-29T13:17:25Z) - Enhanced Multimodal Hate Video Detection via Channel-wise and Modality-wise Fusion [7.728348842555291]
TikTokやYouTubeなどのプラットフォーム上でのビデオコンテンツが急速に普及し、情報発信が変化した。
ヘイトスピーチと戦うための大きな努力にもかかわらず、これらのビデオの検出は、しばしば暗黙的な性質のために難しいままである。
本稿では,Channel-wise and Modality-wise Fusion Mechanismを用いたマルチモーダルヘイトビデオ検出モデルCMFusionを提案する。
論文 参考訳(メタデータ) (2025-05-17T15:24:48Z) - VANE-Bench: Video Anomaly Evaluation Benchmark for Conversational LMMs [64.60035916955837]
VANE-Benchはビデオの異常や矛盾を検出するためのビデオLMMの熟練度を評価するために設計されたベンチマークである。
我々のデータセットは、既存の最先端のテキスト・ビデオ生成モデルを用いて合成された一連のビデオから構成される。
我々は、このベンチマークタスクにおいて、オープンソースとクローズドソースの両方で既存の9つのビデオLMMを評価し、ほとんどのモデルが微妙な異常を効果的に識別するのに困難に直面することを発見した。
論文 参考訳(メタデータ) (2024-06-14T17:59:01Z) - Improving Video Retrieval by Adaptive Margin [18.326296132847332]
ビデオ検索の主流パラダイムは、正の対と負の対の類似性の間の距離を固定辺から切り離すことで、ビデオテキスト表現を学習する。
トレーニングに使用される負のペアはランダムにサンプリングされ、負のペア間のセマンティクスが関連あるいは等価であることを示している。
本稿では、上記の問題を解決するために、正対と負対の距離で変化した適応マージンを提案する。
論文 参考訳(メタデータ) (2023-03-09T08:07:38Z) - Unsupervised Pre-training for Temporal Action Localization Tasks [76.01985780118422]
本稿では、Pseudo Action Localization (PAL) と呼ばれる自己教師付きプレテキストタスクを、時間的アクションローカライゼーションタスク(UP-TAL)のための教師なし事前訓練機能エンコーダに提案する。
具体的には、まず1つのビデオから複数のクリップを含む時間領域をランダムに選択し、他の2つのビデオの異なる時間的位置に貼り付ける。
前提課題は、2つの合成ビデオからペーストした擬似行動領域の特徴を調整し、両者の合意を最大化することである。
論文 参考訳(メタデータ) (2022-03-25T12:13:43Z) - ASCNet: Self-supervised Video Representation Learning with
Appearance-Speed Consistency [62.38914747727636]
本研究では,1)明示的な監督のためのラベルの欠如,2)構造化されていない,ノイズの多い視覚情報による自己指導型映像表現学習について検討する。
既存の方法は、主にビデオクリップをインスタンスとしてコントラスト損失を使用し、互いにインスタンスを識別することで視覚的表現を学ぶ。
本稿では,ロバストな映像表現を学ぶ上で,正のサンプル間の一貫性が鍵となることを観察する。
論文 参考訳(メタデータ) (2021-06-04T08:44:50Z) - Semi-Supervised Action Recognition with Temporal Contrastive Learning [50.08957096801457]
2つの異なる速度でラベル付きビデオを用いて2経路の時間的コントラストモデルを学習する。
我々は最先端の半教師付き画像認識手法の映像拡張性能を著しく向上させた。
論文 参考訳(メタデータ) (2021-02-04T17:28:35Z) - Self-supervised Video Representation Learning by Pace Prediction [48.029602040786685]
本稿では,ビデオペース予測による自己指導型映像表現学習の課題に対処する。
人間の視覚系がビデオのペースに敏感であるという観察に由来する。
我々は、異なるペースでトレーニングクリップをランダムにサンプリングし、ニューラルネットワークに各ビデオクリップのペースを特定するよう依頼する。
論文 参考訳(メタデータ) (2020-08-13T12:40:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。