論文の概要: Rethinking the Readout: Unlocking Video Backbones for AI-Generated Video Detection
- arxiv url: http://arxiv.org/abs/2607.15321v1
- Date: Thu, 16 Jul 2026 07:57:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-20 17:56:52.670828
- Title: Rethinking the Readout: Unlocking Video Backbones for AI-Generated Video Detection
- Title(参考訳): AIが生成したビデオ検出のためのビデオバックボーンのアンロック
- Authors: Manni Cui, Ziheng Qin, ZiAn Wang, Ruiqi Liu, Dianyuan Zou, Jianglan Wei, Han Zhou, Yu Liu, Jingrui Xu, Wenhao Wang, Zhenyu Zhang,
- Abstract要約: 標準的なグローバルな読み出し機能を備えたビデオバックボーンは、AIGVベンチマークにおいて、強い画像事前学習プローブを上回りません。
本稿では,2つの並列ストリームで集約層のみを置き換える軽量な読み出しであるVelocity Gated Patch Velocity Profiling (V-PVP)を提案する。
V-PVPは、エンドツーエンドの微調整とリニアなプローブ設定の両方で、多様なビデオバックボーンのパフォーマンスを継続的に改善する。
- 参考スコア(独自算出の注目度): 27.159823883012738
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: AI-generated videos (AIGVs) typically contain subtle temporal artifacts that arise from inter-frame inconsistencies rather than within individual frames. A detector that captures such artifacts should therefore benefit from video pretrained backbones over image only ones. In practice, however, video backbones with standard global readouts often fail to outperform strong image pretrained probes on AIGV benchmarks. We attribute this gap to excessive spatiotemporal aggregation in the readout. Video pretrained backbones tend to compress each frame into a single global descriptor. This compression suppresses local patch level temporal dynamics and discards inter patch relations, which are precisely the cues that AIGV detection most reliably depends on. Based on this, we propose Velocity Gated Patch Velocity Profiling (V-PVP), a lightweight readout that replaces only the aggregation layer with two parallel streams over the patch velocity field, adding only about $0.5$M trainable parameters. V-PVP serves as a general plug-and-play module that consistently improves performance across diverse video backbones under both end-to-end fine-tuning and linear probing settings. Our method reaches \textbf{95.28} AUC on AIGVDBench while keeping the backbone fully frozen. The results show that simply replacing the aggregation layer reactivates the temporal potential of frozen video backbones, restoring their advantage on AIGV detection. Code is available at https://anonymous.4open.science/r/PVP-81B3/.
- Abstract(参考訳): AI生成ビデオ(AIGV)は通常、個々のフレーム内でではなく、フレーム間の不整合から生じる微妙な時間的アーティファクトを含む。
したがって、そのようなアーティファクトをキャプチャする検出器は、画像のみよりもビデオ事前訓練されたバックボーンの恩恵を受けるべきである。
しかし、実際には、標準的なグローバルな読み出しを持つビデオバックボーンは、AIGVベンチマークの強い画像事前学習プローブを上回りません。
このギャップは、読み出しにおける時空間の過度な集約に起因している。
ビデオ事前トレーニングされたバックボーンは、各フレームを単一のグローバルディスクリプタに圧縮する傾向がある。
この圧縮は、局所的なパッチレベルの時間的ダイナミクスを抑圧し、AIGV検出が最も確実に依存する手がかりであるパッチ間関係を破棄する。
これに基づいて,Velocity Gated Patch Velocity Profiling (V-PVP)を提案する。これは,アグリゲーション層のみをパッチ速度場上の2つの並列ストリームに置き換える軽量な読み出しであり,トレーニング可能なパラメータは0.5ドル程度である。
V-PVPは汎用的なプラグイン・アンド・プレイモジュールとして機能し、エンド・ツー・エンドの微調整と線形探索の両方で様々なビデオバックボーンのパフォーマンスを継続的に改善する。
AIGVDBench上では背骨を完全に凍結しながらtextbf{95.28} AUCに達する。
その結果,アグリゲーション層を置換するだけで凍結したビデオバックボーンの時間的電位が再活性化し,AIGV検出の優位性が回復した。
コードはhttps://anonymous.4open.science/r/PVP-81B3/で入手できる。
関連論文リスト
- A Paradigm Shift: Fully End-to-End Training for Temporal Sentence Grounding in Videos [27.879461637513984]
ビデオの時間文グラウンド(TSGV)は、非トリミングビデオからの文クエリに意味的に対応する時間セグメントをローカライズすることを目的としている。
現在のほとんどの手法では、オフライン機能抽出のために事前訓練されたクエリ非依存のビジュアルエンコーダを採用しており、ビデオバックボーンは凍結されており、TSGVに最適化されていない。
本稿では,ビデオバックボーンとローカライゼーションヘッドを協調的に最適化する,完全なエンドツーエンドパラダイムを提案する。
論文 参考訳(メタデータ) (2026-04-03T08:26:12Z) - StableDPT: Temporal Stable Monocular Video Depth Estimation [14.453483279783908]
本稿では,最新の画像ベース(深度)推定モデルをビデオ処理に適用する手法を提案する。
我々のアーキテクチャは、市販のViTエンコーダ上に構築され、Dense Prediction Transformer (DPT) ヘッドが強化されている。
複数のベンチマークデータセットに対する評価では、リアルタイムシナリオにおける時間的一貫性の向上、最先端のパフォーマンスの競争力、および上位2倍高速な処理が示されている。
論文 参考訳(メタデータ) (2026-01-06T08:02:14Z) - Spatio-temporal Prompting Network for Robust Video Feature Extraction [74.54597668310707]
フレームテンポラリ(Frametemporal)は、ビデオ理解の分野における大きな課題の1つだ。
最近のアプローチでは、トランスフォーマーベースの統合モジュールを活用して、時間的品質情報を得る。
N-Temporal Prompting Network (NNSTP) という,クリーンで統一されたフレームワークを提案する。
ネットワークバックボーン内の入力特徴を調整することで,映像特徴の抽出を効率的に行うことができる。
論文 参考訳(メタデータ) (2024-02-04T17:52:04Z) - RIGID: Recurrent GAN Inversion and Editing of Real Face Videos [73.97520691413006]
GANのインバージョンは、実画像に強力な編集可能性を適用するのに不可欠である。
既存のビデオフレームを個別に反転させる手法は、時間の経過とともに望ましくない一貫性のない結果をもたらすことが多い。
我々は、textbfRecurrent vtextbfIdeo textbfGAN textbfInversion and etextbfDiting (RIGID) という統合されたリカレントフレームワークを提案する。
本フレームワークは,入力フレーム間の固有コヒーレンスをエンドツーエンドで学習する。
論文 参考訳(メタデータ) (2023-08-11T12:17:24Z) - You Can Ground Earlier than See: An Effective and Efficient Pipeline for
Temporal Sentence Grounding in Compressed Videos [56.676761067861236]
ビデオがトリミングされていない場合、時間的文のグラウンド化は、文問合せに従って目的のモーメントを意味的に見つけることを目的としている。
それまでの優れた作品は、かなり成功したが、それらはデコードされたフレームから抽出されたハイレベルな視覚的特徴にのみ焦点を当てている。
本稿では,圧縮された映像を直接視覚入力として利用する,圧縮された領域のTSGを提案する。
論文 参考訳(メタデータ) (2023-03-14T12:53:27Z) - Recurrent Video Restoration Transformer with Guided Deformable Attention [116.1684355529431]
本稿では,グローバルなリカレントフレームワーク内で,隣接するフレームを並列に処理するRVRTを提案する。
RVRTは、バランスの取れたモデルサイズ、メモリとランタイムをテストするベンチマークデータセット上で、最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2022-06-05T10:36:09Z) - VRT: A Video Restoration Transformer [126.79589717404863]
ビデオ復元(例:ビデオ超解像度)は、高品質のフレームを低品質のフレームから復元することを目的としている。
並列フレーム予測と長距離時間依存性モデリング機能を備えたビデオ再生変換器(VRT)を提案する。
論文 参考訳(メタデータ) (2022-01-28T17:54:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。