論文の概要: SphereVideo: Prototype-anchored Hyperspherical Boundary for Continual AI-generated Video Detection
- arxiv url: http://arxiv.org/abs/2608.01334v1
- Date: Sun, 02 Aug 2026 15:54:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.167645
- Title: SphereVideo: Prototype-anchored Hyperspherical Boundary for Continual AI-generated Video Detection
- Title(参考訳): SphereVideo:AIによる連続的ビデオ検出のためのプロトタイプアンコール型超球面境界
- Abstract要約: AI生成ビデオ(AIGV)検出は、実際のビデオとAI生成ビデオとを区別することを目的としている。
実際には、既存のデータに基づいて訓練された検出器は、新しい生成モデルへの一般化に失敗することが多い。
2つの重要な観測結果に基づいてAIGV検出のための新しいフレームワークであるSphereVideoを提案する。
- 参考スコア(独自算出の注目度): 61.05420454815012
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: AI-generated video (AIGV) detection aims to distinguish real videos from AI-generated ones. In practice, detectors trained on existing data often fail to generalize to newly emerging generative models, making this task challenging. Therefore, continual learning (CL) is essential for improving the adaptability. However, CL frameworks for this task remain underexplored. To this end, we propose SphereVideo, a novel CL framework for AIGV detection built on two key observations. First, real videos exhibit a compact feature distribution. Based on this, we encourage real video features to cluster around a real prototype on a hypersphere while repelling AI-generated samples, thereby establishing a decision boundary. This prototype serves as a stable anchor for CL, regulating boundary evolution and mitigating catastrophic forgetting. Second, existing methods tend to rely solely on spatial artifacts as shortcuts. To enhance temporal modeling, we introduce a strategy that models the temporal dynamics of real data at both frame and clip levels. By strengthening real data modeling, this strategy further facilitates learning a real prototype and forming a stable decision boundary. Moreover, we construct a comprehensive and challenging benchmark. Extensive experiments demonstrate that SphereVideo achieves an improved plasticity-stability trade-off, outperforming prior methods by 3.08% on seen data and 4.00% on unseen AI-generated data.
- Abstract(参考訳): AI生成ビデオ(AIGV)検出は、実際のビデオとAI生成ビデオとを区別することを目的としている。
実際には、既存のデータに基づいて訓練された検出器は、新しい生成モデルへの一般化に失敗することが多く、この作業は困難である。
したがって、適応性を向上させるためには継続学習(CL)が不可欠である。
しかし、このタスクのCLフレームワークはいまだ探索されていない。
そこで本研究では,AIGV検出のための新しいCLフレームワークであるSphereVideoを提案する。
まず、実際のビデオはコンパクトな特徴分布を示す。
これに基づいて、我々は、AI生成サンプルを撃退しながら、ハイパースフィアの実際のプロトタイプの周りに実際のビデオ機能をクラスタ化し、決定境界を確立することを推奨する。
このプロトタイプはCLの安定なアンカーとして機能し、境界の進化を制御し、破滅的な忘れを緩和する。
第二に、既存の手法はショートカットとして空間的アーティファクトにのみ依存する傾向がある。
時間的モデリングを強化するため、実データの時間的ダイナミクスをフレームレベルとクリップレベルの両方でモデル化する戦略を導入する。
実際のデータモデリングを強化することで、この戦略は実際のプロトタイプの学習をさらに促進し、安定した決定境界を形成する。
さらに,包括的で挑戦的なベンチマークを構築した。
大規模な実験により、SphereVideoは可塑性-安定性のトレードオフの改善を実現し、従来の手法を3.08%、見えないAI生成データでは4.00%上回った。
関連論文リスト
- Preserving Forgery Artifacts: AI-Generated Video Detection at Native Scale [36.51885181895111]
包括的データセットと新しい検出フレームワークを導入する。
まず、最先端の15のオープンソースおよび商用ジェネレータから140Kビデオの大規模なデータセットをキュレートする。
本稿では,Qwen-VL Vision Transformer上に構築された新しい検出フレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-06T12:36:08Z) - Scaling Up Occupancy-centric Driving Scene Generation: Dataset and Method [54.461213497603154]
作業中心の手法は、最近、フレームとモダリティをまたいだ一貫した条件付けを提供することで、最先端の結果を得た。
Nuplan-Occは、広く使われているNuplanベンチマークから構築された、これまでで最大の占有率データセットである。
高品質な占有、多視点ビデオ、LiDAR点雲を共同で合成する統合フレームワークを開発した。
論文 参考訳(メタデータ) (2025-10-27T03:52:45Z) - Leveraging Pre-Trained Visual Models for AI-Generated Video Detection [54.88903878778194]
ビデオ生成の分野はDeepFakesを超えて進歩し、ジェネリックコンテンツでAI生成ビデオを検出する方法が緊急に必要になった。
本稿では,事前学習した視覚モデルを用いて,実写映像と実写映像を区別する手法を提案する。
提案手法は, 平均90%以上で高い検出精度を達成し, その有効性を裏付けるものである。
論文 参考訳(メタデータ) (2025-07-17T15:36:39Z) - AI-Generated Video Detection via Perceptual Straightening [10.189379841180285]
本稿では,AI生成ビデオと自然を区別する新しい手法であるReStraVを提案する。
知覚的直交」仮説に着想を得て、モデルの表現領域における時間的曲率と段階的距離を定量化する。
我々の分析によると、AI生成ビデオは実際のビデオと比べて、曲率と距離のパターンがかなり異なる。
論文 参考訳(メタデータ) (2025-07-01T09:04:21Z) - Seeing What Matters: Generalizable AI-generated Video Detection with Forensic-Oriented Augmentation [31.737159092430108]
我々は、異なる生成的アーキテクチャを研究し、バイアスがなく、障害に対して堅牢で、モデル間で共有される差別的特徴を探索し識別する。
本稿では,ウェーブレット分解に基づく新たなデータ拡張戦略を導入し,より関連する法医学的手がかりを活用するために,特定の周波数関連帯域を置き換える。
本手法は最先端検出器よりも精度が向上し, 非常に最近の生成モデルにおいても優れた結果が得られる。
論文 参考訳(メタデータ) (2025-06-20T07:36:59Z) - DAVID-XR1: Detecting AI-Generated Videos with Explainable Reasoning [58.70446237944036]
DAVID-Xは、AI生成ビデオに詳細な欠陥レベル、時間空間アノテーションと有理書を組み合わせた最初のデータセットである。
DAVID-XR1は、視覚的推論の解釈可能な連鎖を提供するために設計されたビデオ言語モデルである。
以上の結果から,AI生成ビデオコンテンツの信頼性確認のための説明可能な検出手法が期待できることを示す。
論文 参考訳(メタデータ) (2025-06-13T13:39:53Z) - BusterX: MLLM-Powered AI-Generated Video Forgery Detection and Explanation [77.55074597806035]
GenBuster-200Kは、200Kの高解像度ビデオクリップを備えた、大規模で高品質なAI生成ビデオデータセットである。
BusterXは、マルチモーダル大言語モデル(MLLM)と強化学習を活用した、AI生成のビデオ検出および説明フレームワークである。
論文 参考訳(メタデータ) (2025-05-19T02:06:43Z) - ASF-Net: Robust Video Deraining via Temporal Alignment and Online
Adaptive Learning [47.10392889695035]
本稿では,時間シフトモジュールを組み込んだ新しい計算パラダイムであるアライメント・シフト・フュージョン・ネットワーク(ASF-Net)を提案する。
LArgeスケールのRAINYビデオデータセット(LARA)を構築し,このコミュニティの開発を支援する。
提案手法は,3つのベンチマークにおいて優れた性能を示し,実世界のシナリオにおいて魅力的な視覚的品質を示す。
論文 参考訳(メタデータ) (2023-09-02T14:50:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。