論文の概要: SPLIT: Training-Free AI-Generated and Partially Edited Video Detection via Spatial Patch-Level Incoherence and Temporal Roughness
- arxiv url: http://arxiv.org/abs/2607.02886v1
- Date: Fri, 03 Jul 2026 02:34:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.444551
- Title: SPLIT: Training-Free AI-Generated and Partially Edited Video Detection via Spatial Patch-Level Incoherence and Temporal Roughness
- Title(参考訳): SPLIT:空間的パッチレベル不整合と時間的粗さによるトレーニング不要AI生成部分編集ビデオ検出
- Abstract要約: 本研究では,凍結した視覚エンコーダのパッチトークンを用いて,完全に生成されたビデオと部分的に編集されたビデオの両方を検出するトレーニングフリー検出器を提案する。
SPLITは2段階テンポラルラフネス(TTR)と局所空間運動インコヒーレンス(LSMI)の2つの補完信号を計算する
固定FPRにおけるフェイクリコールに基づくサービス整合性評価プロトコルを提案する。
- 参考スコア(独自算出の注目度): 4.774658730084455
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Deploying AI-generated video detectors in real-world services demands an ultra-low false positive rate (FPR) on real videos to avoid falsely rejecting authentic content, a regime where standard metrics such as AUROC fail to reflect actual operating behavior. We introduce Spatial Patch-Level Incoherence and Temporal Roughness (SPLIT), a training-free detector that operates on patch tokens from a frozen vision encoder to detect both fully generated and partially edited videos. SPLIT computes two complementary signals: Two-step Temporal Roughness (TTR), capturing non-smooth patch trajectories via one-step and two-step feature variation contrast, and Local Spatial Motion Incoherence (LSMI), measuring spatially inconsistent temporal changes through gradients of a feature-space motion field. The two are fused multiplicatively with gamma correction to sharpen real-fake separation at strict thresholds. We further propose a service-aligned evaluation protocol based on Fake Recall at fixed FPR with real-only threshold calibration and cross-real threshold transfer. Across three benchmarks (FakeParts, GenVideo, and ViF-Bench), SPLIT achieves the highest Fake Recall at FPR = $0.1\%$, substantially outperforming supervised and training-free baselines while remaining robust to post-processing with negligible overhead. The code is publicly available at https://github.com/mldljyh/SPLIT .
- Abstract(参考訳): 現実のサービスにAI生成ビデオ検出器を配置するためには、実際のビデオに超低偽陽性率(FPR)を課す。
本研究では,凍結した視覚エンコーダからのパッチトークンを演算し,完全に生成されたビデオと部分的に編集されたビデオの両方を検出する,SPLIT(Spatial Patch-Level Incoherence and Temporal Roughness)について紹介する。
SPLITは、TTR(Two-step Temporal Roughness)、一段階と二段階の特徴変化コントラストによる非滑らかなパッチトラジェクトリのキャプチャ、特徴空間運動の勾配による空間的不整合時間変化を測定するローカル空間運動インコヒーレンス(LSMI)の2つの補完信号を計算する。
両者はガンマ補正と乗算して、厳密なしきい値で実像分離を研ぎ澄ませる。
さらに,固定FPRにおけるフェイクリコールに基づくサービス整合性評価プロトコルを提案する。
3つのベンチマーク(FakeParts、GenVideo、ViF-Bench)で、SPLITはFPRで最高のFakeリコールを達成している。
コードはhttps://github.com/mldljyh/SPLITで公開されている。
関連論文リスト
- Addressing Detail Bottlenecks in Latent Diffusion for RGB-to-SWIR Image Translation [3.8750462550584044]
遅延拡散モデル(LDMs)は、画像から画像への効率的な変換を可能にするが、圧縮中に詳細を破棄する。
そこで我々は,情報を失うオートエンコーダと条件付け経路の2つのボトルネックを同定した。
スイッチ接続によりデコーダに高解像度のソース機能を注入するSCAE(Source-Conditioned Autoencoder)と,ナイーブダウンサンプリングを学習条件信号に置き換えるLearningable Guidance(LGE)の2つの軽量なバックボーン非依存修正を提案する。
論文 参考訳(メタデータ) (2026-06-18T08:59:03Z) - GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval [10.034595422596562]
ビデオモーメント検索(VMR)タスクは、自然言語クエリに沿った時間境界を正確にローカライズする必要がある。
GIRL-DETRは、RLポストトレーニングを、初めて軽量な時間的ローカライゼーションフレームワークに導入する。
論文 参考訳(メタデータ) (2026-05-30T15:40:00Z) - CreFlow: Corrective Reflow for Sparse-Reward Embodied Video Diffusion RL [56.969946199335716]
本稿では,ポストトレーニング後のエンボディドビデオ生成モデルに対して,コンポジション制約に基づく報酬モデルを提案する。
提案するCreFlowは,2つの鍵となる設計を持つ新しいオンラインRLフレームワークである。
論文 参考訳(メタデータ) (2026-05-14T02:18:58Z) - PAS: A Training-Free Stabilizer for Temporal Encoding in Video LLMs [57.790910044227935]
ビデオLLMは時間的不整合に悩まされ、フレームタイミングの小さなシフトは注意をそらすことができ、関連するフレームを抑えることができる。
本稿では, 位相アグリゲード平滑化(PAS)について述べる。これは, 頭部に小さな反対位相オフセットを適用して, 出力を集約する学習自由機構である。
解析の結果,RoPE回転ロジットは,時間核でスケールしたコンテントドット積として近似でき,このカーネルを滑らかにすることで,小さな時間シフトに対する注意のリプシッツ安定性が得られ,マルチフェーズ平均化は,Nyquist-valid サンプリング下での頭当たりスペクトルを保ちながら高周波リップルを減衰させることがわかった。
論文 参考訳(メタデータ) (2025-11-14T05:56:47Z) - Real-Time LiDAR Super-Resolution via Frequency-Aware Multi-Scale Fusion [0.4078247440919472]
FLASH (Frequency-aware LiDAR Adaptive Super- resolution with Hierarchical fusion) は、二重ドメイン処理による制限を克服する新しいフレームワークである。
FLASHは、2つの重要なイノベーションを統合する: (i) 局所的な空間的注意とFFTによるグローバルな周波数領域分析を組み合わせ、細粒度の幾何と周期的な走査パターンの両方をログ線形複雑度で捉え、 (ii) 学習された位置特異的な特徴集約による従来のスキップ接続を置き換え、CBAMによる動的特徴選択のために強化する適応的マルチスケールフュージョン。
論文 参考訳(メタデータ) (2025-11-10T18:38:15Z) - Learning to Recognize Correctly Completed Procedure Steps in Egocentric Assembly Videos through Spatio-Temporal Modeling [11.720299001244976]
手順ステップ認識(PSR)のための2重ストリームフレームワークを提案する。
STORM-PSRはMECCANOとIndustRealのデータセットで評価される。
実際の組立工程の完了までの平均遅延を、それぞれ11.2%、26.1%削減する。
論文 参考訳(メタデータ) (2025-10-14T11:03:30Z) - Stable Video Infinity: Infinite-Length Video Generation with Error Recycling [76.91310169118408]
本研究では、高時間一貫性、可視的シーン遷移、制御可能なストリーミングストーリーラインを有する無限長ビデオを生成することができる安定ビデオインフィニティ(SVI)を提案する。
SVIにはError-Recycling Fine-Tuningが組み込まれており、これはDiffusion Transformerの自己生成エラーをスーパーバイザのプロンプトにリサイクルする、新しいタイプの効率的なトレーニングである。
我々は、一貫性、創造性、条件設定を含む3つのベンチマークでSVIを評価し、その汎用性と最先端の役割を徹底的に検証した。
論文 参考訳(メタデータ) (2025-10-10T09:45:46Z) - Global Context Aggregation Network for Lightweight Saliency Detection of
Surface Defects [70.48554424894728]
我々は,エンコーダ・デコーダ構造上の表面欠陥を簡易に検出するためのGCANet(Global Context Aggregation Network)を開発した。
まず、軽量バックボーンの上部層に新しいトランスフォーマーエンコーダを導入し、DSA(Depth-wise Self-Attention)モジュールを通じてグローバルなコンテキスト情報をキャプチャする。
3つの公開欠陥データセットの実験結果から,提案したネットワークは,他の17の最先端手法と比較して,精度と実行効率のトレードオフを良好に達成できることが示された。
論文 参考訳(メタデータ) (2023-09-22T06:19:11Z) - UIA-ViT: Unsupervised Inconsistency-Aware Method based on Vision
Transformer for Face Forgery Detection [52.91782218300844]
そこで我々は、UIA-ViTと呼ばれるビジョン変換器に基づく教師なし不整合認識手法を提案する。
自己注意機構により、パッチ埋め込み間の注意マップは自然に一貫性関係を表現し、一貫性表現学習に適した視覚変換器となる。
論文 参考訳(メタデータ) (2022-10-23T15:24:47Z) - Dense Label Encoding for Boundary Discontinuity Free Rotation Detection [69.75559390700887]
本稿では,分類に基づく比較的研究の少ない方法論について検討する。
我々は2つの側面でフロンティアを推し進めるための新しい手法を提案する。
航空画像のための大規模公開データセットの実験と視覚解析は,我々のアプローチの有効性を示している。
論文 参考訳(メタデータ) (2020-11-19T05:42:02Z) - Two-branch Recurrent Network for Isolating Deepfakes in Videos [17.59209853264258]
本稿では,2分岐ネットワーク構造に基づくディープフェイク検出手法を提案する。
1つのブランチは元の情報を伝達し、もう1つのブランチは顔の内容を抑制する。
当社の2つの新しいコンポーネントは、FaceForensics++、Celeb-DF、FacebookのDFDCプレビューベンチマークで有望な結果を示している。
論文 参考訳(メタデータ) (2020-08-08T01:38:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。