論文の概要: Mind the Rift: Cross-Scale Coupling Mismatch for AI-Generated Video Detection
- arxiv url: http://arxiv.org/abs/2609.00742v1
- Date: Tue, 01 Sep 2026 05:23:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.400067
- Title: Mind the Rift: Cross-Scale Coupling Mismatch for AI-Generated Video Detection
- Title(参考訳): Mind the Rift:AI生成ビデオ検出のための大規模カップリングミスマッチ
- Authors: Siyu Li, Jin Yang, Weiheng Liang,
- Abstract要約: クロススケールカップリングミスマッチは新しい法医学的信号である。
自然ビデオでは、マクロレベルの時間的ダイナミクスとマイクロレベルの残留パターンは、統合されたイメージング物理パイプラインによって本質的に結合される。
しかし、この共同分布を明示的に保持していないトレーニング目的を持つAIジェネレータは、この結合を体系的に違反する。
このようなミスマッチの検出は、両方のスケールで独立して情報を抽出する必要があるため、難しい。
- 参考スコア(独自算出の注目度): 10.264738258468254
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As AI video generators achieve cinematic realism, reliable detection becomes essential for safeguarding digital trust. We identify cross-scale coupling mismatch as a new forensic signal, where scale refers to the level of abstraction (semantic dynamics vs. pixel-level residuals): in natural videos, macro-level temporal dynamics and micro-level residual patterns are intrinsically coupled by the unified imaging physics pipeline, whereas AI generators, whose training objectives do not explicitly preserve this joint distribution, systematically violate this coupling. Detecting such mismatch is challenging because it requires independently extracting information at both scales while simultaneously quantifying their cross-scale relationship. We propose RIFT (Representation Inconsistency Forensics on Trajectories), an orthogonal forensic framework that addresses this through three interlocking components: a macro stream that builds a dynamic baseline of expected temporal evolution via differential geometry and persistent homology on learned manifold trajectories, a micro stream that acts as a sensitive forensic probe via steganalytic filtering and temporal modeling, and a coupling divergence module that measures the conditional dependency between the two streams. Gram-Schmidt orthogonality guarantees the information-theoretic validity of this measurement. Experiments on two benchmarks (VidProM, 120K videos, 7 generators; GenVidBench, 68K videos, 4 generators) demonstrate that RIFT achieves 99.33% and 99.72% F1-score respectively, with 97.87% unseen-generator detection rate in leave-one-out evaluation, while exhibiting encoder agnosticism: scaling from ViT-S/14 (22M) to ViT-L/14 (300M) changes F1 by less than 0.1%, and switching to a different encoder family (DINOv1) reduces F1 by only 0.73 pp. Code is available at https://github.com/Litsay/RIFT
- Abstract(参考訳): AIビデオジェネレータがシネマリアリズムを達成するにつれ、デジタル信頼を守るために信頼性の高い検出が不可欠となる。
自然なビデオでは、マクロレベルの時間的ダイナミクスとマイクロレベルの残差パターンが、統合されたイメージング物理パイプラインによって本質的に結合されるのに対し、トレーニング対象であるAIジェネレータは、この結合を明示的に保護せず、体系的にこの結合に違反する。
このようなミスマッチの検出は、両者の関係を定量化しながら、双方のスケールで独立して情報を抽出する必要があるため、困難である。
本稿では,これらを3つの連動成分によって処理する直交法学フレームワークであるRIFT(Representation Inconsistency Forensics on Trajectories)を提案する。
グラムシュミット直交性は、この測定の情報理論的妥当性を保証する。
2つのベンチマーク(VidProM、120Kビデオ、7つのジェネレータ、GenVidBench、68Kビデオ、4つのジェネレータ)の実験では、RIFTはそれぞれ99.33%、99.72%のF1スコアを達成した。
コードはhttps://github.com/Litsay/RIFTで入手できる。
関連論文リスト
- TIE: Time Interval Encoding for Video Generation over Events [50.66585165263848]
ディレクタースタイルのプロンプト、ロボットアクション予測、インタラクティブなビデオエージェントは、同時イベントに対する時間的根拠を要求する。
現代のビデオジェネレータは、ポイントワイドな位置エンコーディングを通して、タイムを離散的なポイントとして表現する。
Time Interval TIEは、プラグイン・アンド・プレイ・インターバル・アウェアの一般化である。
論文 参考訳(メタデータ) (2026-05-11T13:23:14Z) - A Task-Agnostic Algebraic Integrity Metric for Event-Camera Streams Toward SOTIF-Compliant Perception using Pearson Correlation Coefficient [0.0]
イベントカメラは、自動運転システムにおける安全クリティカルな認識のための低遅延センシングを提供する。
現在、タスクに依存しない品質基準は非同期イベントストリーム上で直接動作しません。
本研究は、ピアソン相関係数(PCC)を3つの標準イベント表現に引き上げる統一的なフレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-08T12:54:23Z) - Detecting AI-Generated Videos with Spiking Neural Networks [26.67301552503132]
我々は,クロスジェネレータ評価のための冷凍セマンティックエンコーダとともに,スパイク駆動の時間枝で多チャンネル時間残差を処理する検出器であるMASTを提案する。
GenVideoベンチマークでは、MASTは厳密なクロスジェネレータ評価の下で10個の未確認発電機で93.14%の平均精度を達成した。
論文 参考訳(メタデータ) (2026-05-07T09:08:32Z) - Triple Spectral Fusion for Sensor-based Human Activity Recognition [86.21994396715074]
本稿では,センサを用いたヒューマンアクティビティ認識(HAR)に適した新しい三重スペクトル融合フレームワークを提案する。
雑音抑制のための適応的な補間フィルタリング手法を開発し,各IMUセンサを姿勢・運動モードノードに整理する。
適応ウェーブレット周波数選択手法により、コンテキストの冗長性を抑え、特徴の長さを短縮する。
論文 参考訳(メタデータ) (2026-05-04T15:42:58Z) - Attribution-Guided Multimodal Deepfake Detection via Cross-Modal Forensic Fingerprints [4.598350938853635]
ビデオの偽造方法を特定することができない検出器は、間違ったシグナルを学習している可能性が高い、と私たちは主張する。
二分検出とは異なり、帰属誘導学習は共有埋め込み空間に強い幾何学的制約を課す。
本稿では,属性検出と属性抽出を共同で学習する属性誘導型マルチモーダルディープフェイク検出フレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-29T09:11:13Z) - ATSS: Detecting AI-Generated Videos via Anomalous Temporal Self-Similarity [44.13741922118129]
異時性自己相似性(ATSS)と呼ばれるAIGVの特異な指紋を同定する。
我々は,この知見を三重相似表現と相互共役融合機構によって活用する多モーダル検出フレームワークATSSを提案する。
ATSSはAP、AUC、ACCの指標で最先端の手法を大幅に上回っている。
論文 参考訳(メタデータ) (2026-04-05T09:10:13Z) - Federated Spatiotemporal Graph Learning for Passive Attack Detection in Smart Grids [2.721477719641864]
本稿では,時間的ウィンドウ上で物理層と行動指標を融合させて受動的攻撃を検出するグラフ中心型マルチモーダル検出器を提案する。
テスト精度は98.32%、シーケンス毎の93.35%を0.15% FPRで達成している。
論文 参考訳(メタデータ) (2025-09-29T08:52:30Z) - Consistency Trajectory Models: Learning Probability Flow ODE Trajectory of Diffusion [56.38386580040991]
Consistency Trajectory Model (CTM) は Consistency Models (CM) の一般化である
CTMは、対戦訓練とスコアマッチング損失を効果的に組み合わせることで、パフォーマンスを向上させる。
CMとは異なり、CTMのスコア関数へのアクセスは、確立された制御可能/条件生成メソッドの採用を合理化することができる。
論文 参考訳(メタデータ) (2023-10-01T05:07:17Z) - Continuous time recurrent neural networks: overview and application to
forecasting blood glucose in the intensive care unit [56.801856519460465]
連続時間自己回帰リカレントニューラルネットワーク(Continuous Time Autoregressive Recurrent Neural Network, CTRNN)は、不規則な観測を考慮に入れたディープラーニングモデルである。
重篤なケア環境下での血糖値の確率予測へのこれらのモデルの適用を実証する。
論文 参考訳(メタデータ) (2023-04-14T09:39:06Z) - Decoding ECoG signal into 3D hand translation using deep learning [3.20238141000059]
運動脳-コンピュータインターフェース(Motor Brain-Computer Interface、BCI)は、運動障害者が環境と対話できる技術である。
連続手の動きを予測するために使用されるほとんどのECoG信号デコーダは線形モデルである。
多くの問題において最先端のディープラーニングモデルは、この関係をよりよく捉えるための解決策になり得る。
論文 参考訳(メタデータ) (2021-10-05T15:41:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。