論文の概要: Detect Early, Escalate Rarely: Anytime Detection of AI-Generated Video from the Compressed Bitstream
- arxiv url: http://arxiv.org/abs/2607.19476v1
- Date: Tue, 21 Jul 2026 18:00:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 18:51:37.901088
- Title: Detect Early, Escalate Rarely: Anytime Detection of AI-Generated Video from the Compressed Bitstream
- Title(参考訳): 圧縮されたビットストリームからAI生成ビデオがいつでも検出される
- Authors: Mert Onur Cakiroglu, Mehmet Dalkilic, Hasan Kurban,
- Abstract要約: AI生成ビデオの検出器はオフラインで評価される。
クリップはピクセルにデコードされ、大きな視覚言語モデルによって1回得点される。
我々は、タスクをストリーミング認識として再キャストし、すでに書いた動き場をビットストリームにスコアする。
- 参考スコア(独自算出の注目度): 0.764671395172401
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Detectors for AI-generated video are evaluated offline. A clip is decoded to pixels and scored once, increasingly by a large vision-language model. Detection, however, is deployed online. We recast the task as streaming perception and score the motion field the codec already wrote into the bitstream. Reading that field is a parse, not a pixel-domain forward pass. Because the running aggregate is monotone, one end-calibrated threshold is anytime-valid at the data-dependent decision time. Recalibrating at each prefix is not. Escalation is priced in closed form. A compute budget maps to a deferral window, on a frontier monotone exactly where the deferral condition holds. On matched GenVidBench the codec stage reaches full-length AUC 0.64 at five orders of magnitude less compute than a pixel CNN, on CPU. Its gate holds the stopping-time false-positive rate at target while the real data match its calibration, and drifts above it under distribution shift. Deferring 15% of clips lifts accuracy from 0.75 to 0.78 at $7\times$ less compute (paired: McNemar $p<10^{-6}$). The stage-1 ordering replicates on AIGVDBench. We introduce no new detector. The contribution is the reframing, two guarantees, and the measured frontiers. Code, configurations, and evaluation splits: https://github.com/KurbanIntelligenceLab/streamdet.
- Abstract(参考訳): AI生成ビデオの検出器はオフラインで評価される。
クリップはピクセルにデコードされ、大きな視覚言語モデルによって1回得点される。
しかし、検出はオンラインで配信される。
我々は、タスクをストリーミング認識として再キャストし、コーデックがすでに書いた動き場をビットストリームにスコアする。
そのフィールドを読むことはパースであり、ピクセルドメインフォワードパスではない。
ランニングアグリゲーションはモノトンであるため、一方のエンドキャリブレーションされたしきい値は、データ依存の意思決定時間において、いつでも有効である。
それぞれの接頭辞に当てはまらない。
エスカレーションはクローズドな形で価格が設定される。
計算予算は、deferral条件が正確に保持されているフロンティアモノトーン上のdeferralウィンドウにマップされる。
一致したGenVidBenchでは、コーデックステージはCPU上のCNNよりも5桁少ない計算でフル長のAUC 0.64に達する。
そのゲートは、実際のデータがキャリブレーションと一致する間、ターゲットの停止時間偽陽性率を保持し、分布シフトの下でその上をドリフトする。
15%のクリップを定義すれば、精度が0.75から0.78に上がり、$7\times$(p<10^{-6}$)以下になる。
stage-1の配列はAIGVDBenchで複製される。
我々は新しい検出器を導入しない。
貢献はリフレーミング、2つの保証、そして測定されたフロンティアである。
コード、設定、評価は次のように分割される。
関連論文リスト
- SPLIT: Training-Free AI-Generated and Partially Edited Video Detection via Spatial Patch-Level Incoherence and Temporal Roughness [4.774658730084455]
本研究では,凍結した視覚エンコーダのパッチトークンを用いて,完全に生成されたビデオと部分的に編集されたビデオの両方を検出するトレーニングフリー検出器を提案する。
SPLITは2段階テンポラルラフネス(TTR)と局所空間運動インコヒーレンス(LSMI)の2つの補完信号を計算する
固定FPRにおけるフェイクリコールに基づくサービス整合性評価プロトコルを提案する。
論文 参考訳(メタデータ) (2026-07-03T02:34:50Z) - A global predicted-fMRI drive signal from TRIBE does not predict YouTube replay heatmaps [0.0]
マルチモーダル脳エンコーディングモデルは、自然なビデオに対するfMRI応答を高精度に予測する。
TRIBEを48本のYouTubeビデオで実行し、秒単位のエンゲージメント曲線に対する予測された皮質反応を削減します。
TRIBEの入力ストリームでプローブを実行すると、少なくとも小さな境界線視覚ストリーム信号が明らかになる。
我々は、YouTubeのSABRストリーミングに堅牢なコード、ビデオIDマニフェスト、ヒートマップ取得方法をリリースする。
論文 参考訳(メタデータ) (2026-07-01T19:03:17Z) - An Empirical Audit of Input Encoders for Multi-Channel Signal Transformers [0.0]
マルチチャネルスカラー信号を消費するトランスフォーマーは、時間ステップ毎に$C$同時値を1つの$d_textmodel$-dimensionalベクトルに埋め込む必要がある。
我々は、8つの入力エンコーダ(共有スカラーベースライン、チャネルごとの線形射影、明示正規化器、非線形論理的、ブロック分割結合、チャネル非依存、チャネル・アズ・トークン)を監査する。
標準のチャネルごとの線形射影は、小さな、統計的に現実的だが実質的には控えめな差まで、あらゆる選択肢と一致している。
論文 参考訳(メタデータ) (2026-06-03T11:35:09Z) - TAPNext++: What's Next for Tracking Any Point (TAP)? [58.6925880906723]
本稿では,低メモリとアーキテクチャの計算フットプリントを保ちながら,桁数桁長の点を追跡するモデルを提案する。
再検出性能が現在の文献の盲点であることを強調し,新しいメトリクスであるRe-detection Average Jaccardを導入する。
複数のベンチマークにおいて,再帰型トランスフォーマーがポイントトラッキングのために大幅に改善され,新たな最先端のモデルが設定できることが実証された。
論文 参考訳(メタデータ) (2026-04-12T11:02:13Z) - MistExit: Learning to Exit for Early Mistake Detection in Procedural Videos [53.5354731425141]
ビデオにおける早期誤り検出の課題について紹介する。
本研究の目的は,プロシージャ活動におけるキーステップが,ストリーミング映像を可能な限り少なく観察しながら正しく実行されるかどうかを判断することである。
本稿では,誤り検出と強化学習ポリシを組み合わせた手法を提案する。
論文 参考訳(メタデータ) (2026-03-15T07:14:49Z) - Artic: AI-oriented Real-time Communication for MLLM Video Assistant [9.700784988498558]
ArticはMLLMビデオアシスタントのためのAI指向リアルタイムコミュニケーションフレームワークである。
プロトタイプ実験では、Articは精度を15.12%向上し、レイテンシを135.31ミリ秒削減した。
論文 参考訳(メタデータ) (2026-02-13T06:00:17Z) - Diffusion Language Models Know the Answer Before Decoding [56.96815863705218]
拡散言語モデル (DLM) は自己回帰的アプローチの代替として登場した。
我々の研究は、DLMの早期回答収束の見過ごされた特性を強調し、活用する。
Prophetは、早期コミット復号を可能にするトレーニングフリーの高速復号化パラダイムである。
論文 参考訳(メタデータ) (2025-08-27T15:40:25Z) - Prune Spatio-temporal Tokens by Semantic-aware Temporal Accumulation [89.88214896713846]
STAスコアは、時間的冗長性と意味的重要性の2つの重要な要因を考慮に入れている。
市販のビデオトランスフォーマーとビデオウィンにSTAモジュールを適用する。
結果: Kinetics-400 と something-Something V2 は 30% のオーバーシェルフ削減を実現し,0.2% の精度低下を実現した。
論文 参考訳(メタデータ) (2023-08-08T19:38:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。