論文の概要: Do Input-Level Defenses Transfer to Observation-Level Attacks on VideoLLMs?
- arxiv url: http://arxiv.org/abs/2609.08331v1
- Date: Tue, 08 Sep 2026 06:59:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-11 16:49:49.332525
- Title: Do Input-Level Defenses Transfer to Observation-Level Attacks on VideoLLMs?
- Title(参考訳): インプットレベルディフェンスはビデオLLMの観測レベルアタックに転送されるか?
- Authors: Bangshuo Zhu, Wei Song, Yuxin Cao, Yuezhong Wu, Zhiquan Liu, Yuekang Li, Jingling Xue,
- Abstract要約: Video Large Language Models (VideoLLMs) は、コンテンツモデレーションやビデオ分析など、安全上重要なアプリケーションにますますデプロイされている。
近年の観測レベルの攻撃はこのパイプラインを利用して、モデルが有害な内容を認識するのを防ぐ。
制御された評価フレームワークであるDefTEvalを導入し、インプットレベルの敵防衛が観測レベルの攻撃を軽減できるかどうかを評価する。
- 参考スコア(独自算出の注目度): 20.483915081902087
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Video Large Language Models (VideoLLMs) are increasingly deployed in safety-critical applications such as content moderation and video analytics. To process long videos efficiently, VideoLLMs rely on frame sampling, token compression, and modality fusion, which together form an observation pipeline that reduces the raw video to a compact internal representation. Recent observation-level attacks exploit this pipeline to prevent the model from perceiving harmful content, yet no defense has been explicitly designed for this threat. We introduce DefTEval, a controlled evaluation framework that systematically assesses whether input-level adversarial defenses, which operate on the pixel content of already-sampled frames, can mitigate observation-level attacks. Across five VideoLLMs, eleven representative defenses, and five attack types, we find that input-level defenses offer limited and inconsistent protection, with harmful detection rates frequently near zero. Critically, defenses fail even against attacks that embed harmful signals in every sampled frame, indicating that the bottleneck extends beyond sampling omission to the suppression of signals that do enter the model. Token compression discards localized features, and modality fusion systematically down-weights weakened visual signals. Furthermore, defense effectiveness is dominated by model architecture rather than by the defense method itself, and detection rates vary drastically across content categories, exposing structural weaknesses in temporal reasoning. These findings demonstrate that securing VideoLLMs requires system-level robustness mechanisms spanning sampling-aware coverage guarantees, token-level preservation of safety-relevant features, and modality-balanced fusion.
- Abstract(参考訳): Video Large Language Models (VideoLLMs) は、コンテンツモデレーションやビデオ分析など、安全上重要なアプリケーションにますますデプロイされている。
長いビデオを効率的に処理するために、ビデオLLMはフレームサンプリング、トークン圧縮、モダリティ融合に頼っている。
近年の観測レベルの攻撃は、このパイプラインを利用して、モデルが有害なコンテンツを認識するのを防ぐが、この脅威に対して明確な防御は設計されていない。
我々は、既にサンプル化されているフレームの画素内容で動作する入力レベルの対角防御が、観察レベルの攻撃を軽減できるかどうかを体系的に評価する制御された評価フレームワークであるDefTEvalを紹介した。
5つのビデオLLM、11の代表的な防御、および5つの攻撃タイプにまたがって、入力レベルの防御は制限的かつ一貫性のない保護を提供し、有害な検出率は0に近いことが判明した。
重要な点として、すべてのサンプルフレームに有害なシグナルを埋め込む攻撃にも防御は失敗し、ボトルネックがサンプリングの欠落を越えてモデルに入る信号の抑制にまで広がることを示している。
トーケン圧縮は局所的な特徴を捨て、モダリティ融合は系統的にダウンウェイトを減らし視覚信号を弱める。
さらに, 防御効果は, 防御法自体よりもモデルアーキテクチャに支配されており, 検出率はコンテンツカテゴリーによって大きく異なり, 時間的推論における構造的弱点が明らかにされている。
これらの結果から, VideoLLMの確保には, サンプリング・アウェア・カバレッジ保証, トークンレベルの安全関連特徴の保存, モダリティ・バランスド・フュージョンを対象とするシステムレベルの堅牢性機構が必要であることが示唆された。
関連論文リスト
- Fast Object Removal Attacks on Safety-Critical Video-based Perception Systems [10.77921487555435]
本稿では,ビデオベース安全クリティカルシステムに対する準リアルタイム対象物除去攻撃のための新しい攻撃モデルとエンドツーエンドフレームワークを提案する。
サウスカロライナ・コネクテッド・ビークル・テストベッド(英語版)の交差点での実験では、再建されたフレームはオリジナルと大域的に類似していることが示されている。
YOLOベースの検出器を用いて、攻撃はオブジェクト検出を最大97.59%削減し、フレームレベルの攻撃成功率は94.48%に達する。
論文 参考訳(メタデータ) (2026-08-03T19:03:24Z) - FrameShield: Adversarially Robust Video Anomaly Detection [16.21127415496373]
Weakly Supervised Video Anomaly Detection (WSVAD)は目覚ましい進歩を遂げているが、既存のモデルは敵攻撃に弱いままであり、信頼性が制限されている。
本研究では、時間的整合性を維持しつつ、通常のビデオの局所化領域に重篤な拡張を加えて合成異常を生成する「時空間歪み(Spatiotemporal Region Distortion, SRD)」と呼ばれる新しい擬似異常生成手法を提案する。
提案手法は,WSVADモデルの敵攻撃に対するロバスト性を大幅に向上させ,複数のベンチマークでAUROC全体のパフォーマンスを平均71.0%向上させる。
論文 参考訳(メタデータ) (2025-10-24T14:59:43Z) - MirGuard: Towards a Robust Provenance-based Intrusion Detection System Against Graph Manipulation Attacks [13.92935628832727]
MirGuardは、ロジック対応のマルチビュー拡張とコントラスト表現学習を組み合わせた異常検出フレームワークである。
MirGuardは、さまざまなグラフ操作攻撃に対して、最先端の検出器の堅牢性を大幅に上回っている。
論文 参考訳(メタデータ) (2025-08-14T13:35:51Z) - Benchmarking Misuse Mitigation Against Covert Adversaries [80.74502950627736]
既存の言語モデルの安全性評価は、オーバースト攻撃と低レベルのタスクに重点を置いている。
我々は、隠蔽攻撃と対応する防御の評価を自動化するデータ生成パイプラインである、ステートフルディフェンスのためのベンチマーク(BSD)を開発した。
評価の結果,分解攻撃は有効な誤用防止剤であり,その対策としてステートフルディフェンスを強調した。
論文 参考訳(メタデータ) (2025-06-06T17:33:33Z) - Video-SafetyBench: A Benchmark for Safety Evaluation of Video LVLMs [45.265397990158846]
Video-SafetyBenchは、ビデオテキスト攻撃下でのLVLMの安全性を評価するために設計された最初のベンチマークである。
ビデオテキストのペアは2,264で、48のきめ細かいアンセーフなカテゴリにまたがっている。
安全性評価のためのセマンティックなビデオを生成するために,ビデオ意味論を主題画像とモーションテキストに分解する制御可能なパイプラインを設計する。
論文 参考訳(メタデータ) (2025-05-17T05:06:38Z) - T2VShield: Model-Agnostic Jailbreak Defense for Text-to-Video Models [88.63040835652902]
テキストからビデオモデルへの攻撃はジェイルブレイク攻撃に弱いため、特別な方法で安全メカニズムをバイパスし、有害または安全でないコンテンツの生成につながる。
我々は、ジェイルブレイクの脅威からテキストからビデオモデルを守るために設計された包括的でモデルに依存しない防衛フレームワークであるT2VShieldを提案する。
本手法は,既存の防御の限界を特定するために,入力,モデル,出力の段階を体系的に解析する。
論文 参考訳(メタデータ) (2025-04-22T01:18:42Z) - Temporal-Distributed Backdoor Attack Against Video Based Action
Recognition [21.916002204426853]
ビデオデータに対する、シンプルで効果的なバックドア攻撃を導入する。
我々の提案した攻撃は、変換されたドメインに摂動を加えることで、ビデオフレームに知覚不能で時間的に分散されたトリガーを配置する。
論文 参考訳(メタデータ) (2023-08-21T22:31:54Z) - Investigating Robustness of Adversarial Samples Detection for Automatic
Speaker Verification [78.51092318750102]
本研究は,ASVシステムに対して,別個の検出ネットワークによる敵攻撃から防御することを提案する。
VGGライクな二分分類検出器を導入し、対向サンプルの検出に有効であることが実証された。
論文 参考訳(メタデータ) (2020-06-11T04:31:56Z) - A Self-supervised Approach for Adversarial Robustness [105.88250594033053]
敵対的な例は、ディープニューラルネットワーク(DNN)ベースの視覚システムにおいて破滅的な誤りを引き起こす可能性がある。
本稿では,入力空間における自己教師型対向学習機構を提案する。
これは、反逆攻撃に対する強力な堅牢性を提供する。
論文 参考訳(メタデータ) (2020-06-08T20:42:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。