論文の概要: V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure
- arxiv url: http://arxiv.org/abs/2607.21151v2
- Date: Sun, 26 Jul 2026 23:23:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 14:56:47.039697
- Title: V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure
- Title(参考訳): V-DEAL:ビデオの安全性の非校正を理解・拒否結合の失敗として診断する
- Abstract要約: ビデオ大言語モデルは、ますます現実世界のアプリケーションにデプロイされ、安全アライメントが重要になっていることを保証します。
対極的には、良質なクエリと組み合わせた有害なビデオは、明らかな有害なクエリを持つ同じビデオよりも攻撃の成功率が高いことが分かる。
本稿では、この障害行動、理解、内部表現を共同で分析する3段階の診断認識フレームワークであるV-を提案する。
- 参考スコア(独自算出の注目度): 29.105754434519415
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: As Video Large Language Models are increasingly deployed in real-world applications, ensuring their safety alignment has become critical. Counterintuitively, we find that harmful videos paired with benign queries achieve higher attack success rates than the same videos paired with explicitly harmful queries. To understand the underlying mechanism of this vulnerability, we present V-DEAL, a three-level diagnostic framework that jointly analyzes this failure across model behaviour, understanding, and internal representations. By progressively ruling out perception failure and quantifying the model's internal refusal tendency, V-DEAL provides a new diagnostic perspective for analyzing the underlying mechanism of the observed vulnerability. We tested six Video LLMs on three public benchmarks and observed that models correctly recognize harmful video content with over 81\% accuracy, yet the average attack success rate still reaches 48.33\% under the condition pairing harmful videos with benign queries. Hidden-state analysis further shows that visual understanding activates a weaker refusal tendency than textual understanding. Furthermore, we introduce a prompt injection intervention method that reduces attack success rates by an average of 48.24 percentage points and achieves performance comparable to prior fine-tuning-based methods, providing an effective and practical means to address such safety risks in Video LLMs.
- Abstract(参考訳): ビデオ大言語モデルが現実世界のアプリケーションにますますデプロイされるにつれて、安全性の確保が重要になっている。
対極的には、良質なクエリと組み合わせた有害なビデオは、明らかな有害なクエリと組み合わせた同じビデオよりも攻撃の成功率が高いことが分かる。
この脆弱性の基盤となるメカニズムを理解するために,モデル動作,理解,内部表現の3段階の診断フレームワークであるV-DEALを提案する。
知覚障害を段階的に排除し、モデルの内部拒絶傾向を定量化することにより、V-DEALは、観測された脆弱性の基盤となるメカニズムを分析するための新しい診断的視点を提供する。
我々は3つの公開ベンチマークで6つのビデオLLMをテストし、81 %以上の精度で有害なビデオコンテンツを正しく認識するが、平均攻撃成功率は、良質なクエリと有害なビデオのペアリング条件下では48.33 %に達することを観察した。
隠れ状態解析は、視覚的理解がテキスト理解よりも弱い拒絶傾向を活性化することを示している。
さらに,攻撃成功率を平均48.24ポイント削減し,従来の微調整方式に匹敵する性能を実現し,ビデオLLMにおけるこのような安全リスクに効果的かつ実用的な手段を提供するプロンプトインジェクション介入手法を提案する。
関連論文リスト
- INFACT: A Diagnostic Benchmark for Induced Faithfulness and Factuality Hallucinations in Video-LLMs [69.11382230669491]
ビデオ証拠(忠実さ)または検証可能な世界知識(事実性)のどちらかに矛盾する結果である幻覚
textscINFACTは、4つのモードでモデルを評価する。
14の代表的なビデオ-LLMの実験では、高ベースモード精度が誘導モードの信頼性に確実に変換されないことが明らかになった。
論文 参考訳(メタデータ) (2026-03-12T03:03:16Z) - VideoVeritas: AI-Generated Video Detection via Perception Pretext Reinforcement Learning [42.22791607763693]
VideoVeritasは、きめ細かい認識と事実に基づく推論のためのフレームワークだ。
共同知覚選好と知覚Pretext Reinforcement Learningが使用される。
論文 参考訳(メタデータ) (2026-02-09T16:00:01Z) - EchoBench: Benchmarking Sycophancy in Medical Large Vision-Language Models [82.43729208063468]
医療用LVLM(Large Vision-Language Models)の最近のベンチマークでは、信頼性と安全性を見越して、リーダボードの精度を強調している。
ユーザが提供した情報を非批判的に反響させる傾向のモデルについて検討する。
医療用LVLMの梅毒を系統的に評価するベンチマークであるEchoBenchを紹介する。
論文 参考訳(メタデータ) (2025-09-24T14:09:55Z) - Watch, Listen, Understand, Mislead: Tri-modal Adversarial Attacks on Short Videos for Content Appropriateness Evaluation [1.0012740151280692]
本稿では,マルチモーダル大言語モデル(MLLM)の3次元安全性を評価するためのフレームワークを提案する。
本稿では,ヒト誘導型合成対向攻撃を用いたショートビデオ・マルチモーダル対向データセットを提案する。
最先端MLLMの大規模な実験により、攻撃成功率(ASR)の高い重大な脆弱性が明らかになった。
論文 参考訳(メタデータ) (2025-07-16T07:02:15Z) - Video-SafetyBench: A Benchmark for Safety Evaluation of Video LVLMs [45.265397990158846]
Video-SafetyBenchは、ビデオテキスト攻撃下でのLVLMの安全性を評価するために設計された最初のベンチマークである。
ビデオテキストのペアは2,264で、48のきめ細かいアンセーフなカテゴリにまたがっている。
安全性評価のためのセマンティックなビデオを生成するために,ビデオ意味論を主題画像とモーションテキストに分解する制御可能なパイプラインを設計する。
論文 参考訳(メタデータ) (2025-05-17T05:06:38Z) - Video SimpleQA: Towards Factuality Evaluation in Large Video Language Models [77.96693360763925]
Video SimpleQAは、ビデオコンテキストにおける事実性評価に適した最初の包括的なベンチマークである。
我々の研究は、既存のビデオベンチマークとは以下の重要な特徴によって異なる: 知識: ビデオの明示的な物語を超えた外部知識の統合を要求する。
短い形式の決定的な答え: 回答は、最小のスコアリング分散を持つ短いフォーマットで、曖昧で決定的に正しいものとして作成されます。
論文 参考訳(メタデータ) (2025-03-24T17:46:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。