論文の概要: TempJail: Temporal Jailbreak Attacks against Image-to-Video Generation Models
- arxiv url: http://arxiv.org/abs/2608.26971v2
- Date: Fri, 28 Aug 2026 02:16:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-31 15:11:36.095997
- Title: TempJail: Temporal Jailbreak Attacks against Image-to-Video Generation Models
- Title(参考訳): TempJail: 画像からビデオへの生成モデルに対する一時的なジェイルブレイク攻撃
- Abstract要約: I2Vシステムにおける3つの攻撃シナリオを調査し,時間的脆弱性を明らかにする。
I2Vシステムのための新しい時間的ジェイルブレイクフレームワークであるTempJailを提案する。
実験の結果、TempJailは従来の最先端の手法よりも23.3%の攻撃成功率を向上させることが示された。
- 参考スコア(独自算出の注目度): 6.9498303374340225
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: In recent years, image-to-video (I2V) generation models have made remarkable progress in subject consistency and temporal coherence, enabling high quality video synthesis. However, these advances also introduce new safety risks. Existing studies mainly focus on jailbreak attacks involving single frame violations, while largely overlooking the temporal dimension unique to video generation models. In this paper, we investigate three attack scenarios and uncover a temporal vulnerability in I2V systems: unsafe semantics may emerge not from a single frame, but from semantic composition over time. We further identify two key challenges in such attacks: temporal abstraction and semantic camouflage. To address these issues, we propose TempJail, a novel temporal jailbreak framework for I2V systems. For temporal abstraction, we decompose a target malicious caption into an initial frame visual condition and a temporal text instruction. For semantic camouflage, on the image side we model semantic injection as controlled latent perturbation in diffusion sampling and introduce gradient guidance from pretrained encoders. On the text side, we rewrite the caption into an innocuous ``subject-action-scene'' template that bypasses safety filters while preserving temporal guidance. In the black-box inference phase, these two modalities jointly enable malicious semantics to be gradually triggered over time. Experiments on closed-source commercial models, including Kling, Seedance, Veo and PixVerse, show that TempJail improves attack success rate over prior state-of-the-art methods by 23.3\% under GPT-5.2 evaluation and 22.0\% under human evaluation. Our codes are available at \href{https://github.com/luqi-glory/TempJail}{GitHub}.
- Abstract(参考訳): 近年、画像合成(I2V)生成モデルは、被写体一貫性と時間的コヒーレンスを著しく向上させ、高品質なビデオ合成を可能にしている。
しかし、これらの進歩は新たな安全リスクももたらした。
既存の研究は、主に単一のフレーム違反を含むジェイルブレイク攻撃に焦点を当てているが、ビデオ生成モデル特有の時間次元を概ね見落としている。
本稿では,3つの攻撃シナリオを調査し,I2Vシステムにおける時間的脆弱性を明らかにする。
さらに、このような攻撃において、時間的抽象化と意味的カモフラージュという2つの重要な課題を特定します。
これらの問題に対処するため,I2Vシステムのための新しい時間的ジェイルブレイクフレームワークであるTempJailを提案する。
時間的抽象化のために、ターゲットの悪意あるキャプションを初期フレームの視覚状態と時間的テキスト命令に分解する。
セマンティックカモフラージュでは,画像側では拡散サンプリングにおける制御された潜在摂動としてセマンティックインジェクションをモデル化し,事前学習エンコーダからの勾配誘導を導入する。
テキスト側では,キャプションを<subject-action-scene'テンプレートに書き直し,時間的ガイダンスを維持しながら安全フィルタをバイパスする。
ブラックボックス推論フェーズでは、これらの2つのモダリティによって、悪質なセマンティクスが時間とともに徐々にトリガーされる。
Kling、Seedance、Veo、PixVerseといったクローズドソースの商用モデルの実験では、TempJailはGPT-5.2の評価では23.3\%、人間の評価では22.0\%の攻撃成功率を改善することが示されている。
私たちのコードは \href{https://github.com/luqi-glory/TempJail}{GitHub} で利用可能です。
関連論文リスト
- The Price of Consistency: Exploiting Visual Anchors for Multimodal Jailbreaking in Video Generation [83.99528259002504]
このメカニズムにより、生成したコンテンツが元の有害な意図から遠ざかることを防ぐことができる。
本稿では、この脆弱性を利用したビデオ生成のためのトレーニング不要なマルチモーダルジェイルブレイクフレームワークである、Visual Anchors (DIVA)によるDecoupling Intentを提案する。
今後の研究を容易にするため,マルチ条件ビデオ生成のための最初の安全ベンチマークであるTI2SafetyBenchを寄贈する。
論文 参考訳(メタデータ) (2026-09-07T08:34:00Z) - SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense [77.70598852234149]
テキスト・トゥ・ビデオ(T2V)生成モデルは、現実世界のデプロイにおいてジェイルブレイク攻撃に対して脆弱である。
安全なクロスアテンション・ローカライゼーションと正規化のための機能レベル防衛機構であるSafeCAを提案する。
実験の結果、SafeCAは主流のT2Vモデルでジェイルブレイクの成功率を約20%削減することが示された。
論文 参考訳(メタデータ) (2026-08-11T14:01:24Z) - Reading Between the Pixels: An Inscriptive Jailbreak Attack on Text-to-Image Models [31.243185346527255]
現代のテキスト・トゥ・イメージ(T2I)モデルでは、正当性のある段落長のテキストを描画できるようになった。
我々は、敵がT2Iシステムを強制して有害なテキストペイロードを含む画像を生成する、記述的ジェイルブレイクを識別し、形式化する。
敵のプロンプトを3つの機能層に分解するブラックボックス攻撃フレームワークであるEtchを提案する。
論文 参考訳(メタデータ) (2026-04-07T13:16:07Z) - Two Frames Matter: A Temporal Attack for Text-to-Video Model Jailbreaking [3.1471354211996956]
最近のテキスト・トゥ・ビデオ(T2V)モデルは、軽量な自然言語プロンプトから複雑なビデオを合成することができる。
以前のジェイルブレイク攻撃は、通常、安全でないプロンプトをコンテントフィルタを避けるパラフレーズに書き換える。
本稿では,断片化プロンプト下でのT2V系の時間軌道埋込み脆弱性を同定する。
論文 参考訳(メタデータ) (2026-03-07T04:21:54Z) - VidLeaks: Membership Inference Attacks Against Text-to-Video Models [17.443499650679964]
メンバーシップ推論攻撃(MIA)は、著作権やプライバシー侵害を監査するための原則化されたツールである。
2つの相補的な信号を通してスパース時間記憶を探索する新しいフレームワークVidLeaksを導入する。
我々の研究は、T2Vリークがスパース記憶と時間記憶の両方を通して、かなりのメンバーシップ情報をモデル化した最初の具体的な証拠を提供する。
論文 参考訳(メタデータ) (2026-01-16T11:35:52Z) - Factorized Video Generation: Decoupling Scene Construction and Temporal Synthesis in Text-to-Video Diffusion Models [76.7535001311919]
State-of-the-the-art Text-to-Video (T2V)拡散モデルは視覚的に印象的な結果を生成することができるが、複雑なシーンを作成したり、論理的時間的指示に従うのに失敗することが多い。
テキスト・ツー・ビデオ・ジェネレーションを3つの特殊ステージに分解することでこれらのタスクを分離するパイプラインであるFVGを紹介した。
提案手法は,T2V CompBench ベンチマークに新たな最先端技術を導入し,VBench2 上でのテストモデルすべてを大幅に改善する。
論文 参考訳(メタデータ) (2025-12-18T10:10:45Z) - AlcheMinT: Fine-grained Temporal Control for Multi-Reference Consistent Video Generation [58.844504598618094]
本稿では、被験者駆動ビデオ生成のための明示的なタイムスタンプ条件付きフレームワークAlcheMinTを提案する。
提案手法では,時間間隔の符号化を解き放つ新しい位置符号化機構を導入する。
我々は、視覚的アイデンティティとビデオキャプションの結合を強化するために、主観記述型テキストトークンを導入し、世代間あいまいさを緩和する。
論文 参考訳(メタデータ) (2025-12-11T18:59:34Z) - VEIL: Jailbreaking Text-to-Video Models via Visual Exploitation from Implicit Language [25.38940067963429]
テキスト・ツー・ビデオ(T2V)モデルに対する以前の攻撃は、通常、明らかに安全でないプロンプトに敵の摂動を追加する。
我々は、リッチで暗黙的な手がかりを含む良心的なプロンプトがT2Vモデルを誘導し、セマンティックなアンセーフなビデオを生成することを示した。
本稿では,モジュール型プロンプト設計により,T2Vモデルの相互関連パターンを活用するジェイルブレイクフレームワークVEILを提案する。
論文 参考訳(メタデータ) (2025-11-17T08:31:43Z) - T2V-OptJail: Discrete Prompt Optimization for Text-to-Video Jailbreak Attacks [67.91652526657599]
我々は、T2Vジェイルブレイク攻撃を離散最適化問題として定式化し、T2V-OptJailと呼ばれる共同目的ベース最適化フレームワークを提案する。
いくつかのT2Vモデルに対して大規模な実験を行い、オープンソースモデルと実際の商用クローズドソースモデルの両方をカバーする。
提案手法は,攻撃成功率の観点から既存手法よりも11.4%,10.0%向上する。
論文 参考訳(メタデータ) (2025-05-10T16:04:52Z) - T2VShield: Model-Agnostic Jailbreak Defense for Text-to-Video Models [88.63040835652902]
テキストからビデオモデルへの攻撃はジェイルブレイク攻撃に弱いため、特別な方法で安全メカニズムをバイパスし、有害または安全でないコンテンツの生成につながる。
我々は、ジェイルブレイクの脅威からテキストからビデオモデルを守るために設計された包括的でモデルに依存しない防衛フレームワークであるT2VShieldを提案する。
本手法は,既存の防御の限界を特定するために,入力,モデル,出力の段階を体系的に解析する。
論文 参考訳(メタデータ) (2025-04-22T01:18:42Z) - Layer-Level Self-Exposure and Patch: Affirmative Token Mitigation for Jailbreak Attack Defense [55.77152277982117]
私たちは、jailbreak攻撃から防御するために設計された方法であるLayer-AdvPatcherを紹介します。
私たちは、自己拡張データセットを通じて、大規模言語モデル内の特定のレイヤにパッチを適用するために、未学習の戦略を使用します。
我々の枠組みは、脱獄攻撃の有害性と攻撃の成功率を減らす。
論文 参考訳(メタデータ) (2025-01-05T19:06:03Z) - Multimodal Pragmatic Jailbreak on Text-to-image Models [42.53834190690214]
この研究は、新しいタイプのjailbreakを導入し、T2Iモデルをトリガーして、ビジュアルテキストで画像を生成する。
我々は、2つのクローズドソース商用モデルを含む9つの代表的なT2Iモデルをベンチマークする。
我々の研究は、よりセキュアで信頼性の高いT2Iモデルに向けたさらなる開発基盤を提供する。
論文 参考訳(メタデータ) (2024-09-27T21:23:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。