論文の概要: Sparse Tokens Suffice: Jailbreaking Audio Language Models via Token-Aware Gradient Optimization
- arxiv url: http://arxiv.org/abs/2605.04700v1
- Date: Wed, 06 May 2026 09:52:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-07 18:41:07.754522
- Title: Sparse Tokens Suffice: Jailbreaking Audio Language Models via Token-Aware Gradient Optimization
- Title(参考訳): Sparse Tokens Suffice:Token-Aware Gradient Optimizationによる音声モデルのジェイルブレーク
- Authors: Zheng Fang, Xiaosen Wang, Shenyi Zhang, Shaokang Wang, Zhijin Ge,
- Abstract要約: オーディオ言語モデル(ALM)に対するジェイルブレイク攻撃は、オーディオ摂動を最適化し、安全でない世代を誘導する。
ALMにおけるトークン整列勾配の構造を解析する。
token-Aware Gradient Optimization (TAGO) を提案する。
- 参考スコア(独自算出の注目度): 11.868769189066718
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Jailbreak attacks on audio language models (ALMs) optimize audio perturbations to elicit unsafe generations, and they typically update the entire waveform densely throughout optimization. In this work, we investigate the necessity of such dense optimization by analyzing the structure of token-aligned gradients in ALMs. We find that gradient energy is highly non-uniform across audio tokens, indicating that only a small subset of token-aligned audio regions dominates the optimization signal. Motivated by this observation, we propose Token-Aware Gradient Optimization (TAGO), which enables sparse jailbreak optimization by retaining only waveform gradients aligned with audio tokens that have high gradient energy, while masking the remaining gradients at each iteration. Across three ALMs, TAGO outperforms baselines, and substantial sparsification preserves strong attack success rates (e.g. on Qwen3-Omni, $\mathrm{ASR}_{l}$ remains at 86% with a token retention ratio of 0.25, compared to 87% with full token retention). These results demonstrate that dense waveform updates are largely redundant, and we advocate that future audio jailbreak and safety alignment research should further leverage this heterogeneous token-level gradient structure.
- Abstract(参考訳): オーディオ言語モデル(ALM)に対するジェイルブレイク攻撃は、オーディオの摂動を最適化し、安全でない世代を誘導する。
本研究では,ALMにおけるトークン整列勾配の構造を解析し,そのような高密度な最適化の必要性について検討する。
勾配エネルギーは、音声トークン間で非常に一様でないことが分かり、トークン整列されたオーディオ領域のごく一部だけが最適化信号を支配していることを示す。
本研究は,高勾配エネルギーの音声トークンに整合した波形勾配のみを保持するとともに,各繰り返しにおける残りの勾配を隠蔽することにより,スパースジェイルブレイク最適化を可能にするToken-Aware Gradient Optimization (TAGO)を提案する。
3つのALM全体でTAGOはベースラインを上回り、実質的なスペーシフィケーションは強力な攻撃成功率を維持する(例えば Qwen3-Omni, $\mathrm{ASR}_{l}$ はトークン保持率 0.25 であり、トークン保持率 87% に対して 86% である)。
これらの結果から,高密度波形の更新は大半が冗長であることが示され,将来のオーディオジェイルブレイクと安全アライメントの研究は,この異種トークンレベルの勾配構造をさらに活用すべきだと示唆された。
関連論文リスト
- Unlearning What Matters: Token-Level Attribution for Precise Language Model Unlearning [5.454773103061359]
TokenUnlearnはトークンレベルの属性フレームワークで、クリティカルトークンを特定し、選択的にターゲットする。
提案手法は,マスキングによる知識認識信号とエントロピー認識信号を組み合わせて,正確なトークン選択のための重要スコアを得る。
論文 参考訳(メタデータ) (2026-05-01T02:59:03Z) - Temporal Contrastive Decoding: A Training-Free Method for Large Audio-Language Models [56.91801348360746]
大規模な音声言語モデル(LALM)は、音声、音声、音楽にまたがって一般化される。
統一デコーダは 時空間のスムーズなバイアスを示します
LALMの学習自由復号法であるemphTemporal Contrastive Decoding (TCD)を提案する。
論文 参考訳(メタデータ) (2026-04-16T02:30:41Z) - EVATok: Adaptive Length Video Tokenization for Efficient Visual Autoregressive Generation [80.13014959623452]
EVATokは、$textbfE$fficient $textbfV$ideo $textbfA$daptive $textbfTok$enizersを生成するフレームワークである。
EVATok は UCF-101 上でより優れた再構成と最先端のクラス・ビデオ生成を実現する。
論文 参考訳(メタデータ) (2026-03-12T17:59:59Z) - DSA-Tokenizer: Disentangled Semantic-Acoustic Tokenization via Flow Matching-based Hierarchical Fusion [28.204167153140506]
音声トークン化器は、離散音声大言語モデルの基盤となる。
本稿では,DSA-Tokenizerを提案する。
論文 参考訳(メタデータ) (2026-01-14T07:22:24Z) - From Uniform to Heterogeneous: Tailoring Policy Optimization to Every Token's Nature [38.46122853450324]
既存のアルゴリズムは全てのトークンに一様最適化を適用し、推論プロセスにおける異なる役割を無視している。
本稿では,トークンエントロピーに基づく最適化を動的に適用するトークン認識アルゴリズムであるヘテロジニアス適応ポリシー最適化(HAPO)を紹介する。
論文 参考訳(メタデータ) (2025-09-20T09:30:25Z) - Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models [19.373533532464915]
LAMのjailbreak脆弱性を評価するために特別に設計された最初のベンチマークであるAJailBenchを紹介します。
このデータセットを使用して、いくつかの最先端のLAMを評価し、攻撃間で一貫性のある堅牢性を示すものはありません。
以上の結果から, セマンティックに保存された摂動でさえ, 先行するLAMの安全性を著しく低下させる可能性が示唆された。
論文 参考訳(メタデータ) (2025-05-21T11:47:47Z) - CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment [76.32508013503653]
CAV-MAE Sync は,自己教師型音声視覚学習のためのオリジナルの CAV-MAE フレームワークの簡易かつ効果的な拡張として提案する。
音声をグローバルな表現ではなく,映像フレームに整合した時間的シーケンスとして扱うことで,モダリティ間のミスマッチに対処する。
パッチトークンのセマンティック負荷を低減するための学習可能なレジスタトークンを導入することにより,空間的ローカライゼーションを改善する。
論文 参考訳(メタデータ) (2025-05-02T12:59:58Z) - VALL-E R: Robust and Efficient Zero-Shot Text-to-Speech Synthesis via Monotonic Alignment [101.2489492032816]
VALL-E Rは、堅牢で効率的なゼロショットテキスト音声合成システムである。
この研究は、失語症に罹患した人々のためのスピーチの作成を含む有意義なプロジェクトに適用される可能性がある。
論文 参考訳(メタデータ) (2024-06-12T04:09:44Z) - Multi-Discriminator Sobolev Defense-GAN Against Adversarial Attacks for
End-to-End Speech Systems [78.5097679815944]
本稿では,最先端音声テキストシステムのためのエンドツーエンド攻撃に対する防御手法を提案する。
まず,短時間フーリエ変換を用いた2次元スペクトルを用いた音声信号の表現を行う。
第二に、スペクトログラム部分空間射影演算を用いて安全ベクトルを反復的に発見する。
第3に,ソボレフ積分確率計量で学習した新しいganアーキテクチャを用いて,このような安全なベクトルを持つスペクトログラムを合成する。
論文 参考訳(メタデータ) (2021-03-15T01:11:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。