論文の概要: Prosody-driven Jailbreaks in Audio LLMs: A Controlled Study and Mechanistic Analysis
- arxiv url: http://arxiv.org/abs/2607.26541v1
- Date: Wed, 29 Jul 2026 07:12:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.564204
- Title: Prosody-driven Jailbreaks in Audio LLMs: A Controlled Study and Mechanistic Analysis
- Title(参考訳): オーディオLLMにおける韻律駆動ジェイルブレイク : 制御された研究と力学解析
- Authors: Jiachen Qian, Junyu Li,
- Abstract要約: 音声配信におけるテキストの一致変化から, 脱獄能力がどの程度生じるかを検討する。
PJ-Breakは, 覚醒, 権威, 発話率を目標とした, 予め設定したブラックボックス評価プロトコルである。
全体として、一致したテキストによる音声の配信は、オーディオLLMの安全性評価において第一級の要素として扱われるべきである。
- 参考スコア(独自算出の注目度): 2.490194241610381
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Audio-capable foundation models enable end-to-end spoken interaction, but they also introduce safety risks beyond transcript content. It remains unclear how much jailbreak capability can arise from matched-text variation in speech delivery rather than from lexical rewriting or broader style transfer. We study this question by holding transcript content fixed and varying six speech-delivery presets whose acoustic attributes may co-vary. We present PJ-Break, a black-box evaluation protocol with presets targeting arousal, authority, and speaking rate, together with AdvAudio-Prosody, a 600-sample benchmark with acoustically verified attributes. On the exact post-QC Qwen2-Audio panel, the Q=1 Panic (38/95), Anger (35/95), and Fast (32/95) presets are all well above Neutral (4/95). The fixed six-query pool covers 44/95 Qwen2-Audio seeds and 15/95 GPT-4o seeds and exceeds a matched-budget StyleBreak reimplementation (27/95) on Qwen2-Audio. A same-voice pool excluding the confounded Commanding condition still reaches 40/95, and a retained-panel ablation shows emotional-delivery audio alone (44/95) is far more effective than emotional text alone (11/95). Exploratory surrogate diagnostics and pilot mitigation observations are secondary, non-core analyses. Overall, matched-text speech delivery should be treated as a first-class factor in Audio LLM safety evaluation
- Abstract(参考訳): オーディオ対応基盤モデルは、エンドツーエンドの音声対話を可能にするが、書き起こしコンテンツ以外の安全性リスクも導入する。
語彙の書き直しやより広いスタイルの転送よりも、音声配信におけるテキストの一致した変化によってジェイルブレイク能力がどの程度生じるかは、まだ不明である。
音響特性が共変する可能性のある6つの音声配信プリセットを固定・可変して書き起こし内容を保持することにより,本課題を考察する。
我々は,600サンプルの属性を音響的に検証したベンチマークであるAdvAudio-Prosodyとともに,覚醒,権威,発話率を目標としたブラックボックス評価プロトコルであるPJ-Breakを提案する。
QC後のQwen2-Audioパネルでは、Q=1 パニック(38/95)、アンガー(35/95)、ファスト(32/95)のプリセットがニュートラル(4/95)よりかなり高い。
固定6クエリプールは、44/95 Qwen2-Audioシードと15/95 GPT-4oシードをカバーし、Qwen2-Audio上の整合型Break再実装(27/95)を超える。
設定された指令条件を除く同声プールは、まだ40/95に達しており、保持パネルアブレーションは、感情配信音声単独(44/95)が感情テキスト単独(11/95)よりもはるかに効果的であることを示している。
探索的代理診断とパイロット緩和観測は、二次的、非中核分析である。
音声LLMの安全性評価における第1級因子として、一致文による音声配信を考慮すべきである
関連論文リスト
- Unified Audio Intelligence Without Regressing on Text Intelligence [86.55418188552768]
我々は,統一音声テキストLLMであるNemotron-Labs-Audex-30B-A3B(Audex)を紹介する。
Audexは単一のTransformerデコーダで単純な統一設計を採用する。
Audexは最先端の音声理解、音声認識と翻訳、テキスト音声合成、音声生成、音声音声生成を提供する。
論文 参考訳(メタデータ) (2026-07-06T15:11:57Z) - Beyond Text Following: Repairable Arbitration Reversals in Audio-Language Models [34.99721206808916]
音声モデルはしばしば、音声証拠が明確であっても、音声と矛盾するテキストに従う。
Gated Audio Counterfactual Logit Correction (GACL)を提案する。
厳格な5ppの忠実度ドロップの予算の下で、GACLは最高のコントラストベースラインよりも17.8ポイントのnAUCを改善している。
論文 参考訳(メタデータ) (2026-06-03T17:57:51Z) - From Text to Voice: A Reproducible and Verifiable Framework for Evaluating Tool Calling LLM Agents [8.902317289902514]
検証されたテキストのベンチマークを、制御された音声ベースのツールコール評価に変換できるかどうかを検討する。
我々のデータセットに依存しないフレームワークは、テキスト音声、話者変動、環境騒音を利用してペア化されたテキストオーディオインスタンスを作成する。
論文 参考訳(メタデータ) (2026-05-14T17:22:42Z) - When Audio-LLMs Don't Listen: A Cross-Linguistic Study of Modality Arbitration [1.5567685129899713]
音声とテキストが衝突する場合、音声対応言語モデルは2つのテキストソース間の調停の10倍の頻度でテキストに従う。
応答前に書き起こしを強制すると、テキストの優位性(19%から33%)が増加し、アクセシビリティを向上させることなく、音声の利点を犠牲にする。
最先端の4つのオーディオ-LLMと8言語にわたる実験は、言語間およびクロスモデルの変化と一貫した傾向を示している。
論文 参考訳(メタデータ) (2026-02-12T02:15:30Z) - Synthetic Voices, Real Threats: Evaluating Large Text-to-Speech Models in Generating Harmful Audio [63.18443674004945]
この研究は、TSシステムを利用して有害なコンテンツを含む音声を生成する、コンテンツ中心の脅威を探究する。
HARMGENは、これらの課題に対処する2つのファミリーにまとめられた5つの攻撃群である。
論文 参考訳(メタデータ) (2025-11-14T03:00:04Z) - AudioTrust: Benchmarking the Multifaceted Trustworthiness of Audio Large Language Models [125.44235244336623]
オーディオ大言語モデル(ALLMs)は広く採用されているが、信頼性は未定である。
音色,アクセント,背景雑音などの非意味的音響的手がかりから生じるALMの有意な信頼性リスクを同定した。
本稿では,AudioTrustを提案する。
論文 参考訳(メタデータ) (2025-05-22T04:27:46Z) - Audio Is the Achilles' Heel: Red Teaming Audio Large Multimodal Models [50.89022445197919]
我々は、オープンソースのオーディオLMMが有害な音声質問に対して平均69.14%の攻撃成功率を被っていることを示す。
Gemini-1.5-Proの音声固有のジェイルブレイクは、有害なクエリベンチマークで70.67%の攻撃成功率を達成した。
論文 参考訳(メタデータ) (2024-10-31T12:11:17Z) - AIR-Bench: Benchmarking Large Audio-Language Models via Generative Comprehension [95.8442896569132]
AIR-Benchは,Large Audio-Language Models (LALM) の様々な種類の音声信号を理解し,テキスト形式で人間と対話する能力を評価する最初のベンチマークである。
その結果, GPT-4による評価と人間による評価との間には高い一貫性が認められた。
論文 参考訳(メタデータ) (2024-02-12T15:41:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。