論文の概要: AOR-Bench: Do Large Audio Language Models Over-Refuse Pseudo-Harmful Queries?
- arxiv url: http://arxiv.org/abs/2606.21147v1
- Date: Fri, 19 Jun 2026 06:37:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 07:59:28.52373
- Title: AOR-Bench: Do Large Audio Language Models Over-Refuse Pseudo-Harmful Queries?
- Title(参考訳): AOR-Bench: 大規模なオーディオ言語モデルは擬似有害なクエリを再利用するのか?
- Abstract要約: LALM(Large Audio Language Models)は、幅広いオーディオタスクにおいて強力なパフォーマンスを示す。
refusalメカニズムは、モデルが誤って良性クエリを拒否するEm over-refusalにつながる可能性がある。
AOR-BenchはLALM向けに特別に設計されたオーバーリフレクションのための最初のベンチマークである。
- 参考スコア(独自算出の注目度): 15.494511369878042
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large Audio Language Models (LALMs) have demonstrated strong performance across a wide range of audio tasks. As they are increasingly deployed in real-world applications, ensuring their safety alignment has become more important. Although refusal mechanisms serve as a key safeguard by preventing LALMs from responding to harmful requests, they can also lead to {\em over-refusal}, where models incorrectly reject benign queries. This issue is especially challenging in the audio domain because speech that appears harmful in isolation may become benign when interpreted together with the surrounding acoustic context, such as background sounds. To study this problem, we introduce \textbf{AOR-Bench} (\textbf{A}udio \textbf{O}ver-\textbf{R}efusal \textbf{Bench}mark), the first benchmark for over-refusal specifically designed for LALMs. AOR-Bench contains 3,000 pseudo-harmful audio samples across six scenario categories. Evaluating 12 representative LALMs from six major model families, we find that over-refusal is widespread (Figure~\ref{fig:overall_performance}) and uncover several important patterns in their safety judgments. As a preliminary effort to mitigate this issue, we further explore two lightweight strategies (e.g., Chain-of-Thought and activation steering) to reduce over-refusal.
- Abstract(参考訳): LALM(Large Audio Language Models)は、幅広いオーディオタスクにおいて強力なパフォーマンスを示す。
現実世界のアプリケーションにますますデプロイされるにつれて、安全性の確保がますます重要になっている。
リファイン機構は、LALMが有害な要求に応答することを防ぐことでキーセーフガードとして機能するが、モデルが誤って良質なクエリを拒否する {\em over-refusal} につながることもある。
この問題は音声領域では特に困難であり、背景音などの周囲の音環境と解釈すると、孤立して有害な音声が良性になる可能性がある。
この問題を解決するために、LALM向けに特別に設計されたオーバーリファリングのための最初のベンチマークである \textbf{AOR-Bench} (\textbf{A}udio \textbf{O}ver-\textbf{R}efusal \textbf{Bench}mark) を導入する。
AOR-Benchには、6つのシナリオカテゴリにわたる3000の擬似調和オーディオサンプルが含まれている。
6大モデルファミリーから12のLALMを評価したところ、オーバーリフレルが広範に存在し(図)、安全性判断におけるいくつかの重要なパターンが明らかにされている。
この問題を軽減するための予備的な取り組みとして、過剰な拒絶を減らすための2つの軽量戦略(例えば、Chain-of-ThoughtとActivation steering)について検討する。
関連論文リスト
- Hijacking Large Audio-Language Models via Context-Agnostic and Imperceptible Auditory Prompt Injection [22.306688903148046]
大規模な音声言語モデル(LALM)は、音声とテキストを密に統合することでインテリジェントな音声インタラクションをパワーアップする。
textitAudioHijackは,ハイジャックLALMに対して,文脈に依存しない,知覚不能な音声を生成するフレームワークである。
13種類のLALM実験では、6つのカテゴリーで一貫したハイジャックが行われた。
論文 参考訳(メタデータ) (2026-04-16T04:22:11Z) - Learning to Extract Context for Context-Aware LLM Inference [60.376872353918394]
大型言語モデル(LLM)へのユーザープロンプトは曖昧か不明確であることが多い。
ユーザの意図、事前知識、リスク要因によって形成されるコンテキスト的手がかりは、適切な応答を構成するものに影響を与える。
本稿では,ユーザプロンプト自体からコンテキスト情報を抽出し,活用するフレームワークを提案する。
論文 参考訳(メタデータ) (2025-12-12T19:10:08Z) - SARSteer: Safeguarding Large Audio Language Models via Safe-Ablated Refusal Steering [22.462892823842115]
音声入力は、テキストよりも有害な応答を容易に引き出すことができる。
LALMの最初の推論時防衛フレームワークである Safe-Ablated Refusal Steering (SARSteer) を提案する。
論文 参考訳(メタデータ) (2025-10-20T15:14:25Z) - Two Heads Are Better Than One: Audio-Visual Speech Error Correction with Dual Hypotheses [71.34350093068473]
本稿では,音声視覚音声認識(AVSR)における生成誤り訂正(GER)フレームワークの新たなパラダイムを提案する。
我々のフレームワークであるDualHypは、独立した自動音声認識(ASR)モデルと視覚音声認識(VSR)モデルから独立したN-best仮説を構成するために、大規模言語モデル(LLM)を強制する。
我々のフレームワークは、標準のASRベースラインよりもLRS2ベンチマークで57.7%のエラー率を獲得していますが、シングルストリームのGERアプローチでは10%のゲインしか達成できません。
論文 参考訳(メタデータ) (2025-10-15T08:27:16Z) - Investigating Faithfulness in Large Audio Language Models [22.917844547310626]
忠実さは、チェーンオブ思想表現がモデルの決定過程を正確に反映しているかどうかを測り、信頼性のある説明として使用することができる。
本稿では,複数のLALMが生成するCoTの忠実度を,対象とする介入を適用して検討する。
上記のいくつかのデータセットやタスクにわたる介入を経た上で、私たちの実験は、LALMが一般的に、根底にある意思決定プロセスに忠実であるように見えるCoTを生成することを示唆しています。
論文 参考訳(メタデータ) (2025-09-26T13:58:22Z) - Pay More Attention To Audio: Mitigating Imbalance of Cross-Modal Attention in Large Audio Language Models [60.857389526958485]
MATAはLALMを動的にプッシュして、自己保持機構内で textbfMore textbfAttention textbfTo textbfAudioトークンを支払います。
MMAUとMMARベンチマークの実験により、MATAの有効性が確認され、一貫した性能が向上した。
論文 参考訳(メタデータ) (2025-09-23T09:02:15Z) - Retrieval-Augmented Generation with Conflicting Evidence [57.66282463340297]
大規模言語モデル (LLM) エージェントは、応答の事実性を改善するために、検索強化世代 (RAG) をますます採用している。
実際には、これらのシステムは曖昧なユーザクエリを処理し、複数のソースからの情報に衝突する可能性がある。
RAMDocs(Retrieval with Ambiguity and Misinformation in Documents)は,ユーザクエリのエビデンスを矛盾させるような,複雑で現実的なシナリオをシミュレートする新しいデータセットである。
論文 参考訳(メタデータ) (2025-04-17T16:46:11Z) - Audio Is the Achilles' Heel: Red Teaming Audio Large Multimodal Models [50.89022445197919]
我々は、オープンソースのオーディオLMMが有害な音声質問に対して平均69.14%の攻撃成功率を被っていることを示す。
Gemini-1.5-Proの音声固有のジェイルブレイクは、有害なクエリベンチマークで70.67%の攻撃成功率を達成した。
論文 参考訳(メタデータ) (2024-10-31T12:11:17Z) - Pandora's Box or Aladdin's Lamp: A Comprehensive Analysis Revealing the Role of RAG Noise in Large Language Models [25.044751882839886]
大規模言語モデル(LLM)における幻覚に対処するための重要な手法として、検索型拡張生成(RAG)が登場している。
本稿では,言語的観点から7つの異なるノイズタイプを定義し,ノイズRAGベンチマーク(NoiserBench)を確立する。
我々の分析は、より堅牢で適応可能なRAGソリューションを開発し、多様な検索シナリオにまたがる幻覚を緩和するための洞察を提供する。
論文 参考訳(メタデータ) (2024-08-24T09:23:01Z) - OR-Bench: An Over-Refusal Benchmark for Large Language Models [65.34666117785179]
大きな言語モデル(LLM)は、悪意のある出力を防ぐために慎重に安全アライメントを必要とする。
本研究では,大規模なオーバーリファレンスデータセットの自動生成手法を提案する。
OR-Benchは,最初の大規模オーバーリファレンスベンチマークである。
論文 参考訳(メタデータ) (2024-05-31T15:44:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。