論文の概要: The Sound of Absence: Audio-Language Embedding Models Struggle with Negation
- arxiv url: http://arxiv.org/abs/2607.12290v1
- Date: Tue, 14 Jul 2026 02:55:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:30.016941
- Title: The Sound of Absence: Audio-Language Embedding Models Struggle with Negation
- Title(参考訳): 無音の音:否定を伴うオーディオ言語埋め込みモデル
- Abstract要約: 埋め込みモデルは、否定された音のコンセプトを符号化できないことを示す。
データセットを2つの否定対応タスクに変換するフレームワークであるNegEval-Audioを紹介した。
- 参考スコア(独自算出の注目度): 58.04745279785462
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Audio-language embedding models such as CLAP are widely evaluated on matching present sound events, but rarely on negation. We show this affirmation-only evaluation hides a key limitation: these models fail to encode negated sound concepts, mapping affirmative and negated captions to nearly identical representations. To expose this blind spot, we introduce NegEval-Audio, a framework that converts existing datasets into two negation-aware tasks, Retrieval-Neg and Multiple-Choice Negation (MCQ-Neg), to probe whether models distinguish present from absent events. On AudioCaps and Clotho, performance degrades sharply under negation, with negation-type MCQ accuracy falling far below chance, and the failure persists even for a recent multimodal LLM-based embedding model. While a training-free steering method improves MCQ-Neg, it yields marginal gains for Retrieval-Neg. This indicates that affirmation bias is a fundamental flaw in the representation geometry, necessitating explicit negation-aware training objectives.
- Abstract(参考訳): CLAPのような音声-言語埋め込みモデルは、一致した音のイベントでは広く評価されているが、否定では稀である。
これらのモデルは、否定音の概念を符号化せず、肯定音と否定音のキャプションをほぼ同一の表現にマッピングする。
この盲点を公開するために、既存のデータセットを2つの否定対応タスクであるRetrieval-NegとMultiple-Choice Negation(MCQ-Neg)に変換するフレームワークであるNegEval-Audioを紹介し、モデルが欠落したイベントと区別するかどうかを調査する。
AudioCaps と Clotho では、否定型 MCQ の精度ははるかに低い確率で低下し、最近のマルチモーダル LLM ベースの埋め込みモデルでも失敗は持続する。
トレーニングフリーのステアリング法はMCQ-Negを改善するが、Retrieval-Negには限界利得が得られる。
このことは、肯定バイアスが表現幾何学の根本的な欠陥であり、明示的な否定を意識した訓練目標を必要とすることを示している。
関連論文リスト
- When Negation Is a Geometry Problem in Vision-Language Models [32.51815690470519]
CLIPのような統合ビジョン-言語埋め込みモデルは、通常、テキストクエリで否定を理解するのに失敗する。
画像コンテンツに関する単純なイエス/ノー質問の理解に優れるマルチモーダルLLMs-as-a-judgeに基づく代替評価フレームワークについて検討する。
論文 参考訳(メタデータ) (2026-03-20T23:06:23Z) - Mastering Negation: Boosting Grounding Models via Grouped Opposition-Based Learning [87.15765427638195]
D-Negationは、ポジティブな意味記述とネガティブな意味記述の両方で注釈付けされたオブジェクトを提供する新しいデータセットである。
本稿では,限られたサンプルから否定認識表現を学習する,反抗型学習フレームワークを提案する。
モデルパラメータの10%未満を微調整することにより、正および負のセマンティック評価において最大4.4mAPおよび5.7mAPの改善が達成される。
論文 参考訳(メタデータ) (2026-03-13T03:21:48Z) - Towards Effective Negation Modeling in Joint Audio-Text Models for Music [3.7723788828505125]
共同音声テキストモデルは否定のような意味的な現象と競合する。
テキスト拡張による否定と異種性に基づくコントラスト損失を導入する。
本稿では,検索および二項分類タスクとして,否定モデリングをフレーム化する2つのプロトコルを提案する。
論文 参考訳(メタデータ) (2026-01-20T13:06:48Z) - Negation-Aware Test-Time Adaptation for Vision-Language Models [26.043679706381646]
視覚言語モデル(VLM)における実用的だが触覚の少ない問題について検討する。
多くの現実世界のアプリケーションは、偽物や存在しないものを明確に識別するためにモデルを必要とする。
本研究では,推論中の分布関連パラメータを効率的に調整するNegation-Aware Test-Time Adaptation (NEAT)法を提案する。
論文 参考訳(メタデータ) (2025-07-25T08:25:48Z) - Vision-Language Models Do Not Understand Negation [50.27667000027403]
NegBenchは18のタスクバリエーションと79ドルのサンプルに対する否定的理解を評価するために設計されたベンチマークである。
提案手法は, 否定的クエリに対するリコールが10%増加し, 否定的キャプションを用いた複数質問に対する精度が28%向上することを示す。
論文 参考訳(メタデータ) (2025-01-16T09:55:42Z) - Revisiting subword tokenization: A case study on affixal negation in large language models [57.75279238091522]
現代英語大言語モデル(LLM)に対する接尾辞否定の影響を計測する。
我々は、異なるサブワードトークン化手法を用いてLLMを用いて実験を行う。
モデルは全体として、接尾辞の意味を確実に認識できることを示す。
論文 参考訳(メタデータ) (2024-04-03T03:14:27Z) - HyPoradise: An Open Baseline for Generative Speech Recognition with
Large Language Models [81.56455625624041]
ASRの誤り訂正に外部の大規模言語モデル(LLM)を利用する最初のオープンソースベンチマークを導入する。
提案したベンチマークには、334,000組以上のN-best仮説を含む新しいデータセットHyPoradise (HP)が含まれている。
合理的なプロンプトと生成能力を持つLLMは、N-bestリストに欠けているトークンを修正できる。
論文 参考訳(メタデータ) (2023-09-27T14:44:10Z) - Language models are not naysayers: An analysis of language models on
negation benchmarks [58.32362243122714]
我々は,次世代自動回帰言語モデルによる否定処理能力の評価を行った。
LLMには,否定の存在に対する感受性,否定の語彙的意味を捉える能力の欠如,否定下での推論の失敗など,いくつかの制限があることが示されている。
論文 参考訳(メタデータ) (2023-06-14T01:16:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。