論文の概要: When Models Hear What They Expect: Diagnosing Prosodic Heuristics in Multimodal Sarcasm Detection
- arxiv url: http://arxiv.org/abs/2608.30204v1
- Date: Mon, 31 Aug 2026 03:34:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:31.211838
- Title: When Models Hear What They Expect: Diagnosing Prosodic Heuristics in Multimodal Sarcasm Detection
- Title(参考訳): モデルが何を期待するか:マルチモーダルサルカズム検出における韻律的ヒューリスティックの診断
- Abstract要約: マンダリン系中国語と英語の皮肉検出について検討した。
表現的韻律の共有ステレオタイプ,すなわち高いピッチと不規則なパジングにモデル誤差がクラスタリングされていることがわかった。
同じ操作テンプレートを変更せずにGemini3 Flash Previewに適用することは、その効果を再現し、ステレオタイプがQwen Omniファミリを超えて広がることを示唆している。
- 参考スコア(独自算出の注目度): 15.92653903841744
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal Large Language Models (MLLMs) process speech and text jointly, yet whether they exploit prosodic cues for pragmatic inference or rely on surface acoustic patterns has received little systematic investigation. We address this through sarcasm detection, evaluating Qwen2.5-Omni and Qwen3-Omni on Mandarin Chinese and English under five modality conditions that decompose the contributions of lexical content, vocal semantics, and prosodic structure. Adding audio systematically inflates false positives without improving true positive detection. Acoustic error diagnosis reveals that model errors cluster on a shared stereotype of expressive prosody, namely elevated pitch and irregular pausing, that diverges from the actual cues marking sarcasm in both languages. Targeted manipulation of only these two dimensions causally confirms the heuristic, inducing false positive rates of up to 60%. Applying the same manipulation template to Gemini~3 Flash Preview without modification replicates the effect, suggesting that the stereotype extends beyond the Qwen Omni family rather than arising from a single model architecture.
- Abstract(参考訳): MLLM(Multimodal Large Language Models)は、音声とテキストを共同で処理するが、実用的な推論のために韻律的手がかりを利用するか、表面音響パターンに依存するかは、体系的な研究はほとんど行われていない。
本研究では,マンダリン中国語と英語のQwen2.5-OmniとQwen3-Omniを,語彙内容,音声意味論,韻律構造などの寄与を分解する5つのモード条件下で評価する。
オーディオの追加は、真正の検出を改善することなく、偽陽性を体系的に膨らませる。
音響的誤り診断では, 両言語とも, 音高や不規則なパチングといった, 表現的韻律の共有ステレオタイプにモデル誤差が集結していることが判明した。
これら2つの次元のみを標的とした操作は、ヒューリスティックを慎重に確認し、最大60%の偽陽性率を誘導する。
同じ操作テンプレートを変更せずにGemini~3 Flash Previewに適用することは、その効果を再現し、ステレオタイプが単一のモデルアーキテクチャから生じるのではなく、Qwen Omniファミリを超えて広がることを示唆している。
関連論文リスト
- The Sound of Absence: Audio-Language Embedding Models Struggle with Negation [58.04745279785462]
埋め込みモデルは、否定された音のコンセプトを符号化できないことを示す。
データセットを2つの否定対応タスクに変換するフレームワークであるNegEval-Audioを紹介した。
論文 参考訳(メタデータ) (2026-07-14T02:55:00Z) - ProSarc: Prosody-Aware Sarcasm Recognition Framework via Temporal Prosodic Incongruity [2.8137846893317704]
ProSarcは、サルカズムを検出するオーディオのみのフレームワークである。
本稿では,時間的韻律的不整合をモデル化してサルカズムを検出する,音声のみのフレームワークProSarcを提案する。
論文 参考訳(メタデータ) (2026-06-04T13:40:09Z) - Do Language Models Know What Not to Say? Causal Evidence for Statistical Preemption in LLMs [13.891522069967507]
建設文法は統計的プリエンプション(英語版)を提案している: 従来の形式への露出は構造的に可能であるが、証明されていない代替手段を前提としている。
本稿では,大規模言語モデルにおいて,競合するエンレンチメント仮説から統計的プリエンプションを解離する計算手法を提案する。
論文 参考訳(メタデータ) (2026-05-21T21:06:43Z) - AffectVerse: Emotional World Models for Multimodal Affective Computing [56.144242722718985]
AffectVerseは、短時間の潜伏感情予測のためのアクションフリー表現レベルモジュールである。
EWMには3つのモジュールが含まれている。 1) クロスモーダルなテンポラル・イマジネーションは、複数ステップのロールアウトで過去のトークンから将来のビデオ/オーディオ表現を予測する。
EWMは想像されたトークンをモダリティ対応の信仰トークンに圧縮する。
これらの結果は、予測的信念状態モデリングが感情コンピューティングの実用的な代替手段であることを示唆している。
論文 参考訳(メタデータ) (2026-05-19T15:05:00Z) - Do Language Models Encode Knowledge of Linguistic Constraint Violations? [6.1335559884409685]
大規模言語モデル (LLM) は言語的性能は高いが、これらの予測を生成するための内部メカニズムはいまだに不明である。
本研究では,LLMが言語制約違反の表現をパラメータ内にエンコードし,非文法的な文を処理する際に選択的に活性化されるという仮説を考察する。
本稿では,制約違反と良好な入力に対して優先的に活性化される特徴を特定するための感度スコアを導入し,潜在的な違反固有の特徴の教師なし検出を可能にする。
論文 参考訳(メタデータ) (2026-05-12T12:37:06Z) - Investigating the Influence of Language on Sycophantic Behavior of Multilingual LLMs [1.7778609937758327]
大規模言語モデル(LLM)は、幅広いタスクで高いパフォーマンスを達成しているが、梅毒の傾向もある。
以前の研究は、ChatGPT-3.5やDavinciといった初期のモデルにおいて、梅毒の程度と根本原因の両方を概説している。
本研究は、この言語が梅毒の反応にどのように影響するかを考察する。
論文 参考訳(メタデータ) (2026-03-29T12:31:05Z) - Evaluating Hallucinations in Multimodal LLMs with Spoken Queries under Diverse Acoustic Conditions [10.361060366260729]
音声入力が大規模言語モデルにおける幻覚に与える影響について検討する。
本稿では,RePOPEベンチマークの音声拡張であるRePOPE-Spkについて述べる。
実験結果から, 文章ではなく, クエリが話されるときに, 幻覚がエスカレートすることが明らかとなった。
論文 参考訳(メタデータ) (2025-09-19T07:18:45Z) - Languages in Multilingual Speech Foundation Models Align Both Phonetically and Semantically [58.019484208091534]
事前訓練された言語モデル(LM)における言語間アライメントは、テキストベースのLMの効率的な転送を可能にしている。
テキストに基づく言語間アライメントの発見と手法が音声に適用されるかどうかについては、未解決のままである。
論文 参考訳(メタデータ) (2025-05-26T07:21:20Z) - Gumbel Counterfactual Generation From Language Models [64.55296662926919]
対実的推論が介入と概念的に異なることを示す。
そこで本研究では,真の文字列反事実を生成するためのフレームワークを提案する。
提案手法は,従来の介入手法が望ましくない副作用を有意に生み出しているのに対し,本手法は有意義な反事実を生じさせることを示す。
論文 参考訳(メタデータ) (2024-11-11T17:57:30Z) - High-Fidelity Speech Synthesis with Minimal Supervision: All Using
Diffusion Models [56.00939852727501]
最小教師付き音声合成は、2種類の離散音声表現を組み合わせることでTSを分離する。
非自己回帰フレームワークは、制御可能性を高め、持続拡散モデルは、多様化された韻律表現を可能にする。
論文 参考訳(メタデータ) (2023-09-27T09:27:03Z) - Minimally-Supervised Speech Synthesis with Conditional Diffusion Model
and Language Model: A Comparative Study of Semantic Coding [57.42429912884543]
Diff-LM-Speech, Tetra-Diff-Speech, Tri-Diff-Speechを提案する。
また,変分オートエンコーダと韻律ボトルネックに基づくプロンプトエンコーダ構造を導入し,プロンプト表現能力の向上を図る。
実験の結果,提案手法はベースライン法よりも優れていた。
論文 参考訳(メタデータ) (2023-07-28T11:20:23Z) - TranSpeech: Speech-to-Speech Translation With Bilateral Perturbation [61.564874831498145]
TranSpeechは、両側摂動を伴う音声から音声への翻訳モデルである。
我々は,非自己回帰S2ST手法を構築し,繰り返しマスキングを行い,単位選択を予測する。
TranSpeechは推論遅延を大幅に改善し、自動回帰技術よりも最大21.4倍のスピードアップを実現している。
論文 参考訳(メタデータ) (2022-05-25T06:34:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。