論文の概要: ProSarc: Prosody-Aware Sarcasm Recognition Framework via Temporal Prosodic Incongruity
- arxiv url: http://arxiv.org/abs/2606.06168v1
- Date: Thu, 04 Jun 2026 13:40:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-05 22:39:44.827378
- Title: ProSarc: Prosody-Aware Sarcasm Recognition Framework via Temporal Prosodic Incongruity
- Title(参考訳): ProSarc: 時間的韻律による韻律認識フレームワーク
- Authors: Prathamjyot Singh, Ashima Sood, Sahil Sharma, Jasmeet Singh,
- Abstract要約: ProSarcは、サルカズムを検出するオーディオのみのフレームワークである。
本稿では,時間的韻律的不整合をモデル化してサルカズムを検出する,音声のみのフレームワークProSarcを提案する。
- 参考スコア(独自算出の注目度): 2.8137846893317704
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We present ProSarc, an audio-only framework that detects sarcasm by modelling temporal prosodic incongruity, that is, the mismatch between local prosodic dynamics and the utterance-level emotional baseline. Dual encoding paths, a Global Emotion Encoder and a Temporal Prosody Encoder (BiLSTM + multi-head attention), feed a Prosodic Incongruity Analyzer that produces a scalar incongruity score for classification. Monte Carlo dropout provides uncertainty estimates, and an attention-based mechanism localises sarcastic onset without frame-level labels. ProSarc outperforms prior audio-only methods on MUStARD++ (F1=75.3) and generalises to spontaneous (PodSarc, F1=62.9) and cross-lingual speech (MuSaG, F1=65.6). Ten-run validation confirms the contribution of incongruity modelling (Wilcoxon p=0.002, Cohen's d=1.51). Human evaluation shows that model uncertainty tracks perceptual ambiguity and predicted onsets align with human-annotated temporal windows.
- Abstract(参考訳): 本稿では,時間的韻律的不一致,すなわち局所韻律力学と発話レベルの感情ベースラインとのミスマッチをモデル化することにより,サルカズムを検出する,音声のみのフレームワークProSarcを提案する。
デュアルエンコーディングパス、グローバル感情エンコーダ、テンポラル・プロソディ・エンコーダ(BiLSTM + multi-head attention)は、分類のためのスカラー不整合スコアを生成する韻律インコングルリティ・アナライザーを提供する。
モンテカルロのドロップアウトは不確実性の推定を提供し、アテンションに基づくメカニズムはフレームレベルラベルなしでサーカシックなオンセットをローカライズする。
ProSarc は MUStARD++ (F1=75.3) の以前の音声のみの手法より優れており、自然発生(PodSarc, F1=62.9)と言語間音声(MuSaG, F1=65.6)に一般化している。
テンラン検証は不連続モデリングの寄与を確認する(Wilcoxon p=0.002, Cohen's d=1.51)。
人間による評価では、モデル不確実性は知覚的あいまいさをトラックし、予測されたオンセットが人間の注釈付き時間窓と一致していることが示されている。
関連論文リスト
- STEAR: Layer-Aware Spatiotemporal Evidence Intervention for Hallucination Mitigation in Video Large Language Models [14.848157882117613]
大型ビデオ言語モデル (Video-LLMs) は幻覚を起こす傾向があり、しばしば視覚的にサポートされない時間的関係や誤った時間的関係を生じる。
リスクの高いデコードステップを識別し,中間層からトークン条件の視覚的エビデンスを選択するSTEARを提案する。
実験により、STEARは時間的一貫性、忠実性、堅牢性を改善しながら、幻覚を一貫して減少させることが示された。
論文 参考訳(メタデータ) (2026-04-03T13:52:57Z) - SCALE: Semantic- and Confidence-Aware Conditional Variational Autoencoder for Zero-shot Skeleton-based Action Recognition [4.853241666510524]
ゼロショットスケルトンに基づくアクション認識(ZSAR)は、これらのクラスからのトレーニングスケルトンなしでアクションクラスを認識することを目的としている。
本稿では,ZSARをクラス条件エネルギーランキングとして定式化する,軽量で決定論的セマンティックなセマンティック・アンド・信頼を意識したエネルギーベースフレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-02T16:12:42Z) - WISTERIA: Weak Implicit Signal-based Temporal Relation Extraction with Attention [0.0]
時間関係抽出(TRE)では、時間内の2つの事象や時間的表現がどのように関連しているかを特定する必要がある。
本稿では,各イベントペアに設定されたトップKアテンションコンポーネントが,時間的分類の解釈可能な証拠を真にエンコードするかどうかを調べるフレームワークであるWISTERIAを提案する。
TimeBank-Dense、MATRES、TDDMan、TDDAutoにおいて、トップKトークンの言語分析を含む広範な実験を行います。
論文 参考訳(メタデータ) (2026-03-24T15:20:54Z) - Sycophantic Anchors: Localizing and Quantifying User Agreement in Reasoning Models [0.0]
推論モデルは間違ったユーザ提案によく一致する。
Emphsycophantic anchors -- モデルをユーザ合意に因果的にロックする文を導入します。
アンカーを確実に検出・定量化できることを示す。
論文 参考訳(メタデータ) (2026-01-29T02:34:16Z) - WESR: Scaling and Evaluating Word-level Event-Speech Recognition [59.21814194620928]
音声は言語情報だけでなく、笑ったり泣いたりするような豊富な非言語的な音声イベントも伝達する。
我々は,21の発声イベントの分類を改良し,個別(スタンドアローン)と連続(音声と混合)に分類した。
改良された分類法に基づくWESR-Benchは,新しい位置認識プロトコルを備えた専門家アノテート評価セット(900以上の発話)である。
論文 参考訳(メタデータ) (2026-01-08T02:23:21Z) - Hallucination Benchmark for Speech Foundation Models [33.92968426403491]
自動音声認識(ASR)システムにおける幻覚とは、基礎となる音響入力(すなわち、音声信号)とは全く無関係な神経性ASRモデルによって生成される流動的でコヒーレントな転写を指す。
この明らかな一貫性は、その後の処理段階を誤解させ、特に医療や法のような重要な領域において重大なリスクをもたらす可能性がある。
本稿では,ASRにおける幻覚現象を,語彙,音声,形態,意味の4つの相補軸に沿って体系的に分類し,定量化する最初のベンチマークフレームワークであるSHALLOWを紹介する。
論文 参考訳(メタデータ) (2025-10-18T16:26:16Z) - Not in Sync: Unveiling Temporal Bias in Audio Chat Models [59.146710538620816]
大規模音声言語モデル(LALM)は、音声理解やマルチモーダル推論にますます応用されている。
LALMにおける時間バイアスに関する最初の体系的研究を行い,その時間スタンプ予測における重要な限界を明らかにした。
論文 参考訳(メタデータ) (2025-10-14T06:29:40Z) - Certainly Uncertain: A Benchmark and Metric for Multimodal Epistemic and Aleatoric Awareness [106.52630978891054]
視覚言語AIシステムに特有の不確実性の分類法を提案する。
また、精度と校正誤差の両方によく相関する新しい計量信頼度重み付き精度を導入する。
論文 参考訳(メタデータ) (2024-07-02T04:23:54Z) - Prototype-based Aleatoric Uncertainty Quantification for Cross-modal
Retrieval [139.21955930418815]
クロスモーダル検索手法は、共通表現空間を共同学習することにより、視覚と言語モダリティの類似性関係を構築する。
しかし、この予測は、低品質なデータ、例えば、腐敗した画像、速いペースの動画、詳細でないテキストによって引き起こされるアレタリック不確実性のために、しばしば信頼性が低い。
本稿では, 原型に基づくAleatoric Uncertainity Quantification (PAU) フレームワークを提案する。
論文 参考訳(メタデータ) (2023-09-29T09:41:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。