論文の概要: When Text Misleads: Inconsistent-Aware Reasoning for Audio-Grounded Dialogue
- arxiv url: http://arxiv.org/abs/2608.27176v1
- Date: Thu, 27 Aug 2026 14:26:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 16:30:58.446184
- Title: When Text Misleads: Inconsistent-Aware Reasoning for Audio-Grounded Dialogue
- Title(参考訳): テキストの誤り:音声対話における不整合認識推論
- Authors: Yen-Ju Lu, Yuzhe Wang, Yaohan Guan, Xiluo He, Jiarui Hai, Mingrui Liang, Kaavya Chaparala, Thomas Thebaud, Laureano Moro-Velazquez, Najim Dehak, Jesus Villalba,
- Abstract要約: 我々は障害モードをクロスモーダルな不一致として定式化する。
テキストバイアスによる表面解釈を識別し、不一致領域を競合QAの例に変換するスケーラブルなフレームワークを開発する。
さらに、音声を音声に変換するエージェントスタイルの推論フレームワークを開発し、局所的な音響的手がかりのテキスト可読表現であるAudio Twinを提案する。
- 参考スコア(独自算出の注目度): 18.262137202372454
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Understanding spoken dialogue requires joint reasoning over lexical content and paralinguistic acoustic signals such as emotion and conversational intent. However, existing evaluations often allow shortcuts based on transcripts or single-modality solutions, obscuring whether models genuinely ground predictions in speech. We formalize this failure mode as cross-modal disagreement, where transcripts suggest plausible but incorrect surface interpretations while acoustic cues such as prosody or speaking style support different answers. We develop a scalable framework that identifies text-biased surface interpretations and converts disagreement regions into conflict QA examples. We also include consistent cases where transcript-based and speech-grounded interpretations agree, enabling evaluation beyond adversarial audio dependence. This results in ContraTalk, a controlled benchmark containing 501 questions across five discourse dimensions: interaction behavior, emotion state, dialogue act, social stance, and conversational intent. We further develop an agentic-style reasoning framework that converts speech into an Audio Twin, a text-readable representation of localized acoustic cues that exposes acoustic evidence to the reasoning model. Experiments show that strong text-only LLMs exceed 90% accuracy in consistent cases but drop to 33-48% in conflict cases. Direct AudioLLMs provide only partial grounding, still selecting the transcript-biased trap in roughly 30-40% of conflict cases. Our Audio Twin framework improves conflict-case accuracy while reducing trap selection, but its consistent-case behavior remains backbone-dependent. These results identify transcript-based shortcuts as an important failure mode in spoken dialogue understanding and show that explicit acoustic evidence aggregation provides a more controllable interface for diagnosing and improving speech-grounded reasoning.
- Abstract(参考訳): 音声対話を理解するには、語彙内容に対する共同推論と、感情や会話意図といったパラ言語的な音響信号が必要である。
しかし、既存の評価では、モデルが真に音声の予測を下降させるかどうかを無視して、書き起こしや単一モダリティの解に基づくショートカットを許可することが多い。
我々は,この障害モードをクロスモーダルな不一致として定式化し,音韻や発話スタイルなどの音響的手がかりが異なる答えをサポートするのに対して,書き起こしは可塑性だが誤りな表面解釈を示唆する。
テキストバイアスによる表面解釈を識別し、不一致領域を競合QAの例に変換するスケーラブルなフレームワークを開発する。
また、テキストベースの解釈と音声による解釈が一致した一貫した事例も含み、対向的音声依存以外の評価を可能にした。
ContraTalkは、対話行動、感情状態、対話行為、社会的スタンス、会話意図の5つの領域にわたる501の質問を含む制御されたベンチマークである。
さらに,音響的証拠を推論モデルに公開する局所音響手がかりのテキスト可読表現であるAudio Twinに音声を変換するエージェント型推論フレームワークを開発した。
実験の結果、強いテキストのみのLSMは一貫性のあるケースでは90%を超えるが、競合ケースでは33-48%に低下することがわかった。
Direct AudioLLMsは部分的なグラウンドのみを提供し、競合ケースの約30~40%でスクリプティングされたトラップを選択する。
われわれのAudio Twinフレームワークは、競合ケースの精度を向上し、トラップ選択を減らすが、一貫性のある動作はバックボーンに依存している。
これらの結果は, 音声対話理解において, テキストベースのショートカットを重要な障害モードとして認識し, 明瞭なアコースティックエビデンスアグリゲーションが, 音声地上推論の診断および改善のためのより制御可能なインターフェースを提供することを示す。
関連論文リスト
- Hear2Act: Benchmarking When Prosody Should Change What an Assistant Does [27.909684871924004]
本稿では,テキストと音声アシスタントの統一評価プロトコルであるHear2Actを紹介する。
我々は、転写、音声、および関心状態アクセスに基づく意思決定を評価する。
語彙的証拠が不十分な場合には韻律が重要であることを示す。
論文 参考訳(メタデータ) (2026-08-20T00:16:36Z) - From Speech to Interaction: Analyzing Multimodal Systems in Cocktail-Party Scenarios [68.14493981116665]
人間は、近くの会話から競合するスピーチをフィルタリングしながら、個々の話者に選択的に出席する能力を持つ。
この「カクテルパーティー」のシナリオは、音声認識システムに深刻な課題を呈している。
CHiME-9 MCoRecタスクは、システムが話者のグループを認識し、各会話を音声視覚入力から書き起こさなければならないテストベッドを提供する。
論文 参考訳(メタデータ) (2026-08-09T06:11:38Z) - Afrispeech Semantics: Evaluating Audio Semantic Reasoning in Spoken Language Models Across Domains and Accents [3.6734440150955368]
音声言語モデル(ALM)は、音声に基づく理解にますます使われる。
アクセント変化, ドメインシフト, セマンティックオーバー推論が音声推論に与える影響はよく分かっていない。
5つの意味的・パラ言語的推論タスクにおける音声言語モデルの評価を行った。
論文 参考訳(メタデータ) (2026-05-11T20:27:40Z) - Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought [49.53567098922619]
モーダル間干渉を低減するための音声・視覚的推論フレームワークとして, 分離ファースト, ファウズ・レイト (SFFL) を提案する。
SFFLは、モーダリティ固有の連鎖推論を強制し、別々の音声および視覚的推論トレースを生成し、答えのエビデンスを統合する。
実験では精度と頑健さの両面で一貫した改善が示され、一般的なAVQAベンチマークでは5.16%、クロスモーダル幻覚ベンチマークでは11.17%の平均的な相対的な増加が得られた。
論文 参考訳(メタデータ) (2026-05-11T02:50:27Z) - When Contextual Inference Fails: Cancelability in Interactive Instruction Following [51.2195840589474]
私たちは、コンテキスト意味構築のためのインタラクティブなベンチマークであるBuild What I Meanを紹介します。
BWIMでは、モデルは文脈推論を行うか、小さな通信コストで明確化を要求することによって曖昧さを解決しなければならない。
我々は,不確実性の下でのパートナーブラインド過度明確化や質問逆推定などの準最適戦略を観察する。
論文 参考訳(メタデータ) (2026-03-20T14:46:59Z) - Detecting Mental Manipulation in Speech via Synthetic Multi-Speaker Dialogue [12.181747090385612]
心的操作は、他者に影響を与えるか、搾取するために、言語を戦略的に利用することである。
音声対話における心的操作検出に関する最初の研究について述べる。
少数ショットの大きな音声言語モデルと人間のアノテーションを用いて、モーダリティが検出精度と知覚にどのように影響するかを評価する。
論文 参考訳(メタデータ) (2026-01-13T09:02:08Z) - Audio MultiChallenge: A Multi-Turn Evaluation of Spoken Dialogue Systems on Natural Human Interaction [12.216811577733125]
本稿では,E2E音声対話システムを評価するためのオープンソースのベンチマークであるAudio MultiChallengeを紹介する。
そこで我々は,中発音声の補聴とバックトラックに対する頑健さを検査する新軸音声編集手法を提案する。
47の話者と1,712のインスタンス固有のルーリックとの452の会話を、オーディオネイティブエージェントとヒューマンインザループパイプラインのハイブリッドを通じてキュレートする。
論文 参考訳(メタデータ) (2025-12-16T19:26:44Z) - MOSS-Speech: Towards True Speech-to-Speech Models Without Text Guidance [66.74042564585942]
MOSS-Speechは、テキストガイダンスに頼ることなく直接理解し、音声を生成する、真の音声音声合成大言語モデルである。
我々の研究は、表現的かつ効率的なエンドツーエンドの音声対話のための新しいパラダイムを確立する。
論文 参考訳(メタデータ) (2025-10-01T04:32:37Z) - SpeechR: A Benchmark for Speech Reasoning in Large Audio-Language Models [60.72029578488467]
SpeechRは、大規模な音声言語モデルにおける音声に対する推論を評価するための統一的なベンチマークである。
事実検索、手続き推論、規範的判断の3つの重要な側面に沿ったモデルを評価する。
11個の最先端のLALMの評価は、高い転写精度が強い推論能力に変換されないことを示している。
論文 参考訳(メタデータ) (2025-08-04T03:28:04Z) - Question-Interlocutor Scope Realized Graph Modeling over Key Utterances
for Dialogue Reading Comprehension [61.55950233402972]
本稿では,対話読解のためのキーワード抽出手法を提案する。
複数の連続した発話によって形成された単位に対して予測を行い、より多くの回答を含む発話を実現する。
発話のテキスト上に構築されたグラフとして,質問-対話者スコープ実現グラフ(QuISG)モデルを提案する。
論文 参考訳(メタデータ) (2022-10-26T04:00:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。