論文の概要: A Shaky Voice Is Not Always a Dodge: Benchmarking Textual and Vocal Evasion Detection in Earnings Calls
- arxiv url: http://arxiv.org/abs/2608.28040v1
- Date: Fri, 28 Aug 2026 07:58:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-31 17:16:04.249333
- Title: A Shaky Voice Is Not Always a Dodge: Benchmarking Textual and Vocal Evasion Detection in Earnings Calls
- Title(参考訳): 耳鳴り電話におけるテキストと音声の侵入検出のベンチマーク
- Abstract要約: DualEvasionは、収支報告のQ&Aにおいて、テキストとオーディオ間での回避検出のベンチマークである。
我々の実験は、最先端のマルチモーダルモデルが声質の信頼度を検出するのに苦労していることを示している。
話者レベルの参照を提供することで、控えめな改善がもたらされるが、人間のパフォーマンスとはかなりのギャップが残っている。
- 参考スコア(独自算出の注目度): 2.407927905799568
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Existing approaches to evasion detection in earnings calls focus on textual transcripts, treating evasion as a single-dimensional phenomenon. We argue that evasion in spoken communication is inherently multidimensional: beyond what executives say, how they say it carries independent and complementary information. To study these dimensions jointly, we introduce DualEvasion, a benchmark for evasion detection across text and audio in earnings call Q&A. The benchmark contains 505 annotated question-answer pairs from 60 earnings calls, each with two independent labels: textual evasion (direct vs. evasive) and vocal cues operationalized as speaker confidence (confident vs. unconfident). Our experiments show that state-of-the-art multimodal models struggle to detect vocal confidence, particularly on unconfident responses. Our analysis suggests these models interpret acoustic cues in isolation rather than relative to each speaker's baseline. Providing speaker-level references yields modest improvements, but a substantial gap with human performance remains.
- Abstract(参考訳): 既存の収支表における回避検出手法は、テキストの書き起こしに焦点をあて、回避を1次元現象として扱う。
音声コミュニケーションの回避は本質的に多次元的であり、経営陣が何を言っているか、どのように独立的で相補的な情報を持っているかを超えて論じる。
これらの次元を共同で研究するために、収益電話Q&Aにおけるテキストと音声間の回避検出のベンチマークであるDualEvasionを紹介する。
このベンチマークには60件の決算報告から505件の注釈付き質問応答ペアが含まれており、それぞれに2つの独立したラベルがある。
我々の実験は、最先端のマルチモーダルモデルでは、特に不確実な応答において、声の信頼度を検出するのに苦労していることを示している。
分析の結果,これらのモデルは各話者のベースラインと相対的ではなく,音響的手がかりを分離して解釈することが示唆された。
話者レベルの参照を提供することで、控えめな改善がもたらされるが、人間のパフォーマンスとはかなりのギャップが残っている。
関連論文リスト
- When Text Misleads: Inconsistent-Aware Reasoning for Audio-Grounded Dialogue [18.262137202372454]
我々は障害モードをクロスモーダルな不一致として定式化する。
テキストバイアスによる表面解釈を識別し、不一致領域を競合QAの例に変換するスケーラブルなフレームワークを開発する。
さらに、音声を音声に変換するエージェントスタイルの推論フレームワークを開発し、局所的な音響的手がかりのテキスト可読表現であるAudio Twinを提案する。
論文 参考訳(メタデータ) (2026-08-27T14:26:46Z) - Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought [49.53567098922619]
モーダル間干渉を低減するための音声・視覚的推論フレームワークとして, 分離ファースト, ファウズ・レイト (SFFL) を提案する。
SFFLは、モーダリティ固有の連鎖推論を強制し、別々の音声および視覚的推論トレースを生成し、答えのエビデンスを統合する。
実験では精度と頑健さの両面で一貫した改善が示され、一般的なAVQAベンチマークでは5.16%、クロスモーダル幻覚ベンチマークでは11.17%の平均的な相対的な増加が得られた。
論文 参考訳(メタデータ) (2026-05-11T02:50:27Z) - Walking Through Uncertainty: An Empirical Study of Uncertainty Estimation for Audio-Aware Large Language Models [54.041320081289996]
音声対応大言語モデル(ALLM)における不確実性推定に関する最初の系統的研究について述べる。
予測エントロピー、長さ正規化エントロピー、意味エントロピー、個別意味エントロピー、P(True)を含む5つの代表的な手法をベンチマークする。
まず、意味レベルと検証ベースの手法は、一般的な音声推論ベンチマークにおけるトークンレベルベースラインを一貫して上回ります。
論文 参考訳(メタデータ) (2026-04-28T12:56:22Z) - When Contextual Inference Fails: Cancelability in Interactive Instruction Following [51.2195840589474]
私たちは、コンテキスト意味構築のためのインタラクティブなベンチマークであるBuild What I Meanを紹介します。
BWIMでは、モデルは文脈推論を行うか、小さな通信コストで明確化を要求することによって曖昧さを解決しなければならない。
我々は,不確実性の下でのパートナーブラインド過度明確化や質問逆推定などの準最適戦略を観察する。
論文 参考訳(メタデータ) (2026-03-20T14:46:59Z) - Assessing the Impact of Speaker Identity in Speech Spoofing Detection [1.7816843507516946]
スポット検出システムは、通常、複数の話者からの多様な記録を用いて訓練される。
本稿では,スプーフィング検出システムにおける話者情報の影響について検討する。
本稿では,話者不変型マルチタスクフレームワークにおける2つのアプローチを提案する。
論文 参考訳(メタデータ) (2026-02-24T11:45:41Z) - Speech-Hands: A Self-Reflection Voice Agentic Approach to Speech Recognition and Audio Reasoning with Omni Perception [142.4692205981783]
我々は,外部の音声知覚をいつ信頼するか,いつ外部の音声知覚を相談するかを知るという,一貫したスキルを学習する音声認識フレームワークを導入する。
音声認識と外部の音声理解タスクの両方でオムニモデルを鼻で微調整することは、しばしば性能を低下させる。
これを解決するために、我々のフレームワークであるSpeech-Handsは、問題を明示的な自己回帰決定として再考する。この学習可能なプリミティブは、モデルが欠陥のある外部候補によって脱線されるのを防ぐのに有効である。
論文 参考訳(メタデータ) (2026-01-14T12:06:50Z) - Audio MultiChallenge: A Multi-Turn Evaluation of Spoken Dialogue Systems on Natural Human Interaction [12.216811577733125]
本稿では,E2E音声対話システムを評価するためのオープンソースのベンチマークであるAudio MultiChallengeを紹介する。
そこで我々は,中発音声の補聴とバックトラックに対する頑健さを検査する新軸音声編集手法を提案する。
47の話者と1,712のインスタンス固有のルーリックとの452の会話を、オーディオネイティブエージェントとヒューマンインザループパイプラインのハイブリッドを通じてキュレートする。
論文 参考訳(メタデータ) (2025-12-16T19:26:44Z) - Question-Interlocutor Scope Realized Graph Modeling over Key Utterances
for Dialogue Reading Comprehension [61.55950233402972]
本稿では,対話読解のためのキーワード抽出手法を提案する。
複数の連続した発話によって形成された単位に対して予測を行い、より多くの回答を含む発話を実現する。
発話のテキスト上に構築されたグラフとして,質問-対話者スコープ実現グラフ(QuISG)モデルを提案する。
論文 参考訳(メタデータ) (2022-10-26T04:00:42Z) - Multilingual and Multimodal Abuse Detection [3.4352862428120123]
本稿では,多言語ソーシャルメディア設定における多モーダル視点からの会話音声における乱用検出を試みる。
提案手法であるMADAは、音声自体以外の2つのモードに明示的にフォーカスする。
提案手法を10の異なる言語で検証し,複数のモダリティを活用することで,0.6%~5.2%の範囲で一貫した利得を観測する。
論文 参考訳(メタデータ) (2022-04-03T13:28:58Z) - Filling the Gap of Utterance-aware and Speaker-aware Representation for
Multi-turn Dialogue [76.88174667929665]
マルチターン対話は、2つ以上の異なる話者の役割から複数の発話からなる。
既存の検索に基づくマルチターン対話モデルでは、事前訓練された言語モデル(PrLM)をエンコーダとして、対話を粗く表現する。
本稿では,対話履歴に係わる効果的な発話認識表現と話者認識表現をモデル化することにより,そのようなギャップを埋める新しいモデルを提案する。
論文 参考訳(メタデータ) (2020-09-14T15:07:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。