論文の概要: Beyond Decodability: Do Acoustic Factors Drive Predictions in Speech-Based Alzheimer's Assessment?
- arxiv url: http://arxiv.org/abs/2610.01846v1
- Date: Thu, 01 Oct 2026 15:13:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:24.218709
- Title: Beyond Decodability: Do Acoustic Factors Drive Predictions in Speech-Based Alzheimer's Assessment?
- Title(参考訳): 難聴を超えて:音声に基づくアルツハイマーの評価において音響因子は予測を駆動するか?
- Abstract要約: 音声に基づくアルツハイマー病の評価は、訓練済みの自己教師付き学習モデルにますます依存している。
ノイズは、元のデータに有意な診断群差は示さなかったが、最も強い介入効果をもたらす。
我々は、介入に基づく堅牢性テストが、信頼できる臨床音声モデルの標準となるべきであると論じる。
- 参考スコア(独自算出の注目度): 5.489791706599639
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Speech-based Alzheimer's disease (AD) assessments increasingly rely on pretrained self-supervised learning (SSL) models that learn acoustic representations directly from raw audio, exposing the model to recording factors. We ask whether such factors are merely encoded in SSL representations or can systematically alter predictions. Using ADReSSo and three large SSL backbones, we apply controlled noise and reverberation interventions to participant-speech-only, non-speech, and full-recording audio. We combine layer-wise linear decoding, input- and representation-space interventions, and geometric alignment analysis to distinguish acoustic decodability from influence on AD prediction. Our results show that controlled acoustic interventions alter AD predictions across all three SSL backbones. Noise, despite showing no significant diagnostic-group difference in the original data, produces the strongest intervention effects. Importantly, these effects are systematically structured relative to the classifier's decision direction, replicate on the held-out test set and reverse when the representation-space intervention direction is reversed. Together, these findings show that high predictive performance and the absence of a significant diagnostic-group difference in a measured acoustic factor are not sufficient for robustness. We argue that intervention-based robustness tests should become standard for trustworthy clinical speech models.
- Abstract(参考訳): 音声に基づくアルツハイマー病(AD)の評価は、生音声から直接音響表現を学習し、そのモデルを記録因子に露出する事前訓練された自己教師付き学習(SSL)モデルにますます依存している。
このような要因が単にSSL表現にエンコードされているだけなのか、あるいは予測を体系的に変更できるのかを問う。
ADReSSoと3つの大きなSSLバックボーンを用いて、参加者音声のみ、非音声、全音声に制御ノイズと残響介入を適用する。
重み付き線形デコーディング,入力空間と表現空間の介入,および幾何学的アライメント解析を組み合わせることで,音響的デオーダビリティとAD予測への影響を識別する。
以上の結果より,制御された音響介入は3つのSSLバックボーン間でAD予測を変化させることがわかった。
ノイズは、元のデータに有意な診断群差は示さなかったが、最も強い介入効果をもたらす。
重要なことに、これらの効果は分類器の判定方向に対して体系的に構造化され、保持されたテストセットに複製され、表現空間介入方向が反転した場合に逆転する。
これらの結果から, 音響因子に有意な診断群差がなく, 高い予測性能が得られないことが示唆された。
我々は、介入に基づく堅牢性テストが、信頼できる臨床音声モデルの標準となるべきであると論じる。
関連論文リスト
- Cleaner Speech, Weaker Generalization: Revisiting Pitt-Derived Benchmarks for Alzheimer's Disease Detection [24.508547448302078]
音声ベースのアルツハイマー病(AD)の検出は、ピット・コーパスの音声強調版と治療版にますます依存している。
我々は、音声に基づくAD検出のための広く使われているベンチマークにおいて、音声前処理とデータセットのキュレーションの役割を再考する。
論文 参考訳(メタデータ) (2026-08-31T19:19:00Z) - LSEAD: A Privacy-Preserving LLM-Based Speech Analysis Framework for Early Alzheimer's Disease Screening [9.238017937875627]
アルツハイマー病(AD)の早期診断は、病気の進行を遅くし、患者の結果を改善できるタイムリーな介入を可能にするために重要である。
大規模言語モデル(LLM)の最近の進歩は、豊かな言語表現と強力な一般化を提供することで、音声分析を改善している。
LSEAD(LSEAD)は,事前学習したオープンソースLPMを用いたAD検出フレームワークである。
論文 参考訳(メタデータ) (2026-08-07T16:21:00Z) - An Intervention-Based Framework for Shortcut Diagnosis in Spoofing Countermeasures [5.593982292458519]
本稿では,コンバウンド駆動のショートカット依存を識別するための介入に基づく診断フレームワークを提案する。
非音声構造、スペクトル含量、信号エネルギーを対象とする制御音響摂動によりこれを操作する。
その結果、非音声介入は最大のパフォーマンスシフトをもたらし、非音声区間が支配的なショートカットであることを確認した。
論文 参考訳(メタデータ) (2026-07-03T09:42:31Z) - Walking Through Uncertainty: An Empirical Study of Uncertainty Estimation for Audio-Aware Large Language Models [54.041320081289996]
音声対応大言語モデル(ALLM)における不確実性推定に関する最初の系統的研究について述べる。
予測エントロピー、長さ正規化エントロピー、意味エントロピー、個別意味エントロピー、P(True)を含む5つの代表的な手法をベンチマークする。
まず、意味レベルと検証ベースの手法は、一般的な音声推論ベンチマークにおけるトークンレベルベースラインを一貫して上回ります。
論文 参考訳(メタデータ) (2026-04-28T12:56:22Z) - Something from Nothing: Data Augmentation for Robust Severity Level Estimation of Dysarthric Speech [69.86604856129883]
外科的音声品質評価(DSQA)は臨床診断と包括的音声技術において重要である。
本研究では,未ラベルの変形音声と大規模典型的な音声データセットを併用した3段階のフレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-16T23:00:07Z) - Advancing Hearing Assessment: An ASR-Based Frequency-Specific Speech Test for Diagnosing Presbycusis [0.0]
従来の音響測定では、聴覚障害が音声理解に与える影響を完全に特徴づけることができない。
本稿では,新しい音声認識(ASR)に基づく周波数固有音声テストの開発とシミュレーション評価について述べる。
論文 参考訳(メタデータ) (2025-05-28T11:06:22Z) - The Unreliability of Acoustic Systems in Alzheimer's Speech Datasets with Heterogeneous Recording Conditions [11.00082412847855]
MFCC と Wav2vec 2.0 の2つの音響特性に基づくシステムにより,AD 患者を上向きの性能制御から識別できることが示されている。
本研究は,非標準化記録に基づく患者同定のための音響システムの使用に対する警告である。
論文 参考訳(メタデータ) (2024-09-11T20:50:45Z) - Leveraging Pretrained Representations with Task-related Keywords for
Alzheimer's Disease Detection [69.53626024091076]
アルツハイマー病(AD)は高齢者に特に顕著である。
事前学習モデルの最近の進歩は、AD検出モデリングを低レベル特徴から高レベル表現にシフトさせる動機付けとなっている。
本稿では,高レベルの音響・言語的特徴から,より優れたAD関連手がかりを抽出する,いくつかの効率的な手法を提案する。
論文 参考訳(メタデータ) (2023-03-14T16:03:28Z) - Inference and Denoise: Causal Inference-based Neural Speech Enhancement [83.4641575757706]
本研究では、雑音の存在を介入としてモデル化することにより、因果推論パラダイムにおける音声強調(SE)課題に対処する。
提案した因果推論に基づく音声強調(CISE)は,ノイズ検出器を用いて間欠雑音音声中のクリーンフレームとノイズフレームを分離し,両フレームセットを2つのマスクベース拡張モジュール(EM)に割り当て,ノイズ条件SEを実行する。
論文 参考訳(メタデータ) (2022-11-02T15:03:50Z) - Exploring linguistic feature and model combination for speech
recognition based automatic AD detection [61.91708957996086]
音声ベースの自動ADスクリーニングシステムは、他の臨床スクリーニング技術に代わる非侵襲的でスケーラブルな代替手段を提供する。
専門的なデータの収集は、そのようなシステムを開発する際に、モデル選択と特徴学習の両方に不確実性をもたらす。
本稿では,BERT と Roberta の事前学習したテキストエンコーダのドメイン微調整の堅牢性向上のための特徴とモデルの組み合わせ手法について検討する。
論文 参考訳(メタデータ) (2022-06-28T05:09:01Z) - Self-supervised models of audio effectively explain human cortical
responses to speech [71.57870452667369]
我々は、自己教師型音声表現学習の進歩に乗じて、人間の聴覚システムの最先端モデルを作成する。
これらの結果から,ヒト大脳皮質における音声処理の異なる段階に関連する情報の階層構造を,自己教師型モデルで効果的に把握できることが示唆された。
論文 参考訳(メタデータ) (2022-05-27T22:04:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。