論文の概要: ASR-Agnostic Multimodal Spectrotemporal Modeling for Early Dementia Detection
- arxiv url: http://arxiv.org/abs/2606.30646v1
- Date: Wed, 29 Apr 2026 01:20:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:12.960137
- Title: ASR-Agnostic Multimodal Spectrotemporal Modeling for Early Dementia Detection
- Title(参考訳): ASR-Agnostic Multimodal Spectrotemporal Modeling for Early Dementia Detection
- Abstract要約: 本稿では,Mel スペクトログラム上で直接動作する ASR に依存しないフレームワークを提案する。
重要な貢献は、連続した分光器フレームから分光時空間変位場を抽出することである。
DementiaBank、スロバキアのEWA-DB、スペインのIvanova corporaで独立したモデルをトレーニングしています。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Speech recruits the same executive, attentional, and working memory processes underlying instrumental activities of daily living, or IADLs, providing a non-invasive proxy for cognitive assessment. Yet most speech-based dementia detection systems depend on transcription, discard within-recording temporal structure, and are validated on a single English corpus with known recording artifacts. We propose an ASR-agnostic framework operating directly on Mel spectrograms. Our key contribution is extracting spectrotemporal displacement fields from consecutive spectrogram frames, capturing shifting spectral energy patterns as digital biomarkers of cognitive decline. These features are fused with CNN-ConvGRU acoustic embeddings via a learned cross-attention mechanism and aggregated using a Transformer encoder with learnable query pooling. A composite temporal loss enforces smoothness and contrastive coherence across segments. We train independent models on English DementiaBank, Slovak EWA-DB, and Spanish Ivanova corpora, using clinical elicitation protocols taxing IADL-relevant cognitive domains. The Slovak model achieves 83.9% accuracy, and Spanish achieves, while the English baseline yields 53.2%, confirming known artifacts. Cross-lingual ablation studies reveal distinct fusion regimes: removing cross-attention collapses Spanish performance to 53.7%, below unimodal models, while the Slovak audio encoder alone outperforms the full model, 93.7% vs. 83.9%, and all English configurations remain near chance. Thus, multimodal fusion's value is corpus-dependent: essential when signal is distributed across modalities, counterproductive when one dominates, and irrelevant when no signal exists. Auxiliary temporal losses converge to language-invariant values, indicating cross-lingual architectural stability.
- Abstract(参考訳): スピーチは、日常生活(IADL)のインストゥルメンタルな活動に基づく、同じ幹部、注意、作業記憶のプロセスを採用し、認知評価のための非侵襲的プロキシを提供する。
しかし、ほとんどの音声ベースの認知症検出システムは、転写に依存し、記録中の時間構造を破棄し、既知の記録アーティファクトを持つ単一の英語コーパスで検証される。
本稿では,Mel スペクトログラム上で直接動作する ASR に依存しないフレームワークを提案する。
我々の重要な貢献は、連続した分光器フレームから分光時空間変位場を抽出し、認知低下のデジタルバイオマーカーとしてシフトするスペクトルエネルギーパターンをとらえることである。
これらの機能は、学習したクロスアテンション機構を介してCNN-ConvGRU音響埋め込みと融合し、学習可能なクエリプーリングを備えたTransformerエンコーダを用いて集約される。
複合時間損失はセグメント間の滑らかさとコントラストコヒーレンスを強制する。
我々は、IADL関連認知ドメインを課税する臨床ライセンスプロトコルを用いて、イングリッシュ・デメンシア・バンク、スロバキア・EWA-DB、スペイン・イヴァノヴァ・コーポラで独立したモデルを訓練する。
スロバキアのモデルは83.9%の正確さを達成し、スペイン語は53.2%を獲得し、既知の人工物を確認している。
クロスアテンション崩壊の除去 スペインのパフォーマンスは53.7%、単調なモデルより低いが、スロバキアのオーディオエンコーダは93.7%対83.9%という完全なモデルより優れており、全ての英語構成がほぼ偶然である。
したがって、マルチモーダル融合の値はコーパスに依存している:信号がモダリティに分散されるとき、信号が支配されるとき、信号が存在しないとき、無関係である。
補助的時間的損失は言語不変値に収束し、言語間アーキテクチャの安定性を示す。
関連論文リスト
- DeMTS: Denoising Trajectories as Multivariate Time Series for Hallucination Detection in Diffusion Language Models [59.414664850109155]
拡散大言語モデル (D-LLM) はテキスト生成において有望なパラダイムとして登場してきた。
D-LLMは幻覚に弱いままであり、流動的な出力は事実的に誤った、またはサポートされていない内容を含む可能性がある。
論文 参考訳(メタデータ) (2026-07-24T06:45:43Z) - Listening Between the Lines: Joint Learning of ASR Embeddings and LLM-Augmented Linguistics for Dementia Detection [3.4155322317700585]
音声分析による認知症の早期発見は、非侵襲的なスクリーニング代替手段を提供するが、音響的および言語的バイオマーカーの両方をキャプチャすることは依然として困難である。
本稿では,Whisperを多目的抽出に活用したマルチモーダルフレームワークを提案する。
アコースティックパスでは、アテンションを持つ時間ネットワークが、集合的可変長列を固定次元埋め込みにプーリングする。
言語経路において,語彙の多様性,構文的複雑性,意味的一貫性,談話パターンにまたがる解釈可能な特徴を抽出する大規模言語モデル(LLM)を提案する。
論文 参考訳(メタデータ) (2026-06-26T08:21:31Z) - Robust Spoofed Speech Detection via Temporal Pyramid Modeling [2.1485350418225244]
発声音声検出は、現実的な合成、音声変換、リプレイアタックによってますます困難になっている。
本稿では,異なる受容場を持つ並列時間的畳み込みを利用してマルチスケールのスプーフィングキューを捕捉する時間的ピラミッドアダプタを提案する。
また,Mel,Sinc,Temporal Pyramidなどのフロントエンドアダプタと組み合わせた自己教師型XLS-R表現と,マルチスケール時間モデルのための時間ピラミッド設計を統合した。
論文 参考訳(メタデータ) (2026-06-15T15:16:10Z) - A Multimodal Framework for Dementia Detection via Linguistic and Acoustic Representation Learning [10.559333552210434]
アルツハイマー病は認知症の主要な原因であり、記憶、推論、コミュニケーション、日常生活に影響を及ぼす。
近年の研究では、自発音声には認知症に関連する貴重な言語的・音響的バイオマーカーが含まれていることが示されている。
本稿では,言語情報と書き起こし情報をエンドツーエンドのトレーニング可能な方法で共同で活用する,認知症自動検出のためのマルチモーダルディープラーニングフレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-25T07:57:49Z) - Seeing to Ground: Visual Attention for Hallucination-Resilient MDLLMs [47.94507630961399]
トレーニング不要なデコードフレームワークであるVISAGEを導入し、推論時に目的を校正する。
我々は、VISAGEが推定誤差の下で有界目的損失を維持することを保証する解析的安定性を保証する。
幻覚感受性および汎用ベンチマークによる評価は、フレームワークの堅牢性を示している。
論文 参考訳(メタデータ) (2026-03-26T17:53:49Z) - Adapting Self-Supervised Speech Representations for Cross-lingual Dysarthria Detection in Parkinson's Disease [72.0406069194794]
音声表現は、しばしば言語に依存した構造を符号化する。
本稿では,ソース言語による自己教師型音声表現とターゲット言語分布とを一致させる表現レベル言語シフトを提案する。
チェコ語,ドイツ語,スペイン語におけるパーキンソン病音声データセットの経口DDK記録に対するアプローチについて検討した。
論文 参考訳(メタデータ) (2026-03-23T17:23:39Z) - Temporal-Aware Iterative Speech Model for Dementia Detection [0.0]
音声を用いた認知症自動検出の現在の手法は,静的,時間に依存しない特徴や集約された言語コンテンツに依存している。
本稿では,認知症検出のための自然発話を動的にモデル化するテンポラル・アウェア・イテレーティブ・フレームワークであるTAI-Speechを紹介する。
私たちの研究は、より柔軟で堅牢な認知評価ソリューションを提供し、生のオーディオのダイナミクスを直接操作します。
論文 参考訳(メタデータ) (2025-09-26T01:56:07Z) - SignBart -- New approach with the skeleton sequence for Isolated Sign language Recognition [0.17578923069457017]
本研究では,骨格配列のx,y座標から意味情報を独立に抽出することの難しさを克服する新しいSLR手法を提案する。
749,888のパラメータだけで、このモデルはLSA-64データセットで96.04%の精度を達成している。
このモデルはまた、WLASLとASL-Citizenデータセット間で優れたパフォーマンスと一般化を示す。
論文 参考訳(メタデータ) (2025-06-18T07:07:36Z) - It's Never Too Late: Fusing Acoustic Information into Large Language
Models for Automatic Speech Recognition [70.77292069313154]
大規模言語モデル(LLM)は、自動音声認識(ASR)出力の上の生成誤り訂正(GER)に成功することができる。
本研究では,不確実性認識ダイナミックフュージョン (UADF) と呼ばれる新しい遅延融合解によって予測された転写を生成する前に,音響情報を注入することにより,そのような制限を克服することを目的とする。
論文 参考訳(メタデータ) (2024-02-08T07:21:45Z) - Exploiting Cross-domain And Cross-Lingual Ultrasound Tongue Imaging
Features For Elderly And Dysarthric Speech Recognition [55.25565305101314]
調音機能は音響信号歪みに不変であり、音声認識システムにうまく組み込まれている。
本稿では,A2Aモデルにおける24時間TaLコーパスの並列音声・超音波舌画像(UTI)データを利用したクロスドメインおよびクロスランガルA2Aインバージョン手法を提案する。
生成した調音機能を組み込んだ3つのタスクの実験は、ベースラインのTDNNとコンフォーマーASRシステムより一貫して優れていた。
論文 参考訳(メタデータ) (2022-06-15T07:20:28Z) - NUVA: A Naming Utterance Verifier for Aphasia Treatment [49.114436579008476]
失語症(PWA)患者の治療介入に対する反応の診断とモニタリングの両立のための画像命名タスクを用いた音声性能評価
本稿では,失語症脳卒中患者の「正しい」と「正しくない」を分類する深層学習要素を組み込んだ発話検証システムであるNUVAについて述べる。
イギリス系英語8ヶ国語でのテストでは、システムの性能精度は83.6%から93.6%の範囲であり、10倍のクロスバリデーション平均は89.5%であった。
論文 参考訳(メタデータ) (2021-02-10T13:00:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。