論文の概要: Toward Generalizable Cognitive Impairment Detection with Speech-Based Multimodal Large Language Models
- arxiv url: http://arxiv.org/abs/2607.21496v1
- Date: Thu, 23 Jul 2026 16:43:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-24 18:26:25.485912
- Title: Toward Generalizable Cognitive Impairment Detection with Speech-Based Multimodal Large Language Models
- Title(参考訳): 音声に基づく多モーダル大言語モデルによる一般化可能な認知障害検出に向けて
- Authors: Yingchao Huang, Xin Wang, Yuhan Su, Shanshan Yao,
- Abstract要約: 音声信号は認知低下に関連する言語マーカーと音響マーカーの両方を符号化する。
大規模言語モデル(LLM)の最近の進歩は,音声に基づく評価の可能性を高めている。
本稿では,音声音声と対応する書き起こしを統合したオープンソースのLLMに基づくマルチモーダルCI検出フレームワークを提案する。
本研究は、CI識別のための新しい最先端技術を確立し、提案手法により、より優れたクロスデータセットの一般化を実証する。
- 参考スコア(独自算出の注目度): 6.567438338350837
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Cognitive impairment (CI) is a growing public health concern. Early and accurate diagnosis is critical for enabling timely intervention and improving patient outcomes. Speech-based CI detection has emerged as a promising non-invasive approach, as speech signals encode both linguistic and acoustic markers associated with cognitive decline. Recent advances in large language models (LLMs) further strengthen the potential of speech-based assessment by enabling more expressive representation learning and improved generalization across diverse speakers, recording devices, and clinical environments. Moreover, multimodal learning by jointly modeling linguistic and acoustic features allows for a more comprehensive characterization of cognitive and behavioral changes related to CI, leading to more reliable detection. In this work, we propose a multimodal CI detection framework based on open-source LLMs that integrates speech audio and corresponding transcripts while preserving patient privacy. Acoustic embeddings are extracted directly from speech signals, while textual embeddings are generated from automatically transcribed speech. These modality-specific embeddings are then concatenated to create a combined feature vector and used for downstream classification, without requiring access to raw or sensitive patient data. The proposed approach is evaluated on the ADReSS20 and ADReSSo21 benchmark datasets. Experimental results show that the proposed multimodal framework achieves an CI classification accuracy of 92.4% and consistently outperforms single-modality baselines. Our work establishes a new state-of-the-art for CI identification, with the proposed method demonstrating superior cross-dataset generalization. This advance highlights the power of an LLM-based multimodal framework that fuses linguistic and acoustic data to enable robust, scalable, and non-invasive screening.
- Abstract(参考訳): 認知障害 (CI) は公衆衛生上の問題である。
早期かつ正確な診断は、タイムリーな介入を可能にし、患者の結果を改善するために重要である。
音声によるCI検出は、認知低下に関連する言語的マーカーと音響的マーカーの両方を符号化し、有望な非侵襲的アプローチとして登場した。
大規模言語モデル(LLM)の最近の進歩は、より表現力のある表現学習を可能にし、多様な話者、録音装置、臨床環境における一般化を向上させることで、音声に基づく評価の可能性をさらに強化している。
さらに、言語的特徴と音響的特徴を併用したマルチモーダル学習により、CIに関連する認知的・行動的変化をより包括的に評価することができ、より信頼性の高い検出が可能になる。
本研究では,患者のプライバシを保護しつつ,音声と対応する転写文を統合するオープンソースのLLMをベースとしたマルチモーダルCI検出フレームワークを提案する。
音声信号から直接音響埋め込みを抽出し、自動転写音声からテキスト埋め込みを生成する。
これらのモダリティ固有の埋め込みは、結合して機能ベクトルを生成し、生または敏感な患者データへのアクセスを必要とせず、下流の分類に使用される。
提案手法はADReSS20とADReSSo21ベンチマークデータセットで評価される。
実験の結果,提案したマルチモーダルフレームワークは,CI分類精度92.4%を達成し,単一モーダルベースラインを一貫して上回ることがわかった。
本研究は、CI識別のための新しい最先端技術を確立し、提案手法はより優れたクロスデータセットの一般化を実証する。
この進歩は、言語データと音響データを融合し、堅牢でスケーラブルで非侵襲的なスクリーニングを可能にするLLMベースのマルチモーダルフレームワークのパワーを強調している。
関連論文リスト
- LoRA-Tuned Large Language Models for Dementia Detection via Multi-View Speech-Derived Features [3.4155322317700585]
そこで本研究では,4つの補完音声から得られる信号に対して,構造化多視点推論を行うローランク適応 (LoRA) 付き大言語モデル (LLM) を提案する。
ADReSSoではF1スコア90.14%を達成し,それぞれのビューの補完的寄与をアブレーションで確認した。
論文 参考訳(メタデータ) (2026-06-26T08:29:31Z) - Listening Between the Lines: Joint Learning of ASR Embeddings and LLM-Augmented Linguistics for Dementia Detection [3.4155322317700585]
音声分析による認知症の早期発見は、非侵襲的なスクリーニング代替手段を提供するが、音響的および言語的バイオマーカーの両方をキャプチャすることは依然として困難である。
本稿では,Whisperを多目的抽出に活用したマルチモーダルフレームワークを提案する。
アコースティックパスでは、アテンションを持つ時間ネットワークが、集合的可変長列を固定次元埋め込みにプーリングする。
言語経路において,語彙の多様性,構文的複雑性,意味的一貫性,談話パターンにまたがる解釈可能な特徴を抽出する大規模言語モデル(LLM)を提案する。
論文 参考訳(メタデータ) (2026-06-26T08:21:31Z) - A Multimodal Framework for Dementia Detection via Linguistic and Acoustic Representation Learning [10.559333552210434]
アルツハイマー病は認知症の主要な原因であり、記憶、推論、コミュニケーション、日常生活に影響を及ぼす。
近年の研究では、自発音声には認知症に関連する貴重な言語的・音響的バイオマーカーが含まれていることが示されている。
本稿では,言語情報と書き起こし情報をエンドツーエンドのトレーニング可能な方法で共同で活用する,認知症自動検出のためのマルチモーダルディープラーニングフレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-25T07:57:49Z) - Generative Human-Object Interaction Detection via Differentiable Cognitive Steering of Multi-modal LLMs [85.69785384599827]
人間と物体の相互作用(Human-object Interaction、HOI)の検出は、人と物体のペアとそれらの相互作用を局在させることを目的としている。
既存のメソッドはクローズドワールドの仮定の下で動作し、タスクを未定義の小さな動詞集合上の分類問題として扱う。
本稿では,閉集合分類タスクから開語彙生成問題へのHOI検出を再構成する新しい生成推論・ステアブル知覚フレームワークGRASP-HOを提案する。
論文 参考訳(メタデータ) (2025-12-19T14:41:50Z) - Linguistic and Audio Embedding-Based Machine Learning for Alzheimer's Dementia and Mild Cognitive Impairment Detection: Insights from the PROCESS Challenge [0.0]
音声は、音響的次元と言語的次元の両方を包含し、認知の低下に対して有望な非侵襲的バイオマーカーを提供する。
本稿では,自然発声音声からの音声埋め込みと言語的特徴を両立させるプロシージャチャレンジのための機械学習フレームワークを提案する。
論文 参考訳(メタデータ) (2025-10-02T06:54:55Z) - $C^2$AV-TSE: Context and Confidence-aware Audio Visual Target Speaker Extraction [80.57232374640911]
我々はMask-And-Recover (MAR)と呼ばれるモデルに依存しない戦略を提案する。
MARは、モダリティ間およびモダリティ間コンテキスト相関を統合し、抽出モジュール内の大域的推論を可能にする。
各サンプルの難易度を向上するために, 精細信頼スコア(FCS)モデルを導入する。
論文 参考訳(メタデータ) (2025-04-01T13:01:30Z) - Dementia Insights: A Context-Based MultiModal Approach [0.3749861135832073]
早期発見は、病気の進行を遅らせる可能性のあるタイムリーな介入に不可欠である。
テキストと音声のための大規模事前学習モデル(LPM)は、認知障害の識別において有望であることを示している。
本研究は,テキストデータと音声データを最高の性能のLPMを用いて統合する,コンテキストベースのマルチモーダル手法を提案する。
論文 参考訳(メタデータ) (2025-03-03T06:46:26Z) - Devising a Set of Compact and Explainable Spoken Language Feature for Screening Alzheimer's Disease [52.46922921214341]
アルツハイマー病(AD)は高齢化社会において最も重要な健康問題の一つとなっている。
我々は,大言語モデル(LLM)とTF-IDFモデルの視覚的機能を活用する,説明可能な効果的な機能セットを考案した。
当社の新機能は、自動ADスクリーニングの解釈可能性を高めるステップバイステップで説明し、解釈することができる。
論文 参考訳(メタデータ) (2024-11-28T05:23:22Z) - Where are we in audio deepfake detection? A systematic analysis over generative and detection models [59.09338266364506]
SONARはAI-Audio Detection FrameworkとBenchmarkの合成である。
最先端のAI合成聴覚コンテンツを識別するための総合的な評価を提供する。
従来のモデルベース検出システムと基礎モデルベース検出システムの両方で、AIオーディオ検出を均一にベンチマークする最初のフレームワークである。
論文 参考訳(メタデータ) (2024-10-06T01:03:42Z) - BrainLLM: Generative Language Decoding from Brain Recordings [77.66707255697706]
本稿では,大言語モデルと意味脳デコーダの容量を利用した生成言語BCIを提案する。
提案モデルでは,視覚的・聴覚的言語刺激のセマンティック内容に整合したコヒーレントな言語系列を生成することができる。
本研究は,直接言語生成におけるBCIの活用の可能性と可能性を示すものである。
論文 参考訳(メタデータ) (2023-11-16T13:37:21Z) - Leveraging Pretrained Representations with Task-related Keywords for
Alzheimer's Disease Detection [69.53626024091076]
アルツハイマー病(AD)は高齢者に特に顕著である。
事前学習モデルの最近の進歩は、AD検出モデリングを低レベル特徴から高レベル表現にシフトさせる動機付けとなっている。
本稿では,高レベルの音響・言語的特徴から,より優れたAD関連手がかりを抽出する,いくつかの効率的な手法を提案する。
論文 参考訳(メタデータ) (2023-03-14T16:03:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。