論文の概要: LoRA-Tuned Large Language Models for Dementia Detection via Multi-View Speech-Derived Features
- arxiv url: http://arxiv.org/abs/2606.28445v1
- Date: Fri, 26 Jun 2026 08:29:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:15.560828
- Title: LoRA-Tuned Large Language Models for Dementia Detection via Multi-View Speech-Derived Features
- Title(参考訳): 多視点音声合成特徴を用いた認知症検出のためのLoRA付き大言語モデル
- Abstract要約: そこで本研究では,4つの補完音声から得られる信号に対して,構造化多視点推論を行うローランク適応 (LoRA) 付き大言語モデル (LLM) を提案する。
ADReSSoではF1スコア90.14%を達成し,それぞれのビューの補完的寄与をアブレーションで確認した。
- 参考スコア(独自算出の注目度): 3.4155322317700585
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Early detection of dementia enables timely intervention, and reflecting cognitive impairment, spontaneous speech offers a non-invasive screening modality. Conventional approaches often focus on a single representational dimension -- such as acoustic descriptors, pause modeling, automatic speech recognition (ASR) transcripts, or multimodal fusion -- limiting integrative reasoning across heterogeneous cognitive symptoms. We propose a low-rank adaptation (LoRA)-tuned large language model (LLM) that performs structured multi-view reasoning over four complementary speech-derived signals: ASR transcripts with pause markers, discourse-level topic cues, temporal fluency statistics, and phonological sequences. These cues are encoded within a unified prompt, enabling a single LLM to learn a coherent decision function without modality-specific encoders or late-stage fusion. On ADReSSo, our best model achieves an F1-score of 90.14%, and ablation confirms the complementary contribution of each view.
- Abstract(参考訳): 認知症の早期発見は、タイムリーな介入を可能にし、認知障害を反映し、自然発声は非侵襲的なスクリーニングモダリティを提供する。
従来のアプローチでは、音響ディスクリプタ、一時停止モデリング、自動音声認識(ASR)文字起こし、マルチモーダル融合のような単一の表現的次元に重点を置いており、不均一な認知症状に対する統合的推論を制限する。
そこで我々は,低ランク適応 (LoRA) 型大言語モデル (LLM) を提案する。このモデルでは,ポーズマーカー付きASR transcripts,談話レベルのトピックキュー,時間流速統計,音韻列の4つの相補的音声信号に対して,構造化された多視点推論を行う。
これらのキューは統一されたプロンプト内にエンコードされ、単一のLCMがモダリティ固有のエンコーダや後期融合なしでコヒーレントな決定関数を学習することができる。
ADReSSoではF1スコア90.14%を達成し,各ビューの補完的寄与をアブレーションで確認した。
関連論文リスト
- Toward Generalizable Cognitive Impairment Detection with Speech-Based Multimodal Large Language Models [6.567438338350837]
音声信号は認知低下に関連する言語マーカーと音響マーカーの両方を符号化する。
大規模言語モデル(LLM)の最近の進歩は,音声に基づく評価の可能性を高めている。
本稿では,音声音声と対応する書き起こしを統合したオープンソースのLLMに基づくマルチモーダルCI検出フレームワークを提案する。
本研究は、CI識別のための新しい最先端技術を確立し、提案手法により、より優れたクロスデータセットの一般化を実証する。
論文 参考訳(メタデータ) (2026-07-23T16:43:12Z) - Listening Between the Lines: Joint Learning of ASR Embeddings and LLM-Augmented Linguistics for Dementia Detection [3.4155322317700585]
音声分析による認知症の早期発見は、非侵襲的なスクリーニング代替手段を提供するが、音響的および言語的バイオマーカーの両方をキャプチャすることは依然として困難である。
本稿では,Whisperを多目的抽出に活用したマルチモーダルフレームワークを提案する。
アコースティックパスでは、アテンションを持つ時間ネットワークが、集合的可変長列を固定次元埋め込みにプーリングする。
言語経路において,語彙の多様性,構文的複雑性,意味的一貫性,談話パターンにまたがる解釈可能な特徴を抽出する大規模言語モデル(LLM)を提案する。
論文 参考訳(メタデータ) (2026-06-26T08:21:31Z) - Multi-View Speech Representation Learning for Parkinson's Disease Detection Using Context-guided Cross-modal Attention [9.395262542018235]
本稿では,パーキンソン病の自動検出のためのマルチブランチ深層学習フレームワークを提案する。
提案したアーキテクチャは91.51%の精度、F1スコアは91.24%、AUCは95.97%である。
論文 参考訳(メタデータ) (2026-06-08T09:39:33Z) - A Multimodal Framework for Dementia Detection via Linguistic and Acoustic Representation Learning [10.559333552210434]
アルツハイマー病は認知症の主要な原因であり、記憶、推論、コミュニケーション、日常生活に影響を及ぼす。
近年の研究では、自発音声には認知症に関連する貴重な言語的・音響的バイオマーカーが含まれていることが示されている。
本稿では,言語情報と書き起こし情報をエンドツーエンドのトレーニング可能な方法で共同で活用する,認知症自動検出のためのマルチモーダルディープラーニングフレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-25T07:57:49Z) - Optimizing Conversational Quality in Spoken Dialogue Systems with Reinforcement Learning from AI Feedback [82.70507055599093]
本稿では,マルチターン・チェーン・オブ・ソートモデルとブロックワイド・デュプレックスモデルの両方において,SDSの品質向上のための選好学習に関する最初の体系的研究を行う。
実験により, 単一回帰RLAIFは目標距離を選択的に改善し, 連立多重回帰学習は意味的品質と音声の自然性において一貫した利得が得られることが示された。
論文 参考訳(メタデータ) (2026-01-27T00:55:14Z) - Generative Human-Object Interaction Detection via Differentiable Cognitive Steering of Multi-modal LLMs [85.69785384599827]
人間と物体の相互作用(Human-object Interaction、HOI)の検出は、人と物体のペアとそれらの相互作用を局在させることを目的としている。
既存のメソッドはクローズドワールドの仮定の下で動作し、タスクを未定義の小さな動詞集合上の分類問題として扱う。
本稿では,閉集合分類タスクから開語彙生成問題へのHOI検出を再構成する新しい生成推論・ステアブル知覚フレームワークGRASP-HOを提案する。
論文 参考訳(メタデータ) (2025-12-19T14:41:50Z) - National Institute on Aging PREPARE Challenge: Early Detection of Cognitive Impairment Using Speech -- The SpeechCARE Solution [1.0486773259892048]
アルツハイマー病と関連する認知症は、60歳以上の成人の5人に1人に影響を与えるが、認知低下した人の半数以上が未診断のままである。
SpeechCAREは、認知障害に関連する微妙な音声関連手がかりをキャプチャするマルチモーダル音声処理パイプラインである。
その堅牢な前処理には、自動転写、大規模言語モデル(LLM)に基づく異常検出、タスク識別が含まれる。
論文 参考訳(メタデータ) (2025-11-11T11:39:20Z) - Linguistic and Audio Embedding-Based Machine Learning for Alzheimer's Dementia and Mild Cognitive Impairment Detection: Insights from the PROCESS Challenge [0.0]
音声は、音響的次元と言語的次元の両方を包含し、認知の低下に対して有望な非侵襲的バイオマーカーを提供する。
本稿では,自然発声音声からの音声埋め込みと言語的特徴を両立させるプロシージャチャレンジのための機械学習フレームワークを提案する。
論文 参考訳(メタデータ) (2025-10-02T06:54:55Z) - Temporal-Aware Iterative Speech Model for Dementia Detection [0.0]
音声を用いた認知症自動検出の現在の手法は,静的,時間に依存しない特徴や集約された言語コンテンツに依存している。
本稿では,認知症検出のための自然発話を動的にモデル化するテンポラル・アウェア・イテレーティブ・フレームワークであるTAI-Speechを紹介する。
私たちの研究は、より柔軟で堅牢な認知評価ソリューションを提供し、生のオーディオのダイナミクスを直接操作します。
論文 参考訳(メタデータ) (2025-09-26T01:56:07Z) - It's Never Too Late: Fusing Acoustic Information into Large Language
Models for Automatic Speech Recognition [70.77292069313154]
大規模言語モデル(LLM)は、自動音声認識(ASR)出力の上の生成誤り訂正(GER)に成功することができる。
本研究では,不確実性認識ダイナミックフュージョン (UADF) と呼ばれる新しい遅延融合解によって予測された転写を生成する前に,音響情報を注入することにより,そのような制限を克服することを目的とする。
論文 参考訳(メタデータ) (2024-02-08T07:21:45Z) - High-Fidelity Speech Synthesis with Minimal Supervision: All Using
Diffusion Models [56.00939852727501]
最小教師付き音声合成は、2種類の離散音声表現を組み合わせることでTSを分離する。
非自己回帰フレームワークは、制御可能性を高め、持続拡散モデルは、多様化された韻律表現を可能にする。
論文 参考訳(メタデータ) (2023-09-27T09:27:03Z) - Leveraging Pretrained Representations with Task-related Keywords for
Alzheimer's Disease Detection [69.53626024091076]
アルツハイマー病(AD)は高齢者に特に顕著である。
事前学習モデルの最近の進歩は、AD検出モデリングを低レベル特徴から高レベル表現にシフトさせる動機付けとなっている。
本稿では,高レベルの音響・言語的特徴から,より優れたAD関連手がかりを抽出する,いくつかの効率的な手法を提案する。
論文 参考訳(メタデータ) (2023-03-14T16:03:28Z) - Audio-visual multi-channel speech separation, dereverberation and
recognition [70.34433820322323]
本稿では,音声-視覚的多チャンネル音声分離,デバーベレーション,認識手法を提案する。
音声を用いた場合の視覚的モダリティの利点は、2つのニューラルデバーベレーションアプローチでのみ示される。
LRS2データセットを用いて行った実験から,提案手法がベースラインよりも優れていたことが示唆された。
論文 参考訳(メタデータ) (2022-04-05T04:16:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。