論文の概要: Multimodal Domain Generalization for Depression Detection: An Attention-Based BiLSTM Network with Domain-Adversarial Training
- arxiv url: http://arxiv.org/abs/2607.22794v1
- Date: Fri, 24 Jul 2026 13:52:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:14.880277
- Title: Multimodal Domain Generalization for Depression Detection: An Attention-Based BiLSTM Network with Domain-Adversarial Training
- Title(参考訳): 抑うつ検出のためのマルチモーダル・ドメイン一般化:ドメイン・アドバイザリ・トレーニングを用いた注意型BiLSTMネットワーク
- Abstract要約: ドメイン一般化(DG)を取り入れた最初の患者非依存型マルチモーダルうつ病検出フレームワークを提案する。
提案モデルでは、双方向長短期記憶(BiLSTM)と、意思決定のためのセグメントレベル融合を伴うモーダル内およびクロスモーダルアテンション機構を統合する。
このベースラインへのDGの追加は精度が2.5%増加し、F1スコアは3.3%増加し、93.2%の精度、93.2%の精度、96.2%のリコール、94.2%のF1スコアを達成した。
- 参考スコア(独自算出の注目度): 4.970364068620607
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Automatic depression detection with deep learning has shown promise but often suffers from limited generalization due to domain shift arising from inter-speaker variability. To address this critical issue, we present the first patient-independent multimodal depression detection framework that incorporates domain generalization (DG), jointly leveraging both acoustic and textual modalities. The proposed model integrates bidirectional Long Short-Term Memory (BiLSTM) with intra- and cross-modal attention mechanisms, accompanied by segment-level fusion for decision-making. Generalization is further enhanced by applying a gradient reversal layer inspired by Domain-Adversarial Training of Neural Networks (DANN), which promotes domain-invariant representations by adversarially limiting the model's ability to identify individual speakers, effectively reducing patient-specific bias. Conducting experiments on the Androids-Corpus dataset with a 5-fold cross-validation (CV) protocol, various pairings of audio and text feature extractors were evaluated over different segment durations, determining MelSpec and ItalianBERT as the optimal baseline at a 30-second segment duration. The addition of DG to this baseline yields a 2.5% increase in accuracy and 3.3% in F1-score, achieving 93.2% accuracy, 93.2% precision, 96.2% recall, and 94.2% F1-score, surpassing all existing benchmarks. Extensive ablation studies assess the impact of multimodal fusion, deep architectural choices, and DG, highlighting their combined contribution to robust and generalizable depression detection.
- Abstract(参考訳): 深層学習による自動抑うつ検出は、将来性を示すが、話者間変動に起因する領域シフトによる限定的な一般化に悩まされることが多い。
この重要な問題に対処するために、ドメイン一般化(DG)を取り入れた最初の患者非依存型マルチモーダルうつ病検出フレームワークを提案する。
提案モデルでは、双方向長短期記憶(BiLSTM)と、意思決定のためのセグメントレベル融合を伴うモーダル内およびクロスモーダルアテンション機構を統合する。
一般化は、モデルが個々の話者を特定する能力を逆向きに制限し、患者固有のバイアスを効果的に減らし、ドメイン不変表現を促進するDANN(Domain-Adversarial Training of Neural Networks)にインスパイアされた勾配反転層を適用することでさらに強化される。
5-fold cross-validation (CV) プロトコルを用いてAndroids-Corpusデータセット上で実験を行い、音声とテキストの特徴抽出器のペアリングを異なるセグメント期間で評価し、30秒間隔でMelSpecとItaBERTを最適なベースラインとして判定した。
このベースラインへのDGの追加は精度が2.5%増加し、F1スコアは3.3%増加し、93.2%の精度、93.2%の精度、96.2%のリコール、94.2%のF1スコアを達成した。
広範囲にわたるアブレーション研究は、マルチモーダル融合、ディープアーキテクチャの選択、DGの影響を評価し、それらが堅牢で一般化可能なうつ病検出への複合的な貢献を強調している。
関連論文リスト
- D3Seg: Dependency-Aware Diffusion for Brain Tumor Segmentation with Missing Modalities [54.87947751720332]
欠落モード設定下での安定した性能を維持するために,新しいセグメンテーションモデルD3Segを提案する。
提案モデルでは, 腫瘍造影法 (ET) で約1.5~2.0%, 腫瘍コア法 (TC) で約1.0%, 複数の欠損モードで約1.0%を達成している。
論文 参考訳(メタデータ) (2026-05-21T09:55:42Z) - PRIME: Prototype-Driven Multimodal Pretraining for Cancer Prognosis with Missing Modalities [86.63247982275396]
PRIMEは、欠落を認識したマルチモーダルな自己教師型事前トレーニングフレームワークである。
部分的に観察されたコホートから頑健で伝達可能な表現を学ぶ。
The Cancer Genome AtlasのPRIMEを32種類の癌に対してラベルフリープレトレーニングで評価した。
論文 参考訳(メタデータ) (2026-04-05T21:14:27Z) - Improving Generalization of Deep Learning for Brain Metastases Segmentation Across Institutions [5.4585656405659195]
この作業の目標は、BMセグメンテーションを複数の機関で使用できるようにするためのドメイン適応フレームワークを作ることである。
本稿では,変分オートエンコーダ(VAE)と平均誤差損失(MMD)を組み合わせたVAE-MMD前処理パイプラインを提案する。
論文 参考訳(メタデータ) (2026-04-01T02:25:25Z) - UniField: A Unified Field-Aware MRI Enhancement Framework [45.03230466428695]
methodnameは、複数のモダリティと拡張タスクを統合する統合フレームワークである。
我々は、事前学習した3D基礎モデルを利用して、総合的な3Dボリューム情報を利用する。
我々は,総合的なマルチフィールドMRIデータセットを編成し,公開する。
論文 参考訳(メタデータ) (2026-03-10T05:45:12Z) - Externally Validated Multi-Task Learning via Consistency Regularization Using Differentiable BI-RADS Features for Breast Ultrasound Tumor Segmentation [2.337709693812769]
セグメンテーションと分類の間の破壊的干渉を緩和する新しい整合正則化手法を提案する。
BrEaSTデータセット(Poland)上のすべてのモデルをトレーニングし、3つの外部データセット上で評価することで、このアプローチを検証した。
論文 参考訳(メタデータ) (2025-11-20T01:45:25Z) - Cancer-Net PCa-MultiSeg: Multimodal Enhancement of Prostate Cancer Lesion Segmentation Using Synthetic Correlated Diffusion Imaging [55.62977326180104]
前立腺癌病変の分節化に対する近年の深層学習アプローチは,限られた性能を達成している。
本稿では,標準拡散型プロトコルの拡張として,合成相関拡散イメージング(CDI$s$)について検討する。
以上の結果から,PCa病変セグメント化タスクの実践的ドロップイン強化として,CDI$s$に対する検証済み統合経路が確立された。
論文 参考訳(メタデータ) (2025-11-11T04:16:12Z) - Colorectal Cancer Histopathological Grading using Multi-Scale Federated Learning [0.0]
本稿では,大腸癌診断のための拡張性,プライバシ保護型フェデレーション学習フレームワークを提案する。
我々のフレームワークは全体の83.5%の精度を達成し、同等の集中型モデルよりも優れています。
提案されたモジュールパイプラインは、デジタル病理のためのデプロイ可能でプライバシに配慮した臨床AIに向けた基礎的なステップを確立する。
論文 参考訳(メタデータ) (2025-11-05T18:18:09Z) - DRBD-Mamba for Robust and Efficient Brain Tumor Segmentation with Analytical Insights [54.87947751720332]
脳腫瘍の正確なセグメンテーションは、臨床診断と治療に重要である。
マンバを拠点とするState Space Modelsは、有望なパフォーマンスを示している。
本稿では,計算オーバーヘッドを最小限に抑えながら,マルチスケールの長距離依存関係をキャプチャするマルチ解像度双方向マンバを提案する。
論文 参考訳(メタデータ) (2025-10-16T07:31:21Z) - Cross-dataset Multivariate Time-series Model for Parkinson's Diagnosis via Keyboard Dynamics [1.4895002251586484]
パーキンソン病(PD)は世界的な課題となり、1000万人以上の人に影響を与えている。
本稿では,キーストロークダイナミックスを非侵襲的かつスケーラブルなバイオマーカーとして活用し,遠隔PDスクリーニングと遠隔監視を実現するパイプラインを提案する。
論文 参考訳(メタデータ) (2025-10-10T17:42:08Z) - Rethink Domain Generalization in Heterogeneous Sequence MRI Segmentation [1.3753367700362567]
PancreasDGは、大規模な3次元MRI膵セグメンテーションデータセットである。
PancreasDGは、医療画像の領域一般化のための新しいベンチマークを設定している。
論文 参考訳(メタデータ) (2025-07-30T21:26:28Z) - $C^2$AV-TSE: Context and Confidence-aware Audio Visual Target Speaker Extraction [80.57232374640911]
我々はMask-And-Recover (MAR)と呼ばれるモデルに依存しない戦略を提案する。
MARは、モダリティ間およびモダリティ間コンテキスト相関を統合し、抽出モジュール内の大域的推論を可能にする。
各サンプルの難易度を向上するために, 精細信頼スコア(FCS)モデルを導入する。
論文 参考訳(メタデータ) (2025-04-01T13:01:30Z) - ERNIE-SPARSE: Learning Hierarchical Efficient Transformer Through
Regularized Self-Attention [48.697458429460184]
情報ボトルネック感度と異なる注目トポロジ間の不整合の2つの要因がスパース変換器の性能に影響を及ぼす可能性がある。
本稿では,ERNIE-Sparseというモデルを提案する。
i) 局所情報とグローバル情報を逐次統一する階層スパース変換器(HST) と、(ii) 注意トポロジの異なる変換器の距離を最小化する自己注意正規化(SAR) の2つの特徴がある。
論文 参考訳(メタデータ) (2022-03-23T08:47:01Z) - Cross-Modality Brain Tumor Segmentation via Bidirectional
Global-to-Local Unsupervised Domain Adaptation [61.01704175938995]
本論文では,UDAスキームに基づくBiGL(Bidirectional Global-to-Local)適応フレームワークを提案する。
具体的には、脳腫瘍をセグメント化するために、双方向画像合成およびセグメンテーションモジュールを提案する。
提案手法は, 最先端の非教師なし領域適応法を大きなマージンで上回っている。
論文 参考訳(メタデータ) (2021-05-17T10:11:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。