論文の概要: Label-Free Parkinson's Disease Screening from Face and Voice through Mechanistic Interpretability
- arxiv url: http://arxiv.org/abs/2608.08976v1
- Date: Mon, 10 Aug 2026 00:43:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.025686
- Title: Label-Free Parkinson's Disease Screening from Face and Voice through Mechanistic Interpretability
- Title(参考訳): メカニスティック・インタラクタビリティによる無ラベルパーキンソン病の顔と声のスクリーニング
- Abstract要約: パーキンソン病(英: Parkinson's disease、PD)は、神経変性疾患の2番目に多い疾患である。
そこで本研究では,凍結事前学習エンコーダをベースとした無ラベル顔+音声PDスクリーンを提案する。
合成劣化型CAA検出器は、合成疾患方向と実際の疾患方向のコサイン類似度が0を超えると機能することを示す。
- 参考スコア(独自算出の注目度): 4.241413288920499
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Parkinson's disease (PD) is the second most common neurodegenerative disorder. Typical machine learning screening methods require PD labels, but the available data is limited by privacy concerns and the need for expert annotation. We propose a label-free face-plus-voice PD screen built entirely on frozen pretrained encoders--a face-expression Vision Transformer and HuBERT--in which no PD label touches any fit; the reference is training controls only. The voice modality uses a synthetic-dysarthria contrastive activation addition (CAA) direction built from time-stretch and breathy degradation of healthy speech; the face modality uses a k-nearest-neighbor anomaly score to the control embedding cluster. We introduce the alignment principle, a post-hoc analysis showing that a synthetic-degradation CAA detector works when the cosine similarity between the synthetic and real disease directions exceeds zero. Measured on the YouTubePD benchmark, this cosine is +0.37 for voice (CAA works, AUROC 0.765) and -0.48 for face (CAA fails; anomaly succeeds, AUROC 0.751). Equal-weight late fusion reaches AUROC 0.802 (95% CI [0.70,0.89]) with NPV 0.95, supporting a rule-out triage interpretation. An overfitting audit shows the voice detector transfers cleanly, while the face-side--and thus fused--AUROC is potentially optimistic pending external validation.
- Abstract(参考訳): パーキンソン病(英: Parkinson's disease、PD)は、神経変性疾患の2番目に多い疾患である。
典型的な機械学習スクリーニング方法はPDラベルを必要とするが、利用可能なデータはプライバシー上の懸念と専門家のアノテーションの必要性によって制限されている。
本研究では,凍結事前訓練エンコーダとHuBERTをベースとした,PDラベルが適合しないラベルフリーのPDスクリーンを提案する。
音声モダリティは、健常音声の時間伸縮及び呼吸劣化から構築された合成ジストロフィー造影アクティベーション付加(CAA)方向を使用し、顔モダリティは、制御埋め込みクラスタにk-アネレスト近傍異常スコアを使用する。
合成劣化型CAA検出器は, 合成疾患方向と実際の疾患方向のコサイン類似度が0を超えると機能することを示す。
YouTubePDベンチマークで測定されたこのコサインは、音声用+0.37(AUROC 0.765)、顔用-0.48(CAAは失敗、異常な成功、AUROC 0.751)である。
等重量後期核融合は NPV 0.95 で AUROC 0.802 (95% CI [0.70,0.89]) に達する。
オーバーフィッティング監査では、ボイス検出器がきれいに転送され、フェイスサイドが融合し、AUROCは外部の検証を控えて楽観的になる可能性がある。
関連論文リスト
- CARDEA: Auditable Reasoning Grounded in Spatial Evidence for End-to-End Coronary Angiography Interpretation [0.0]
既存のAIシステムは一貫性を向上させることができるが、監査可能な意思決定プロセスが欠如している。
我々はCAGパイプラインの推論コアとして機能する統合された大きな視覚言語モデルであるCARDEAを開発した。
CARDEAは、選択から研究レベルの診断を通じて、生のマルチビュービデオからエンドツーエンドのCAGパイプラインを実行する。
論文 参考訳(メタデータ) (2026-09-07T02:01:27Z) - Physiological Signals as a Forensic Modality for Talking-Face Deepfake Detection [0.0]
ディープスワップ生成(TF)は、静止音源画像とauフェイク信号からフォトレアロスティックな顔映像を合成し、現在の画像ベースの検出器が常に識別できない偽造物を生成する。
本稿では、RhythmFormerを介してビデオ単位のr波を抽出し、実信号の識別のために軽量な分類器群を訓練する検出フレームワークを提案する。
論文 参考訳(メタデータ) (2026-07-23T19:47:15Z) - Post-Operative Glioma Segmentation via Loss Stabilization, Normalization and Subspace Attention [46.03321798937855]
ドメインシフトの際,GDL(Generalized Dice Loss)が不安定であることを示す。
本稿では,ボトルネック機能を再校正するサブスペース・アウェア・クラス・アテンション(SACA)モジュールを提案し,腫瘍の感度を8%向上させる。
論文 参考訳(メタデータ) (2026-07-23T09:59:30Z) - Fine-tuning LLMs for Passive Depression Severity Estimation from AI Mental Health Dialogue [4.051184721197422]
うつ病は世界の障害の主要な原因であり、症状の早期発見は時間的介入に不可欠である。
我々は、ユーザーが自己申告措置を完了することなく、AIメンタルヘルスプラットフォームにおける受動的かつ継続的な症状モニタリングを提案する。
論文 参考訳(メタデータ) (2026-06-16T14:28:47Z) - Amplifying, Not Learning: Fine-Tuned AI Text Detectors Amplify a Pretrained Direction [51.56484100374058]
テキスト検出器は、事前訓練された典型軸を増幅する。
タスク監督前の生エンコーダでは、3つのアーキテクチャでNYT-vs-HC3 AUROC 0.806/0.944/0.834を達成する。
RoBERTaベースでは、生のプロジェクションは微調整を超えるが、RoBERTaベースでは、フル微調整は、試験された流線型人口の双方で生よりも識別を小さくする。
論文 参考訳(メタデータ) (2026-05-20T19:08:38Z) - Neural Uncertainty Principle: A Unified View of Adversarial Fragility and LLM Hallucination [60.197429875410286]
大規模言語モデルにおける視覚と幻覚の対立的脆弱性は、伝統的に別の問題と見なされている。
損失誘起状態下でのニューラル不確実性原理(NUP)の定式化により, ほぼバウンド状態においては, さらなる圧縮は感度分散の増大を伴うことが判明した。
視覚では、高度に結合したコンポーネントをマスキングすることで、コストのかかる敵の訓練なしに堅牢性を向上させる。
言語では、任意の応答トークンを生成する前に、同じプレフィルステージプローブが幻覚リスクを検出する。
論文 参考訳(メタデータ) (2026-03-20T02:07:10Z) - From Black Box to Glass Box: Cross-Model ASR Disagreement to Prioto Review in Ambient AI Scribe Documentation [43.148402136307716]
異種ASRシステム間のクロスモデル不一致は、基準のない不確実性信号として機能する。
商用APIとオープンソースエンジンにまたがる8つのASRシステムを備えた,50の公開医療用オーディオクリップを転写した。
低アグリメント領域は内容の不一致に富み、高リスク質量のクインタイル全体では53.9%から73.9%に増加した。
論文 参考訳(メタデータ) (2026-03-02T13:02:13Z) - I Detect What I Don't Know: Incremental Anomaly Learning with Stochastic Weight Averaging-Gaussian for Oracle-Free Medical Imaging [2.384534878752428]
異常ラベルを使わずに,信頼度の高い正規サンプル群を漸進的に拡張する,教師なしのオラクルフリーフレームワークを導入する。
凍結した事前訓練された視覚バックボーンは、小さな畳み込みアダプタで拡張され、無視できる計算オーバーヘッドを伴う高速なドメイン適応が保証される。
COVID-CXRでは、ROC-AUCは0.9489から0.9982に改善され、肺炎CXRでは0.6834から0.8968に上昇し、脳MRIではND-5では0.6041から0.7269に上昇する。
論文 参考訳(メタデータ) (2025-11-05T23:28:14Z) - Motion2Meaning: A Clinician-Centered Framework for Contestable LLM in Parkinson's Disease Gait Interpretation [0.8230528541914085]
Motion2Meaningは、Contestable AIを前進させるクリニック中心のフレームワークである。
システムを構成する3つの重要なコンポーネントは、歩行データ可視化インタフェース(GDVI)、1次元畳み込みニューラルネットワーク(1D-CNN)で、Hoehn & Yahrの重大度を予測し、Contestable Interface(CII)である。
XMEDは、誤った予測における説明の不一致の5倍の増大を検出することにより、モデル不確実性をうまく識別する。
我々のLCMを利用したインタフェースにより、臨床医は正しい予測を検証し、モデルのエラーの一部に挑戦できる。
論文 参考訳(メタデータ) (2025-10-21T12:04:58Z) - A Novel Attention-Augmented Wavelet YOLO System for Real-time Brain Vessel Segmentation on Transcranial Color-coded Doppler [49.03919553747297]
我々は,脳動脈を効率よく捉えることができるAIを利用したリアルタイムCoW自動分割システムを提案する。
Transcranial Color-coded Doppler (TCCD) を用いたAIによる脳血管セグメンテーションの事前研究は行われていない。
提案したAAW-YOLOは, 異方性および対側性CoW容器のセグメンテーションにおいて高い性能を示した。
論文 参考訳(メタデータ) (2025-08-19T14:41:22Z) - Instant automatic diagnosis of diabetic retinopathy [36.2143325805188]
OphtAIは、眼のラテラルを認識し、参照可能なDRを検出し、DR重症度を評価するために訓練された畳み込みニューラルネットワークのアンサンブルに依存している。
システムは164,660のスクリーニング手順から,733,848の画像のデータセットを用いて開発,検証した。
OphtAIは、FDAが認可している唯一のAIシステムよりも安全で高速で包括的だ。
論文 参考訳(メタデータ) (2019-06-12T08:34:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。