論文の概要: Unlocking In-Context Learning in Audio-Language Models from Decentralized Medical Audio
- arxiv url: http://arxiv.org/abs/2606.23243v1
- Date: Mon, 22 Jun 2026 12:28:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-24 23:05:50.43645
- Title: Unlocking In-Context Learning in Audio-Language Models from Decentralized Medical Audio
- Title(参考訳): 分散医療オーディオを用いた音声言語モデルにおける文脈内学習のアンロック
- Authors: Ran Piao, Tsai-Ning Wang, Martijn den Dekker, Linda Moonen, Hareld Kemps, Yuan Lu, Aaqib Saeed,
- Abstract要約: 本稿では,テキスト内臨床オーディオ診断のための多モーダル言語モデルフレームワークであるフェデレーション・セルフコンテキスト化(FSC)を提案する。
FSCは音声表現の教師なしクラスタリングを通じて擬似ラベルエピソードを構築し、希少な実ラベルをバイパスする。
保留中の呼吸と心臓の状態では、FSCは2方向の2ショット評価において71.6%の精度を達成し、音声のベースラインを9%以上上回っている。
- 参考スコア(独自算出の注目度): 9.223303217530464
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Clinical audio diagnosis in low-resource settings requires models that identify conditions from minimal examples without large annotated corpora. We propose Federated Self-Contextualization (FSC), a multimodal language model framework for in-context clinical audio diagnosis across federated hospital clients. FSC constructs pseudo-label episodes via unsupervised clustering of audio representations, bypassing scarce real diagnostic labels, and enables contextual reasoning from support-query pairs. Our progressive three-stage pipeline first aligns audio embeddings with the language model via caption-based pretraining, then adapts it for episodic in-context inference through federated optimization. At test time, given a small labeled support set, the model diagnoses an unseen query through multimodal reasoning. On held-out respiratory and cardiac conditions, FSC achieves 71.6% accuracy in 2-way 2-shot evaluation, outperforming audio-language baselines by over 9%.
- Abstract(参考訳): 低リソース環境における臨床オーディオ診断には、注釈付きコーパスを伴わない最小限の例から条件を識別するモデルが必要である。
本稿では,統合病院のクライアント間でのコンテキスト内臨床オーディオ診断のためのマルチモーダル言語モデルフレームワークであるFederated Self-Contextualization (FSC)を提案する。
FSCは、音声表現の教師なしクラスタリングを通じて擬似ラベルエピソードを構築し、少ない実際の診断ラベルをバイパスし、サポートクエリペアからのコンテキスト推論を可能にする。
プログレッシブな3段階パイプラインは、まずキャプションベースの事前学習を通じて、音声埋め込みを言語モデルと整列させ、その後、フェデレートされた最適化を通じて、エピソディックなインコンテキスト推論に適応させる。
テスト時には、小さなラベル付きサポートセットが与えられた場合、モデルはマルチモーダル推論を通じて、目に見えないクエリを診断する。
保留中の呼吸と心臓の状態では、FSCは2方向の2ショット評価において71.6%の精度を達成し、音声のベースラインを9%以上上回っている。
関連論文リスト
- When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition [10.779774155043166]
我々は, 診断ラベル, 臨床医由来の音声評価, および徐々にリッチな臨床記述が, 変形性関節症音声の転写精度を向上させるかどうかを検証した。
診断インフォームドおよび臨床的に詳細なプロンプトは、無視できる改善をもたらし、しばしば単語誤り率を低下させる。
サブグループ分析により,ダウン症候群と軽度重度話者に有意な改善が認められた。
論文 参考訳(メタデータ) (2026-05-04T16:24:06Z) - StethoLM: Audio Language Model for Cardiopulmonary Analysis Across Clinical Tasks [14.936669090239548]
心肺蘇生に特化した最初の音声言語モデルであるStethoLMについて紹介する。
オースカルテーション分析の全スペクトルにわたって、インストラクション駆動の臨床タスクを実行することができる。
本研究は,臨床教育における指導追従型AIシステムの基礎を確立するものである。
論文 参考訳(メタデータ) (2026-02-27T22:39:23Z) - Resp-Agent: An Agent-Based System for Multimodal Respiratory Sound Generation and Disease Diagnosis [14.922065513695294]
Resp-Agent(Resp-Agent)は、アクティブアドリキュラムエージェント(Thinker-A$2$CA)によって編成された自律型マルチモーダルシステムである。
表現ギャップに対処するため,EHRデータをストラテジックグローバルアテンションを介して音声トークンで織り込むModality-Weaving Diagnoserを導入する。
データギャップに対処するために,テキストのみのLarge Language Model (LLM) をモダリティインジェクションにより適応させるフローマッチングジェネレータを設計する。
論文 参考訳(メタデータ) (2026-02-16T14:48:24Z) - PRiSM: Benchmarking Phone Realization in Speech Models [70.82595415252682]
音声認識(PR)は言語に依存しない言語間音声処理と音声解析のためのアトミックインタフェースとして機能する。
PRiSMは、音声知覚における盲点を明らかにするために設計された、最初のオープンソースベンチマークである。
論文 参考訳(メタデータ) (2026-01-20T15:00:36Z) - WESR: Scaling and Evaluating Word-level Event-Speech Recognition [59.21814194620928]
音声は言語情報だけでなく、笑ったり泣いたりするような豊富な非言語的な音声イベントも伝達する。
我々は,21の発声イベントの分類を改良し,個別(スタンドアローン)と連続(音声と混合)に分類した。
改良された分類法に基づくWESR-Benchは,新しい位置認識プロトコルを備えた専門家アノテート評価セット(900以上の発話)である。
論文 参考訳(メタデータ) (2026-01-08T02:23:21Z) - Language Models as Semantic Teachers: Post-Training Alignment for Medical Audio Understanding [15.79973026677169]
事前訓練された音響モデルは、聴力音の音響パターンを検出するのに優れるが、臨床的意義を把握できないことが多い。
AcuLaは、医療用言語モデルと整合することで、任意のオーディオエンコーダに意味理解を組み込むフレームワークである。
我々の研究は、このオーディオ言語アライメントが純粋に音響モデルから臨床的に認識される診断ツールに変換することを実証している。
論文 参考訳(メタデータ) (2025-12-04T14:30:58Z) - CLAIR-A: Leveraging Large Language Models to Judge Audio Captions [73.51087998971418]
機械生成オーディオキャプションの評価は、様々な要因を検討する必要がある複雑なタスクである。
本稿では,大規模言語モデルのゼロショット機能を活用するシンプルで柔軟なCLAIR-Aを提案する。
我々の評価では、CLAIR-Aは従来のメトリクスと比較して品質の人的判断を良く予測する。
論文 参考訳(メタデータ) (2024-09-19T17:59:52Z) - Multilingual Audio-Visual Speech Recognition with Hybrid CTC/RNN-T Fast Conformer [59.57249127943914]
本稿では,複数の改良を加えた多言語音声認識モデルを提案する。
我々は、6つの異なる言語に対する音声視覚訓練データの量を増やし、重複しない多言語データセットの自動書き起こしを生成する。
提案モデルでは, LRS3データセット上での新たな最先端性能を実現し, WERは0.8%に達した。
論文 参考訳(メタデータ) (2024-03-14T01:16:32Z) - Exploiting Cross-domain And Cross-Lingual Ultrasound Tongue Imaging
Features For Elderly And Dysarthric Speech Recognition [55.25565305101314]
調音機能は音響信号歪みに不変であり、音声認識システムにうまく組み込まれている。
本稿では,A2Aモデルにおける24時間TaLコーパスの並列音声・超音波舌画像(UTI)データを利用したクロスドメインおよびクロスランガルA2Aインバージョン手法を提案する。
生成した調音機能を組み込んだ3つのタスクの実験は、ベースラインのTDNNとコンフォーマーASRシステムより一貫して優れていた。
論文 参考訳(メタデータ) (2022-06-15T07:20:28Z) - Few-Shot Cross-lingual Transfer for Coarse-grained De-identification of
Code-Mixed Clinical Texts [56.72488923420374]
事前学習型言語モデル (LM) は低リソース環境下での言語間移動に大きな可能性を示している。
脳卒中におけるコードミキシング(スペイン・カタラン)臨床ノートの低リソース・実世界の課題を解決するために,NER (name recognition) のためのLMの多言語間転写特性を示す。
論文 参考訳(メタデータ) (2022-04-10T21:46:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。