論文の概要: Voice EHR: Introducing Multimodal Audio Data for Health
- arxiv url: http://arxiv.org/abs/2404.01620v1
- Date: Tue, 2 Apr 2024 04:07:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2024-04-03 17:58:09.536273
- Title: Voice EHR: Introducing Multimodal Audio Data for Health
- Title(参考訳): Voice EHR: 健康のためのマルチモーダルオーディオデータの導入
- Abstract要約: 本報告では、モバイル/ウェブアプリケーションのみを用いて、ガイド付き質問を通じて健康データをキャプチャする新しいデータ型とそれに対応する収集システムを紹介する。
このアプリケーションは最終的に、従来の音声/呼吸機能、音声パターン、意味のある言語から健康の複雑なバイオマーカーを含む音声電子健康記録(ボイスEHR)をもたらす。
- 参考スコア(独自算出の注目度): 3.912664056049194
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large AI models trained on audio data may have the potential to rapidly classify patients, enhancing medical decision-making and potentially improving outcomes through early detection. Existing technologies depend on limited datasets using expensive recording equipment in high-income, English-speaking countries. This challenges deployment in resource-constrained, high-volume settings where audio data may have a profound impact. This report introduces a novel data type and a corresponding collection system that captures health data through guided questions using only a mobile/web application. This application ultimately results in an audio electronic health record (voice EHR) which may contain complex biomarkers of health from conventional voice/respiratory features, speech patterns, and language with semantic meaning - compensating for the typical limitations of unimodal clinical datasets. This report introduces a consortium of partners for global work, presents the application used for data collection, and showcases the potential of informative voice EHR to advance the scalability and diversity of audio AI.
- Abstract(参考訳): オーディオデータに基づいてトレーニングされた大規模なAIモデルは、患者を迅速に分類し、医療上の意思決定を強化し、早期発見を通じて結果を改善する可能性がある。
既存の技術は、高所得の英語圏で高価な記録装置を使用する限られたデータセットに依存している。
これにより、オーディオデータが大きな影響を与える可能性のある、リソース制約のある高ボリューム設定へのデプロイメントが困難になる。
本報告では、モバイル/ウェブアプリケーションのみを用いて、ガイド付き質問を通じて健康データをキャプチャする新しいデータ型とそれに対応する収集システムを紹介する。
このアプリケーションは最終的に、従来の音声/呼吸機能、音声パターン、意味のある言語から健康の複雑なバイオマーカーを含む音声電子健康記録(ボイスEHR)を出力し、単調な臨床データセットの典型的な制限を補う。
本報告では、グローバルな作業のためのパートナーのコンソーシアムを紹介し、データ収集に使用されるアプリケーションを紹介し、音声AIのスケーラビリティと多様性を向上するために、インフォメーション音声EHRの可能性を示す。
関連論文リスト
- Speech-to-SOAP: End-to-End Summarization of Medical Dialogues: KIT@BeTraC 2026 [62.221439619588914]
我々は、KITのこの年に提出したBeTraCチャレンジを軽量トラックで紹介する。
我々の主な貢献は、多種多様な医療対話データセットを合成音声生成と自動生成SOAP監視によって統合するスケーラブルなデータ拡張パイプラインである。
論文 参考訳(メタデータ) (2026-08-25T09:51:03Z) - RA-QA: Towards Respiratory Audio-based Health Question Answering [17.905364553833724]
呼吸器疾患は世界的な死因の1つであり、早期かつアクセス可能なスクリーニング方法の緊急の必要性を強調している。
自然言語を使ったリアルタイムのコンサルティングで対話できるインテリジェントシステムの欠如は、依然として重要なギャップである。
第1回呼吸音響質問応答データセットを構築するため,11種類の呼吸オーディオデータセットから収集したデータをキュレートし,調和させた。
論文 参考訳(メタデータ) (2026-02-04T13:25:47Z) - A Fully Open and Generalizable Foundation Model for Ultrasound Clinical Applications [77.3888788549565]
一般臨床用超音波基礎モデルであるEchoCareについて紹介する。
我々は、キュレートされた、一般公開された大規模なデータセットであるEchoCareData上で、自己教師付き学習を通じてEchoCareを開発した。
最小限のトレーニングで、EchoCareは10の代表的なベンチマークで最先端の比較モデルを上回っている。
論文 参考訳(メタデータ) (2025-09-15T10:05:31Z) - Extracting OPQRST in Electronic Health Records using Large Language Models with Reasoning [3.486461799078777]
本稿では,Large Language Models (LLM) の機能を活用して,EHRからOPQRSTアセスメントを抽出するための新しいアプローチを提案する。
本稿では,医師の認知過程を模倣する推論ステップをモデルに提供できるように,シーケンスラベリングからテキスト生成へタスクを再構成することを提案する。
当社のコントリビューションは、医療におけるAIの利用の大幅な進歩を示し、EHRからの情報抽出の正確性とユーザビリティを向上させるスケーラブルなソリューションを提供しています。
論文 参考訳(メタデータ) (2025-09-02T02:21:02Z) - A Comprehensive Review of Datasets for Clinical Mental Health AI Systems [55.67299586253951]
本稿では,AIを活用した臨床アシスタントの訓練・開発に関連する臨床精神保健データセットの総合的調査を行う。
本調査では, 縦断データの欠如, 文化・言語表現の制限, 一貫性のない収集・注釈基準, 合成データのモダリティの欠如など, 重要なギャップを明らかにした。
論文 参考訳(メタデータ) (2025-08-13T13:42:35Z) - CaReAQA: A Cardiac and Respiratory Audio Question Answering Model for Open-Ended Diagnostic Reasoning [17.462121203082006]
CaReAQAは、基礎的なオーディオモデルと大きな言語モデルの推論機能を統合するオーディオ言語モデルである。
メタデータを付加したアノテートされた医療オーディオ記録のベンチマークデータセットであるCaReSoundを紹介する。
評価の結果、CaReAQAは、オープンエンド診断推論タスクにおいて86.2%の精度を達成していることがわかった。
論文 参考訳(メタデータ) (2025-05-02T11:42:46Z) - RespLLM: Unifying Audio and Text with Multimodal LLMs for Generalized Respiratory Health Prediction [20.974460332254544]
RespLLMは、呼吸健康予測のためのテキストと音声の表現を統一する新しいフレームワークである。
我々の研究は、異種データの知覚、聴取、理解が可能なマルチモーダルモデルの基礎を築いた。
論文 参考訳(メタデータ) (2024-10-07T17:06:11Z) - SONAR: A Synthetic AI-Audio Detection Framework and Benchmark [59.09338266364506]
SONARはAI-Audio Detection FrameworkとBenchmarkの合成である。
最先端のAI合成聴覚コンテンツを識別するための総合的な評価を提供することを目的としている。
従来のモデルとファンデーションベースのディープフェイク検出システムの両方で、AIオーディオ検出を均一にベンチマークする最初のフレームワークである。
論文 参考訳(メタデータ) (2024-10-06T01:03:42Z) - Speaking the Same Language: Leveraging LLMs in Standardizing Clinical Data for AI [0.0]
本研究は、医療データの標準化など、特定の課題に対処するため、大規模言語モデルの採用を念頭においている。
この結果から,大規模言語モデルを用いることで手作業によるデータキュレーションの必要性が著しく低下することが示唆された。
提案手法は、医療におけるAIの統合を迅速化し、患者のケアの質を向上させるとともに、AIのためのデータ作成に必要な時間と資金を最小化する。
論文 参考訳(メタデータ) (2024-08-16T20:51:21Z) - Speech Emotion Recognition under Resource Constraints with Data Distillation [64.36799373890916]
音声感情認識(SER)は、人間とコンピュータの相互作用において重要な役割を果たす。
モノのインターネットにおけるエッジデバイスの出現は、複雑なディープラーニングモデルを構築する上での課題を示している。
本研究では,IoTアプリケーションにおけるSERモデルの効率的な開発を容易にするためのデータ蒸留フレームワークを提案する。
論文 参考訳(メタデータ) (2024-06-21T13:10:46Z) - BTS: Bridging Text and Sound Modalities for Metadata-Aided Respiratory Sound Classification [0.0]
音声サンプルのメタデータから派生した自由テキスト記述を用いて,事前学習したテキスト・オーディオ・マルチモーダルモデルを微調整する。
提案手法は,ICBHIデータセットの最先端性能を達成し,先行した最良値の1.17%を突破した。
論文 参考訳(メタデータ) (2024-06-10T20:49:54Z) - README: Bridging Medical Jargon and Lay Understanding for Patient Education through Data-Centric NLP [9.432205523734707]
医療用語を患者に親しみやすい平易な言語に簡略化することを目的とした,レイ定義の自動生成という新たなタスクを導入する。
このデータセットは、5万以上のユニークな(医療用語、日常の定義)ペアと30万の言及からなる。
また、データフィルタリング、拡張、選択を相乗化してデータ品質を改善する、データ中心のHuman-AIパイプラインも開発しました。
論文 参考訳(メタデータ) (2023-12-24T23:01:00Z) - Radiology Report Generation Using Transformers Conditioned with
Non-imaging Data [55.17268696112258]
本稿では,胸部X線画像と関連する患者の人口統計情報を統合したマルチモーダルトランスフォーマーネットワークを提案する。
提案ネットワークは、畳み込みニューラルネットワークを用いて、CXRから視覚的特徴を抽出し、その視覚的特徴と患者の人口統計情報のセマンティックテキスト埋め込みを組み合わせたトランスフォーマーベースのエンコーダデコーダネットワークである。
論文 参考訳(メタデータ) (2023-11-18T14:52:26Z) - Analysing the Impact of Audio Quality on the Use of Naturalistic
Long-Form Recordings for Infant-Directed Speech Research [62.997667081978825]
早期言語習得のモデリングは、幼児が言語スキルをブートストラップする方法を理解することを目的としている。
近年の進歩により、より自然主義的なトレーニングデータを計算モデルに利用できるようになった。
音質がこれらのデータに対する分析やモデリング実験にどう影響するかは、現時点では不明である。
論文 参考訳(メタデータ) (2023-05-03T08:25:37Z) - Deep Feature Learning for Medical Acoustics [78.56998585396421]
本研究の目的は,医療音響の課題における学習内容の比較である。
ヒトの呼吸音と心臓の鼓動を健康的または病態の影響の2つのカテゴリに分類する枠組みが実装されている。
論文 参考訳(メタデータ) (2022-08-05T10:39:37Z) - Cross-Modal Information Maximization for Medical Imaging: CMIM [62.28852442561818]
病院では、同じ情報を異なるモダリティの下で利用できるようにする特定の情報システムにデータがサイロ化される。
これは、テスト時に常に利用できないかもしれない同じ情報の複数のビューを列車で取得し、使用するためのユニークな機会を提供する。
テスト時にモダリティの低下に耐性を持つマルチモーダル入力の優れた表現を学習することで、利用可能なデータを最大限活用する革新的なフレームワークを提案する。
論文 参考訳(メタデータ) (2020-10-20T20:05:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。