論文の概要: HealthLoopQA: A Context-Aware Question Answering Benchmark for Interpreting Wearable Monitoring Data in Diabetes Care
- arxiv url: http://arxiv.org/abs/2609.06976v1
- Date: Mon, 07 Sep 2026 03:11:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.346541
- Title: HealthLoopQA: A Context-Aware Question Answering Benchmark for Interpreting Wearable Monitoring Data in Diabetes Care
- Title(参考訳): HealthLoopQA: 糖尿病患者のウェアラブルモニタリングデータの解釈のためのコンテキスト対応質問回答ベンチマーク
- Abstract要約: 連続糖尿病モニタリングデータよりも大きな言語モデル(LLM)を評価するための診断ベンチマークであるHealthLoopQAを紹介する。
HealthLoopQAは、プロセスマイニング、異常検出、30日間の水平線の予測にまたがる127のタスクと1500以上のQAインスタンスで構成されている。
実世界のデータセットを、様々なデバイス障害とサイバー物理攻撃をモデル化したフォールトインジェクトシミュレーションテストベッドで補完し、生理学的に妥当なハザードシナリオを生成する。
- 参考スコア(独自算出の注目度): 25.340084694880048
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: As medical wearables become integrated into daily chronic disease care, effectively interpreting longitudinal monitoring data is essential for patients and clinicians to understand health trends, detect safety-critical events, and make informed decisions. While large language models (LLMs) show promise for transforming this streaming physiological data into personalized health insights, evaluating their reasoning capability and analytical rigor in diverse monitoring tasks remains a fundamental challenge. Existing medical wearable question answering (QA) benchmarks primarily assess short-horizon classification or statistical summaries, largely ignoring the long-term patterns, therapeutic and behavioural contexts, and potential system failures inherent in real-world deployments. To address this, we introduce HealthLoopQA, a comprehensive diagnostic benchmark for evaluating LLM reasoning over continuous diabetes monitoring data. Grounded in a novel taxonomy of eleven atomic reasoning abilities, HealthLoopQA comprises 127 tasks and over 1,500 QA instances spanning process mining, anomaly detection, and prediction over 30-day horizons. To systematically evaluate safety awareness, we complement real-world datasets with a fault-injected simulation testbed modeling diverse device malfunctions and cyber-physical attacks to generate physiologically plausible hazard scenarios. Evaluating state-of-the-art LLMs across prompting and agentic frameworks reveals severe limitations in complex temporal pattern mining. Furthermore, we identify a broader phenomenon of In-context Laziness under long-context prompting, highlighting critical open challenges in deploying LLMs for rigorous long-horizon medical reasoning.
- Abstract(参考訳): 医療ウェアラブルが日常の慢性疾患医療に統合されるにつれて、患者や臨床医が健康動向を理解し、安全に重要な事象を検出し、情報的な決定を下すために、経時的モニタリングデータを効果的に解釈することが不可欠である。
大規模言語モデル(LLM)は、このストリーミング生理データをパーソナライズされたヘルスインサイトに変換することを約束しているが、様々なモニタリングタスクにおいて、その推論能力と分析上の厳密さを評価することは、依然として根本的な課題である。
既存の医療ウェアラブル質問応答(QA)ベンチマークは、主に短期の分類や統計的な要約を評価し、長期的なパターン、治療と行動の文脈、および実際の展開に固有のシステム障害を無視している。
これを解決するために、連続糖尿病モニタリングデータよりもLCM推論を評価するための総合的な診断ベンチマークHealthLoopQAを導入する。
HealthLoopQAは、プロセスマイニング、異常検出、30日間の地平線上の予測にまたがる127のタスクと1500以上のQAインスタンスで構成されている。
安全意識を体系的に評価するために,種々のデバイス障害とサイバー物理攻撃をモデル化したフォールトインジェクト・シミュレーション・ベッドを用いて実世界のデータセットを補完し,生理学的に妥当なハザードシナリオを生成する。
プロンプトおよびエージェント・フレームワークにわたる最先端のLCMの評価は、複雑な時間的パターンマイニングにおいて重大な制限を生じさせる。
さらに,LLMを厳密なロングホライズン医学的推論のために展開する上で重要なオープン課題を浮き彫りにした。
関連論文リスト
- Towards a General Intelligence and Interface for Wearable Health Data [45.854819784803055]
本研究では,1兆分以上の未ラベルセンサ信号に基づいて,ウェアラブルヘルスの基盤モデルを提案する。
この集団スケールの表現は、ラベル効率のよい少数ショット学習と生成能力を有効化して、1日あたりのロバストな計量推定を行う。
論文 参考訳(メタデータ) (2026-05-21T17:24:06Z) - A Multi-Dimensional Clustering Approach for Identifying Inborn Errors of Immunity [40.41295591212923]
新生児免疫不全(IEI)のような希少な疾患は、臓器の損傷を予防し、生活の質を向上させるために早期診断を必要とする。
IEIにおけるパターン認識のための機械学習(ML)アルゴリズムの開発は限られている。
本研究は,IEIの特徴認識を洗練させ,まれな疾患集団分析のためのデータツールキットを開発し,教師なしMLで解釈可能なデータ構造における複雑な医療記録の変換を拡大する。
論文 参考訳(メタデータ) (2026-05-16T03:29:36Z) - VitalDiagnosis: AI-Driven Ecosystem for 24/7 Vital Monitoring and Chronic Disease Management [16.145016231691972]
VitalDiagnosisは、慢性疾患の管理を受動的モニタリングから、能動的で対話的なエンゲージメントに移行するためのエコシステムである。
ウェアラブルデバイスからの連続データをLCMの推論能力と統合することにより、システムは急性の健康異常と定期的な順守の両方に対処する。
このアプローチは,患者の自己管理を向上し,回避可能な臨床作業量を削減し,より積極的で協調的なケアパラダイムを促進することを目的としている。
論文 参考訳(メタデータ) (2026-01-22T09:31:19Z) - Benchmarking Egocentric Clinical Intent Understanding Capability for Medical Multimodal Large Language Models [48.95516224614331]
MedGaze-Benchは、臨床医の視線を認知的カーソルとして活用し、手術、緊急シミュレーション、診断解釈における意図的理解を評価する最初のベンチマークである。
本ベンチマークでは,解剖学的構造の視覚的均一性,臨床における時間・因果依存性の厳格化,安全プロトコルへの暗黙の順守という3つの基本的な課題に対処する。
論文 参考訳(メタデータ) (2026-01-11T02:20:40Z) - A Proposed Paradigm for Imputing Missing Multi-Sensor Data in the Healthcare Domain [1.0927928652289287]
本研究では、既存のデータセットの限界について検討し、低血糖予測に関連する重要な特徴の時間的特徴を強調した。
特定の特徴の性質や欠落間隔の持続時間に合わせて計算戦略を調整した体系的パラダイムが提案されている。
論文 参考訳(メタデータ) (2026-01-07T04:23:47Z) - AURA: Development and Validation of an Augmented Unplanned Removal Alert System using Synthetic ICU Videos [1.8993428741072542]
集中治療室 (ICUs) における非計画的外挿 (UE) の重要性
AURA(Augmented Unplanned removal Alert)は、完全に合成されたビデオデータセットに基づいて開発・検証された視覚ベースのリスク検出システムである。
論文 参考訳(メタデータ) (2025-11-15T14:52:37Z) - Medical Reasoning in the Era of LLMs: A Systematic Review of Enhancement Techniques and Applications [59.721265428780946]
医学における大きな言語モデル(LLM)は印象的な能力を実現しているが、体系的で透明で検証可能な推論を行う能力に重大なギャップが残っている。
本稿は、この新興分野に関する最初の体系的なレビューを提供する。
本稿では,学習時間戦略とテスト時間メカニズムに分類した推論強化手法の分類法を提案する。
論文 参考訳(メタデータ) (2025-08-01T14:41:31Z) - Stress Monitoring in Healthcare: An Ensemble Machine Learning Framework Using Wearable Sensor Data [0.0]
本研究では,生理的信号,脳活動,心拍数,皮膚温度などのデータセットを紹介する。
これらの課題を克服するため、データセットはSMOTE(Synthetic Minority Over sample Technique)で事前処理が行われた。
Random Forest、XGBoost、Multi-Layer Perceptron(MLP)といった先進的な機械学習モデルを評価し、スタックに組み合わせて、それらの予測強度を活用した。
論文 参考訳(メタデータ) (2025-07-10T09:47:56Z) - A Vector-Quantized Foundation Model for Patient Behavior Monitoring [41.48188433408574]
本稿では,スマートフォンやウェアラブルデバイスからの実世界のデータを処理するために設計されたベクトル量子化変分自動エンコーダを改良した基礎モデルを提案する。
本研究では, 個別の潜伏表現を利用して, 微調整を必要とせず, 2つの下流課題, 自殺リスク評価, 情緒的状態予測を効果的に実施した。
論文 参考訳(メタデータ) (2025-03-19T14:01:16Z) - Machine Learning Applications in Medical Prognostics: A Comprehensive Review [0.0]
機械学習(ML)は、高度なアルゴリズムと臨床データを統合することで、医学的診断に革命をもたらした。
RFモデルは高次元データの処理において堅牢な性能を示す。
CNNは、がん検出において異常な精度を示している。
LSTMネットワークは、時間的データの解析に優れ、臨床劣化の正確な予測を提供する。
論文 参考訳(メタデータ) (2024-08-05T09:41:34Z) - Clairvoyance: A Pipeline Toolkit for Medical Time Series [95.22483029602921]
時系列学習は、データ駆動の*クリニカルな意思決定支援のパンとバターである*
Clairvoyanceは、ソフトウェアツールキットとして機能する、統合されたエンドツーエンドのオートMLフレンドリなパイプラインを提案する。
Clairvoyanceは、臨床時系列MLのための包括的で自動化可能なパイプラインの生存可能性を示す最初のものである。
論文 参考訳(メタデータ) (2023-10-28T12:08:03Z) - Remote Medication Status Prediction for Individuals with Parkinson's
Disease using Time-series Data from Smartphones [75.23250968928578]
本稿では,パーキンソン病患者のmPowerデータセットを用いて薬剤状態を予測する方法を提案する。
提案手法は,3つの薬物状態を客観的に予測する上で有望な結果を示す。
論文 参考訳(メタデータ) (2022-07-26T02:08:08Z) - MIA-Prognosis: A Deep Learning Framework to Predict Therapy Response [58.0291320452122]
本稿では,患者の予後と治療反応を予測するための統合型深層学習手法を提案する。
我々は,マルチモーダル非同期時系列分類タスクとして,確率モデリングを定式化する。
我々の予測モデルは、長期生存の観点から、低リスク、高リスクの患者をさらに階層化する可能性がある。
論文 参考訳(メタデータ) (2020-10-08T15:30:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。