論文の概要: WearableQA: A Benchmark for Health Reasoning over Real-World Wearable Data
- arxiv url: http://arxiv.org/abs/2609.05405v1
- Date: Fri, 04 Sep 2026 17:52:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-07 18:15:24.14919
- Title: WearableQA: A Benchmark for Health Reasoning over Real-World Wearable Data
- Title(参考訳): WearableQA: 現実のウェアラブルデータに対するヘルス推論のベンチマーク
- Abstract要約: WearableQAは、実際のユーザの経時的ウェアラブルレコードに対するAIシステムの推論を評価するためのベンチマークである。
我々は,2つの相補的軸に沿って整理された16の質問型(データ対健康推論,シングル対信号間推論)を紹介した。
14のプロプライエタリでオープンソースのLCMの評価は、WearableQAがモデル機能を効果的に差別化し、性能は19.6%から72.9%であり、10%の確率ベースラインであることを示している。
- 参考スコア(独自算出の注目度): 37.47499553332249
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent advances in wearable sensing enable continuous monitoring of physiological and behavioral signals, yet existing benchmarks rarely evaluate whether AI systems can reason over a real user's longitudinal wearable record. We introduce WearableQA, a benchmark comprising 4,084 10-option multiple-choice questions constructed from the wearable time series, blood biomarkers, and demographics of 200 real users, each with up to 500 days of daily measurements. WearableQA preserves authentic wearable distributions that include device noise and inter-individual variability. To evaluate distinct reasoning capabilities, we introduce 16 question types organized along two complementary axes: data versus health reasoning, which distinguishes computation over longitudinal measurements from physiological interpretation; and single- versus cross-signal reasoning, which separates reasoning about individual signals from the integration of multiple signals. To construct reliable questions at scale, we adopt a dual-grounding framework that combines literature-grounded physiological findings with statistically validated population-grounded physiological patterns. This enables the capture of meaningful relationships observed in real-world wearable data. Evaluation of 14 proprietary and open-source LLMs demonstrates that WearableQA effectively differentiates model capabilities, with performance ranging from 19.6% to 72.9% against a 10% chance baseline. Moreover, WearableQA remains far from solved: most models achieve accuracies below 60%. Overall, WearableQA provides a realistic and diagnostic benchmark for evaluating LLM reasoning over real-world wearable data.
- Abstract(参考訳): ウェアラブルセンシングの最近の進歩は、生理的および行動的な信号の連続的なモニタリングを可能にするが、既存のベンチマークでは、AIシステムが実際のユーザの経時的ウェアラブル記録を推論できるかどうかをほとんど評価していない。
我々は,ウェアラブル時系列,血液バイオマーカー,200人の実ユーザから構築された4,084の10オプションの複数選択質問からなるベンチマークであるWearableQAを紹介した。
WearableQAは、デバイスノイズや個人間の変動を含む、本物のウェアラブル分布を保存する。
本研究では,データと健康推論の2つの相補的軸に沿って構成された16種類の質問タイプについて,縦断的測定と生理的解釈とを区別するデータと,複数の信号の統合から個々の信号の推論を分離するシングル信号とクロス信号の推論を導入する。
信頼性の高い質問を大規模に構築するために,文献的基盤の生理的知見と統計的に検証された人口的基盤の生理的パターンを組み合わせた二重接地フレームワークを採用する。
これにより、現実世界のウェアラブルデータで観察される意味のある関係をキャプチャできる。
14のプロプライエタリでオープンソースのLCMの評価は、WearableQAがモデル機能を効果的に差別化し、性能は19.6%から72.9%であり、10%の確率ベースラインであることを示している。
さらに、WearableQAは解決には程遠い。ほとんどのモデルは60%未満の精度を達成する。
全体として、WearableQAは、現実のウェアラブルデータよりもLCM推論を評価するための、現実的で診断的なベンチマークを提供する。
関連論文リスト
- NovGauge: A Fine-Grained Benchmark for Diagnosing LLMs' Capability in Paper Novelty Assessment [54.4265627247104]
大規模言語モデル(LLM)は、主要なAIカンファレンスでピアレビューでますます使用されている。
既存のベンチマークでは、ノベルティを1つの総合的なスコアとして評価している。
本報告では,詳細なノベルティアセスメント診断のための人手によるベンチマークであるNovGaugeについて述べる。
論文 参考訳(メタデータ) (2026-09-10T08:34:56Z) - HealthLoopQA: A Context-Aware Question Answering Benchmark for Interpreting Wearable Monitoring Data in Diabetes Care [25.340084694880048]
連続糖尿病モニタリングデータよりも大きな言語モデル(LLM)を評価するための診断ベンチマークであるHealthLoopQAを紹介する。
HealthLoopQAは、プロセスマイニング、異常検出、30日間の水平線の予測にまたがる127のタスクと1500以上のQAインスタンスで構成されている。
実世界のデータセットを、様々なデバイス障害とサイバー物理攻撃をモデル化したフォールトインジェクトシミュレーションテストベッドで補完し、生理学的に妥当なハザードシナリオを生成する。
論文 参考訳(メタデータ) (2026-09-07T03:11:34Z) - Rethinking the Evaluation and Optimization of LLM-Based Social Simulation [56.18577997572273]
主観性係数を用いて、主観性が高くなるにつれて、精度に基づく評価とハードラベルトレーニングがいかに失敗するかを分析する。
我々は193のアノテーションと100の主観的質問を含む19,300の文脈のベンチマークであるSUBJSIMを構築した。
SUBJSIMの結果は,本手法の利点を示すものである。
論文 参考訳(メタデータ) (2026-08-20T06:26:03Z) - Full-Self Diagnostics (FSD): Physics-Grounded Visual Biomarker Inference from Smartphone Video via Inverse Problems and Operator Learning [0.0]
Full-Self Diagnostics (FSD) は、制限のない9秒の顔ビデオから潜伏する生理的状態を回復するための統一的な数学的枠組みである。
59名の被験者を対象に,実世界の38812個のペアスキャンの実証検証を行った。
その結果, 一般消費者の顔画像は, 完全に制約のない条件下での, 臨床的に関係のない非侵襲的推論のための十分な構造化情報を符号化していることがわかった。
論文 参考訳(メタデータ) (2026-06-11T20:26:47Z) - Towards a General Intelligence and Interface for Wearable Health Data [45.854819784803055]
本研究では,1兆分以上の未ラベルセンサ信号に基づいて,ウェアラブルヘルスの基盤モデルを提案する。
この集団スケールの表現は、ラベル効率のよい少数ショット学習と生成能力を有効化して、1日あたりのロバストな計量推定を行う。
論文 参考訳(メタデータ) (2026-05-21T17:24:06Z) - ESL-Bench: An Event-Driven Synthetic Longitudinal Benchmark for Health Agents [10.567096101127886]
ESLBenchは100人の合成ユーザを提供するイベント駆動合成フレームワークである。
ツール,DBネイティブエージェント,メモリ拡張RAGでLLMにまたがる13の手法を評価した。
論文 参考訳(メタデータ) (2026-04-03T07:55:56Z) - A Neuro-Symbolic System for Interpretable Multimodal Physiological Signals Integration in Human Fatigue Detection [3.430778683859764]
眼球運動動態,視線安定性,前頭前血行動態,マルチモーダルの4つの解釈可能な生理的概念を,視線追跡と神経血行動態,機能的近赤外分光,注意に基づくエンコーダを用いたFNIRSウィンドウから学習し,学習重量とソフトしきい値を用いた近似的推論規則と組み合わせた。
本システムは, 正確かつ解釈可能なモデルを必要とする領域であるマルチモーダル生理信号からの疲労分類に応用する。
論文 参考訳(メタデータ) (2026-03-25T14:41:02Z) - Medical Imaging AI Competitions Lack Fairness [50.895929923643905]
課題データセットが現実の臨床的多様性を代表するものなのか、FAIR原則に従ってアクセス可能で法的に再利用可能なものなのか、という2つの相補的な側面に沿って公正性を評価する。
本研究の結果は, 地理的位置, モダリティ, 問題型関連バイアスなどのデータセット構成に有意な偏りがみられ, 現在のベンチマークは実世界の臨床多様性を十分に反映していないことが示唆された。
これらの欠点は、ベンチマークエコシステムの基本的な制限を明らかにし、リーダボードの成功と臨床関連性との間の断絶を浮き彫りにします。
論文 参考訳(メタデータ) (2025-12-19T13:48:10Z) - Toward Foundation Model for Multivariate Wearable Sensing of Physiological Signals [2.370585289844609]
本稿では,ウェアラブルセンシングデータから情報表現を抽出するための,最初のマルチモーダル・ユビキタス基盤モデルを提案する。
具体的には,センサ内およびセンサ間の両方の信号パターンを検出するための特別な連絡トークンを共用したチャネル認識型アテンション機構を設計する。
本モデルでは, メンタルヘルス, 身体状態推定, バイタルサイン推定, 疾患リスク評価など, 11のパブリックなウェアラブルセンシングデータセットに対して, 異常な一般化性を示す。
論文 参考訳(メタデータ) (2024-12-12T23:35:18Z) - Video-based Remote Physiological Measurement via Cross-verified Feature
Disentangling [121.50704279659253]
非生理的表現と生理的特徴を混同するための横断的特徴分離戦略を提案する。
次に, 蒸留された生理特性を用いて, 頑健なマルチタスク生理測定を行った。
歪んだ特徴は、最終的に平均HR値やr信号のような複数の生理的信号の合同予測に使用される。
論文 参考訳(メタデータ) (2020-07-16T09:39:17Z) - Hemogram Data as a Tool for Decision-making in COVID-19 Management:
Applications to Resource Scarcity Scenarios [62.997667081978825]
新型コロナウイルス(COVID-19)のパンデミックは世界中の緊急対応システムに挑戦している。
本研究は, 症状患者の血液検査データから得られた機械学習モデルについて述べる。
提案されたモデルでは、新型コロナウイルスqRT-PCRの結果を、高い精度、感度、特異性で症状のある個人に予測することができる。
論文 参考訳(メタデータ) (2020-05-10T01:45:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。