論文の概要: ViSTA: A Simple Bridge Extends Visual Alignment to Clinical Time-Series Understanding in Multimodal LLMs
- arxiv url: http://arxiv.org/abs/2609.31448v1
- Date: Fri, 25 Sep 2026 16:06:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 18:27:51.48019
- Title: ViSTA: A Simple Bridge Extends Visual Alignment to Clinical Time-Series Understanding in Multimodal LLMs
- Title(参考訳): ViSTA:マルチモーダルLLMにおける臨床時系列理解に視覚的アライメントを拡張したシンプルなブリッジ
- Abstract要約: ViSTAは、不規則な数値測定を事前訓練された視覚言語モデルのチャート表現に組み込むコンパクトアダプタである。
事前訓練されたパラメータをすべてそのまま残しながら、視覚トークンの修正を学習する。
MIMIC-IVでは、ViSTAは、急性腎障害と死亡予測の4つの指標で比較された平均スコアのうち、最も高い。
- 参考スコア(独自算出の注目度): 5.2290663882417645
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Clinical prediction models estimate risk from patient measurements, while large language models support medical text understanding and question answering. Yet their language capabilities do not ensure accurate prediction from structured, high-dimensional clinical time series. Improving this ability would connect risk estimation with flexible questions about a patient's evolving condition. We introduce ViSTA, a compact adapter that incorporates irregular numerical measurements into a pretrained vision-language model's chart representations. It learns corrections to visual tokens while leaving all pretrained parameters unchanged. On MIMIC-IV, ViSTA has the highest mean scores among the compared adaptations on all four metrics for acute kidney injury and mortality prediction across models with 2-9 billion parameters. With 0.516 million trainable parameters, the 2-billion-parameter model reaches an area under the ROC curve of 0.7376 for acute kidney injury, compared with GPT-5.6 Sol's 0.7380 with text input and high reasoning effort. Training for temporal question answering yields 69.27% accuracy at 4 billion parameters with over 90% fewer trainable parameters than low-rank adaptation using charts or numerical text, at a 2.82-4.88 percentage-point accuracy gap. ViSTA extends pretrained language models to numerical prediction and temporal questions.
- Abstract(参考訳): 臨床予測モデルは患者の測定値からリスクを推定し、大きな言語モデルは医学的テキスト理解と質問応答をサポートする。
しかし、それらの言語能力は、構造化された高次元臨床時系列からの正確な予測を保証しない。
この能力を改善することで、リスク推定と患者の進行状態に関する柔軟な質問を結びつけることができる。
本稿では,不規則な数値測定を事前学習した視覚言語モデルのチャート表現に組み込む,コンパクトなアダプタViSTAを紹介する。
事前訓練されたパラメータをすべてそのまま残しながら、視覚トークンの修正を学習する。
MIMIC-IVでは、ViSTAは2-90億のパラメータを持つモデル全体で、急性腎障害と死亡予測の4つの指標の順応点のうち、最も高いスコアを持つ。
0.516万のトレーニングパラメータを持つ2ビリオンパラメーターモデルは、GPT-5.6のSolの0.7380のテキスト入力と高い推論の努力と比較して、急性腎傷害に対するRCC曲線0.7376の領域に達する。
時間的質問応答のトレーニングでは、40億のパラメータで69.27%の精度が得られ、グラフや数値テキストを使った低ランク適応よりも90%少ないトレーニング可能なパラメータが2.82-4.88パーセンテージの精度ギャップで得られる。
ViSTAは、事前訓練された言語モデルから、数値予測や時間的質問まで拡張する。
関連論文リスト
- Beyond Scalar Scores: Exploring LLM-based Metrics for Clinical Significance Evaluation in Radiology Reports [49.5225801722164]
既存のメトリクスは、医学的に根拠のないスカラーにレポートの品質を低下させることによって、この要件を曖昧にしている。
テストベッドとしてReEvalMedベンチマークを用いて,この境界について検討し,計量レベルの臨床的意義を評価する。
論文 参考訳(メタデータ) (2026-06-17T08:10:30Z) - Training Large Language Models to Predict Clinical Events [0.0]
我々は,時間順のMIMIC-IIIノートを過去の患者コンテキストの例に変換することで,フォレストラーニングを臨床予測に拡張する。
このプロセスは、薬品、手順、臓器サポート、微生物学、死亡率を含む702の入院から6,900の予測例を生成する。
論文 参考訳(メタデータ) (2026-05-12T23:18:14Z) - Automating Clinical Information Retrieval from Finnish Electronic Health Records Using Large Language Models [0.0]
ローカルにデプロイ可能なフレームワークは、外部データ転送なしでEHRから直接臨床質問に答える。
オープンソースの大規模言語モデル(LLM)は、4Bから70Bまでのパラメータを完全にオフラインでベンチマークした。
論文 参考訳(メタデータ) (2026-03-27T14:03:51Z) - Cerebra: A Multidisciplinary AI Board for Multimodal Dementia Characterization and Risk Assessment [56.62016795093786]
CerebraはインタラクティブなマルチエージェントAIチームで、ERH、臨床ノート、医療画像分析のための特殊エージェントをコーディネートする。
構造化された表現を操作することで、プライバシ保護デプロイメントをサポートし、モダリティが不完全であれば、堅牢である。
Cerebraは、有識者のパフォーマンスを著しく改善し、前向き認知症リスク推定において精度を17.5ポイント向上させた。
論文 参考訳(メタデータ) (2026-03-23T05:46:45Z) - Explainable Admission-Level Predictive Modeling for Prolonged Hospital Stay in Elderly Populations: Challenges in Low- and Middle-Income Countries [65.4286079244589]
長期滞在期間 (pLoS) は, 院内感染のリスクに関連する重要な要因である。
入院レベルの患者と病院の診療データを用いて, pLosの予測モデルを開発し, 解説する。
論文 参考訳(メタデータ) (2026-01-07T23:35:24Z) - A DeepSeek-Powered AI System for Automated Chest Radiograph Interpretation in Clinical Practice [83.11942224668127]
Janus-Pro-CXR (1B) はDeepSeek Janus-Proモデルに基づく胸部X線解釈システムである。
本システムは, 自動レポート生成において, 最先端のX線レポート生成モデルより優れる。
論文 参考訳(メタデータ) (2025-12-23T13:26:13Z) - Scaling Down to Scale Up: Towards Operationally-Efficient and Deployable Clinical Models via Cross-Modal Low-Rank Adaptation for Medical Vision-Language Models [0.30586855806896035]
視覚言語による事前訓練によってトレーニングされた基礎モデルは、多様な画像領域にまたがる強力なゼロショット機能を示している。
MedCT-VLM(MedCT-VLM: Medical CT Vision-Language Model)を紹介する。
胸部疾患18例のゼロショット分類について検討し,CT埋め込みと未確認のテキストプロンプトを,タスク固有の訓練を伴わない推論で一致させなければならないことを示した。
論文 参考訳(メタデータ) (2025-11-29T19:03:25Z) - Automatically measuring speech fluency in people with aphasia: first
achievements using read-speech data [55.84746218227712]
本研究の目的は,言語習得の分野で開発された信号処理algorithmの関連性を評価することである。
論文 参考訳(メタデータ) (2023-08-09T07:51:40Z) - Deformation Driven Seq2Seq Longitudinal Tumor and Organs-at-Risk
Prediction for Radiotherapy [12.05638699290782]
畳み込み長短記憶(ConvLSTM)に基づく新しい3次元シーケンス・ツー・シーケンスモデルを提案する。
将来の解剖学的変化と腫瘍の体積の変化を予測し、重要なOARも予測する。
私たちは2つの放射線治療データセットでモデルを検証した。
論文 参考訳(メタデータ) (2021-06-16T18:29:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。