論文の概要: HounsWorld: A Multimodal World Model for Hidden Patient-State Readout, Reconstruction, and Simulation
- arxiv url: http://arxiv.org/abs/2608.12904v1
- Date: Thu, 13 Aug 2026 07:41:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-14 18:29:38.420883
- Title: HounsWorld: A Multimodal World Model for Hidden Patient-State Readout, Reconstruction, and Simulation
- Title(参考訳): HounsWorld: 隠れた患者状態の読み出し、再構築、シミュレーションのためのマルチモーダルワールドモデル
- Abstract要約: 臨床知能は、不完全な観察から患者の根底にある状態を推定する必要がある。
HounsWorldは、ボリュームスキャンと言語を共有状態の観測として扱う3Bマルチモーダル世界モデルである。
共有トランスは暗黙の患者状態推定を形成し、3つの出力をサポートする。
- 参考スコア(独自算出の注目度): 21.392940683066367
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Clinical intelligence requires estimating a patient's underlying condition from incomplete observations rather than learning isolated mappings from scans to answers. Volumetric medical images provide dense observations of anatomy, attenuation, and lesions, whereas clinical language provides sparse but complementary semantic observations. We formulate CT-centered intelligence as inference over a shared latent patient state, under which readout, reconstruction, and simulation all become state-dependent prediction problems. To operationalize this view, we introduce HounsBench, a computed tomography (CT) centric patient-state benchmark that unifies these three task families with patient-disjoint splits and per-family metrics, and HounsWorld, a 3B multimodal world model that treats volumetric scans and language as observations of the shared state through Joint Understanding-Generation Learning. A shared transformer forms an implicit patient-state estimate and supports three outputs: query-conditioned answers that read out the state, reports and captions that reconstruct it in language, and condition-specific CT volumes for low-dose denoising, virtual contrast enhancement, and anatomy-constrained text-and-mask-to-volume generation. Zero-initialized CT adapters preserve pretrained multimodal mappings, while condition-explicit Hounsfield-unit window sampling exposes clinically meaningful density observations. HounsWorld shows strong performance across all three task families while consistently improving CT understanding through clinically structured completion. Our project is available at https://github.com/byhwhite/HounsWorld.git
- Abstract(参考訳): 臨床知能は、スキャンから回答への独立したマッピングを学習するのではなく、不完全な観察から患者の根底にある状態を推定する必要がある。
ボリューム医学画像は解剖学、減衰、病変の密集した観察を提供するが、臨床言語はスパースだが相補的な意味的な観察を提供する。
我々は,CT中心のインテリジェンスを患者の共有状態に対する推論として定式化し,読み出し,再構築,シミュレーションはすべて状態依存の予測問題となる。
この視点を運用するために、CT(Computerd tomography)中心の患者状態ベンチマークであるHounsBenchと、Joint Understanding-Generation Learningを通じてボリュームスキャンと言語を共有状態の観測として扱う3Bマルチモーダル世界モデルであるHounsWorldを紹介する。
共有トランスフォーマーは、暗黙の患者状態推定を作成し、状態を読み出すクエリ条件付き回答、それを言語で再構成するレポートとキャプション、低用量復調のための条件固有のCTボリューム、仮想コントラスト拡張、解剖制約されたテキストとマスクとボリューム生成の3つの出力をサポートする。
ゼロ初期化CTアダプタは、事前訓練されたマルチモーダルマッピングを保存し、条件付きハウンズフィールド単位ウィンドウサンプリングは、臨床的に意味のある密度観察を公開する。
HounsWorldは3つのタスクファミリーにまたがって強いパフォーマンスを示し、臨床的に構造化された完了によってCT理解を継続的に改善している。
私たちのプロジェクトはhttps://github.com/byhwhite/HounsWorld.gitで利用可能です。
関連論文リスト
- Anatomy Contextualized Adaption of CT Foundation Models [0.0]
我々は、解剖レベルの視覚言語アライメントに凍結CT基盤モデル表現を適応させる軽量フレームワークである、解剖コンテキスト適応(ACA)を導入する。
ACAは、ゼロショット発見分類において、凍結基礎モデルベースラインと既存のきめ細かい方法の両方を一貫して上回っている。
論文 参考訳(メタデータ) (2026-07-29T17:32:57Z) - Disease-Centric Vision-Language Pretraining with Hybrid Visual Encoding for 3D Computed Tomography [75.7789001619107]
ビジョン言語による事前トレーニングは、汎用医療AIにとって大きな可能性を秘めている。
3つの主要なコンポーネントを特徴とするフレームワークを提案する。
診断対応プロンプト戦略では、トレーニング前の推論ギャップを埋めるために、実際の臨床用語と集約された疾患プロトタイプを用いている。
論文 参考訳(メタデータ) (2026-06-24T08:24:45Z) - MedScribe: Clinically Grounded CT Reporting through Agentic Workflows [13.40306812882295]
視覚言語モデル(VLM)は、自動放射線診断レポート生成の可能性を示している。
我々は,仮説駆動型フレームワークであるMedScribeを紹介し,レポート生成を反復的証拠取得プロセスとして再構築する。
論文 参考訳(メタデータ) (2026-05-03T08:32:40Z) - EXACT: an explainable anomaly-aware vision foundation model for analysis of 3D chest CT [29.0378459959757]
EXACTは3次元胸部CTの異常認識基盤モデルである。
2つの臨床スキャンと放射線学レポートから空間的に解決された表現を学習する。
EXACTは臨床的に関係のあるCTタスクに対して一貫した改善を示す。
論文 参考訳(メタデータ) (2026-04-27T07:57:47Z) - OmniCT: Towards a Unified Slice-Volume LVLM for Comprehensive CT Analysis [53.01523944168442]
臨床解釈はスライス駆動の局所特徴と体積駆動の空間表現の両方に依存している。
既存のLVLM(Large Vision-Language Models)は、CTスライスとボリューム理解で断片化されている。
我々は,CTシナリオのための強力な統合スライスボリュームLVLMであるOmniCTを提案する。
論文 参考訳(メタデータ) (2026-02-18T00:42:41Z) - Self-Supervised Anatomical Consistency Learning for Vision-Grounded Medical Report Generation [61.350584471060756]
医用画像の臨床的に正確な記述を作成することを目的とした医用レポート生成。
本稿では, 自己監督型解剖学的一貫性学習(SS-ACL)を提案し, 生成された報告を対応する解剖学的領域と整合させる。
SS-ACLは、ヒト解剖学の不変のトップダウン包摂構造にインスパイアされた階層的な解剖学的グラフを構築する。
論文 参考訳(メタデータ) (2025-09-30T08:59:06Z) - CTFlow: Video-Inspired Latent Flow Matching for 3D CT Synthesis [7.57931364659531]
臨床報告に条件付き潜時流整合変圧器モデルであるCTFlowを紹介する。
FLUXのA-VAEを用いて潜伏空間を定義し,CT-Clipテキストエンコーダを用いて臨床報告を符号化する。
我々は,現状のCTモデルと比較し,時間的コヒーレンス,画像の多様性,テキスト画像のアライメントの観点から,我々のアプローチの優位性を実証した。
論文 参考訳(メタデータ) (2025-08-18T12:58:21Z) - Rethinking Whole-Body CT Image Interpretation: An Abnormality-Centric Approach [57.86418347491272]
全身に404例の異常所見を呈する包括的階層分類システムを提案する。
複数平面および全人体領域からの14.5K以上のCT画像を含むデータセットを寄贈し,19K以上の異常に対する接地アノテーションを念頭に提供した。
OminiAbnorm-CTは,テキストクエリに基づいて,多面的および全身的なCT画像に異常な所見を自動的に検出し,記述することができる。
論文 参考訳(メタデータ) (2025-06-03T17:57:34Z) - MG-3D: Multi-Grained Knowledge-Enhanced 3D Medical Vision-Language Pre-training [7.968487067774351]
3次元医用画像解析は多くの臨床応用において重要である。
3次元医用画像解析では、大規模視覚言語による事前訓練がまだ検討されていない。
大規模データ(47.1K)に基づいて事前学習したMG-3Dを提案する。
論文 参考訳(メタデータ) (2024-12-08T09:45:59Z) - RadGenome-Chest CT: A Grounded Vision-Language Dataset for Chest CT Analysis [56.57177181778517]
RadGenome-Chest CTはCT-RATEに基づく大規模3次元胸部CT解釈データセットである。
私たちは、最新の強力なユニバーサルセグメンテーションと大きな言語モデルを活用して、元のデータセットを拡張します。
論文 参考訳(メタデータ) (2024-04-25T17:11:37Z) - CT-GLIP: 3D Grounded Language-Image Pretraining with CT Scans and Radiology Reports for Full-Body Scenarios [53.94122089629544]
我々は,CT-GLIP(Grounded Language- Image Pretraining with CT scans)を導入する。
本手法は,104臓器にわたる17,702症例を対象に,44,011例の臓器レベルの視覚テキストペアからなるマルチモーダルCTデータセットを用いて訓練し,自然言語を用いて臓器と異常をゼロショットで識別できることを実証した。
論文 参考訳(メタデータ) (2024-04-23T17:59:01Z) - Deep Negative Volume Segmentation [60.44793799306154]
対象物を取り囲むすべての組織間で空の空間を分割する3Dセグメント化タスクに対する新しい角度を提案する。
我々のアプローチは骨分割のためのV-Netを含むエンドツーエンドパイプラインである。
顎顔面領域の専門医が注釈を付した50名の患者データセットにおけるCTスキャンの考え方を検証した。
論文 参考訳(メタデータ) (2020-06-22T16:55:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。