論文の概要: TractoGraphVLM: A Unified Vision-Language Framework for White Matter Tractography
- arxiv url: http://arxiv.org/abs/2608.18166v1
- Date: Sun, 16 Aug 2026 16:14:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-20 20:13:55.165862
- Title: TractoGraphVLM: A Unified Vision-Language Framework for White Matter Tractography
- Title(参考訳): TractoGraphVLM:ホワイトマタートラクトグラフィのための統一視覚言語フレームワーク
- Authors: Gurucharan Marthi Krishna Kumar, Janine Dale Mendola, Amir Shmuel,
- Abstract要約: TractoGraphVLMは4つのタスク、バンドル分類、テキストから抽出、解剖学、視覚的質問応答のための統一されたフレームワークである。
GPSトランスフォーマーは、対照的な学習を通じて凍結されたBiomedBERTテキストエンコーダと整列したバンドル埋め込みを生成する。
ビジュアルキャプション付きバイオGPTデコーダはトークンと回答を生成する。
- 参考スコア(独自算出の注目度): 0.30586855806896046
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision language models have transformed 2D medical imaging, yet extending them to 3D white matter tractography remains challenging due to the complex topology of fiber bundles. We introduce TractoGraphVLM, a unified framework for four tasks, bundle classification, text-to-tract retrieval, anatomical captioning, and visual question answering, built on a shared GPS architecture, training procedure, and read-out design. Fiber bundles are represented as streamline graphs whose nodes encode 3D position and tangent orientation. A General, Powerful, Scalable (GPS) graph transformer produces bundle embeddings aligned with a frozen BiomedBERT text encoder via contrastive learning, while a BioGPT decoder with visual prefix tokens generates captions and answers. A single shared encoder and decoder is trained jointly across all four tasks and evaluated from one checkpoint. Trained on HCP Young Adult subjects, TractoGraphVLM achieves 91.8% bundle classification accuracy, 84.7% retrieval R@1, BLEU-4=20.1, ROUGE-L=66.8, and 66.4% VQA accuracy on a held-out test set. The same checkpoints transfer zero-shot to HCP Aging subjects, with a modest drop on discriminative tasks and a larger drop on generative tasks, showing robustness to age and acquisition shift. Language supervision yields richer representations than label-only training, recovering structure like hemisphere and fiber family, carried by captions but never given as a label. Swapping only the visual encoder, graphs preserving fiber orientation outperform volumetric baselines, with GPS giving the best balance. Generative metrics measure consistency with a structured knowledge base rather than independent clinical text; even so, TractoGraphVLM shows that classifying, retrieving, describing, and answering questions about a white matter bundle can be served by one jointly trained model that learns transferable neuroanatomy from language alone.
- Abstract(参考訳): 視覚言語モデルは2次元の医用画像に変換されているが、繊維束の複雑なトポロジーのため、これらを3次元のホワイトマター・トラクトグラフィーに拡張することは依然として困難である。
我々は,共有GPSアーキテクチャ上に構築された,バンドル分類,テキスト・ツー・トラクション検索,解剖学的キャプション,視覚的質問応答という,4つのタスクのための統合されたフレームワークであるTractoGraphVLMを紹介した。
ファイバーバンドルは、ノードが3D位置と接方向を符号化するストリームライングラフとして表現される。
汎用、パワーフル、スケーラブル(GPS)グラフトランスフォーマーは、対照的な学習を通じて凍結されたBiomedBERTテキストエンコーダと整列したバンドル埋め込みを生成し、ビジュアルプレフィックストークンを持つBioGPTデコーダはキャプションと回答を生成する。
1つの共有エンコーダとデコーダは4つのタスクすべてで共同で訓練され、1つのチェックポイントから評価される。
HCP若年者を対象に訓練されたTractoGraphVLMは、91.8%のバンドル分類精度、84.7%の検索R@1、BLEU-4=20.1、ROUGE-L=66.8、66.4%のVQAを保持テストセットで達成している。
同じチェックポイントはゼロショットをHCP高齢の被験者に転送し、差別的タスクはわずかに減少し、生成的タスクは大幅に減少し、年齢や取得のシフトに対する堅牢性を示している。
言語監督は、ラベルのみのトレーニングよりも豊かな表現をもたらし、キャプションによって運ばれるがラベルとして与えられない半球やファイバファミリーのような構造を回復する。
ビジュアルエンコーダのみをスワップし、繊維配向を保存したグラフはボリュームベースラインよりも優れており、GPSは最適なバランスを与えている。
TractoGraphVLMは、ホワイトマターバンドルに関する質問を分類し、検索し、記述し、答えることが、言語単独で伝達可能な神経解剖学を学習する1つの共同訓練されたモデルによって提供されることを示した。
関連論文リスト
- Tractogram foundation model [46.43770468662999]
トラクトFMはトラクトグラムの基礎モデルであり,脳全体から再利用可能な表現を直接学習する。
TractFMは、局所的なストリーラインエンコーダと置換等価なトラクトグラムエンコーダを組み合わせることで、被験者のすべてのストリーラインをコンテキスト化することができる。
凍結した表現は正確なトラクションのパーセレーションを実現し、独立したデータセット間で年齢と性別を予測する。
論文 参考訳(メタデータ) (2026-06-03T19:45:23Z) - GLINT: Sparsely Gated Vision-Language Alignment for Fine-Grained Radiology Representations [1.2679579476597642]
本稿では,この疎対応を明示的にモデル化したGLINT(Gated Language-ImagealignedmeNT)を提案する。
GLINTは、フリーテキストクエリからのゼロショット分類、グラウンド化、セグメンテーションを可能にする。
マスクの監督なしに3次元CTボリュームにゼロショットセグメンテーションを初めて示す。
論文 参考訳(メタデータ) (2026-06-02T05:40:51Z) - Curriculum-Driven 3D CT Report Generation via Language-Free Visual Grafting and Zone-Constrained Compression [0.0]
胸部CTボリュームから自由テキストレポートを生成するための4段階のカリキュラム学習フレームワークであるKer-VLJEPA-3Bを提案する。
フェーズドトレーニングカリキュラムは、Llama 3.2 3Bデコーダに適応し、凍結した自己監督型エンコーダの視覚的特徴を出力する。
我々の視覚バックボーン(LeJEPA ViT-Large)は、テキスト監督なしで、ラベルなしCTの自己監督共同埋め込み予測によって訓練される。
論文 参考訳(メタデータ) (2026-03-24T15:13:30Z) - A Graph-Based Framework for Interpretable Whole Slide Image Analysis [86.37618055724441]
我々は,全スライディング画像を生物学的にインフォームドされたグラフ表現に変換するフレームワークを開発した。
我々のアプローチは、任意の格子ではなく、自然構造を尊重する組織領域からグラフノードを構築する。
がんのステージングと生存予測の課題に強いパフォーマンスを示す。
論文 参考訳(メタデータ) (2025-03-14T20:15:04Z) - G2D: From Global to Dense Radiography Representation Learning via Vision-Language Pre-training [10.786853837756686]
我々は、textbfDenseレベル表現学習(G2D)のための、textbfGlobalという新しい医用ビジョン言語事前学習フレームワークを提案する。
G2Dは,大域的視覚言語アライメントと並行して,擬似セグメンテーションタスクを通じて,密で意味的な画像表現を学習する。
G2Dは、6つの医療画像タスクと25の疾患、特にセマンティックセグメンテーションにおいて優れたパフォーマンスを達成する。
論文 参考訳(メタデータ) (2023-12-03T22:44:04Z) - Transforming Visual Scene Graphs to Image Captions [69.13204024990672]
我々は、Scene Graphs (TSG) をより説明的なキャプションに変換することを提案する。
TSGでは、シーングラフの埋め込みのためのグラフニューラルネットワーク(GNN)の設計にマルチヘッドアテンション(MHA)を適用している。
TSGでは、各専門家はMHAに基づいてグラフ埋め込みを識別し、異なる種類の単語を生成する。
論文 参考訳(メタデータ) (2023-05-03T15:18:37Z) - Triple-View Feature Learning for Medical Image Segmentation [9.992387025633805]
TriSegNetは半教師付きセマンティックセグメンテーションフレームワークである。
ラベル付けされたデータの限られた量と、ラベル付けされていない大量のデータに基づいて、トリプルビューの特徴学習を使用する。
論文 参考訳(メタデータ) (2022-08-12T14:41:40Z) - Structure-Augmented Text Representation Learning for Efficient Knowledge
Graph Completion [53.31911669146451]
人為的な知識グラフは、様々な自然言語処理タスクに重要な支援情報を提供する。
これらのグラフは通常不完全であり、自動補完を促す。
グラフ埋め込みアプローチ(例えばTransE)は、グラフ要素を密度の高い埋め込みに表現することで構造化された知識を学ぶ。
テキストエンコーディングアプローチ(KG-BERTなど)は、グラフトリプルのテキストとトリプルレベルの文脈化表現を利用する。
論文 参考訳(メタデータ) (2020-04-30T13:50:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。