論文の概要: Homogeneous Semantic Alignment and Hierarchical Expert Routing for Radiology Report Generation
- arxiv url: http://arxiv.org/abs/2610.04499v1
- Date: Sat, 03 Oct 2026 12:57:35 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 21:42:32.805885
- Title: Homogeneous Semantic Alignment and Hierarchical Expert Routing for Radiology Report Generation
- Title(参考訳): 放射線学レポート作成のための均質なセマンティックアライメントと階層的エキスパートルーティング
- Abstract要約: 放射線医学報告生成(RRG)は、医学的イメージを診断用テキストに変換し、臨床的意思決定を支援し、医師の作業負荷を軽減することを目的としている。
本稿では,新しい2段階の均一なセマンティックアライメントと階層的エキスパートルーティング(HSA-HER)フレームワークを提案する。
まず,視覚的特徴とテキスト的特徴の相互分布シフトを効果的に除去するために,下層の潜在空間に明示的な均質分布制約を導入する。
第2に、視覚的特徴、局所エンティティ、グローバル検索からなる異種臨床証拠について、これらの疾患意味アンカーによって誘導される階層的専門家ルーティング機構を設計する。
- 参考スコア(独自算出の注目度): 27.044632569390714
- License:
- Abstract: Radiology report generation (RRG) aims to convert medical images into diagnostic texts to assist in clinical decision-making and alleviate the workload of physicians. Although existing methods have made extensive progress in cross-modal interaction and the incorporation of external priors, the distribution shift of underlying representations and the undifferentiated rigid coupling of heterogeneous information cause weak visual abnormality cues to be easily diluted by massive text priors and generation inertia during decoding. To overcome this bottleneck, inspired by cognitive science, we propose a novel two-stage Homogeneous Semantic Alignment and Hierarchical Expert Routing (HSA-HER) framework. First, the model introduces an explicit homogeneous distribution constraint in the underlying latent space to effectively eliminate the cross-modal distribution shift between visual and textual features, thereby extracting purified visual features as semantic anchors that accurately align with diseases. Second, for heterogeneous clinical evidence composed of visual features, local entities, and global retrievals, we design a hierarchical expert routing mechanism guided by these disease semantic anchors. This mechanism abandons the undifferentiated rigid coupling paradigm. Specifically, it dynamically activates expert networks to perform targeted mining and semantic reconstruction on multi-source evidence, and adaptively allocates fusion weights. Extensive experiments on three mainstream benchmark datasets demonstrate that HSA-HER achieves state-of-the-art performance, accurately depicting complex imaging details and key diagnostic information.
- Abstract(参考訳): 放射線医学報告生成(RRG)は、医学的イメージを診断用テキストに変換し、臨床的意思決定を支援し、医師の作業負荷を軽減することを目的としている。
既存の手法は、相互モーダルな相互作用や外部の事前の取り込みにおいて大きな進歩を遂げてきたが、基礎となる表現の分布シフトと不均一な情報の厳密な結合により、大量のテキストの先行と復号時に慣性を生成することで、弱い視覚的異常のキューが容易に希薄になる。
認知科学に触発されたこのボトルネックを克服するため、我々は新しい2段階のホモジニアス・セマンティック・アライメントと階層的エキスパート・ルーティング(HSA-HER)フレームワークを提案する。
まず,視覚的特徴とテキスト的特徴の相互分布シフトを効果的に排除し,病気と正確に一致したセマンティックアンカーとして視覚的特徴を抽出する。
第2に、視覚的特徴、局所的な実体、及びグローバルな検索からなる異種臨床証拠について、これらの疾患セマンティックアンカーによって誘導される階層的専門家ルーティング機構を設計する。
このメカニズムは、未分化の剛性結合パラダイムを捨てる。
具体的には、専門家ネットワークを動的に活性化し、マルチソースエビデンスをターゲットとしたマイニングとセマンティック再構築を行い、融合重みを適応的に割り当てる。
3つの主要なベンチマークデータセットに対する大規模な実験は、HSA-HERが最先端のパフォーマンスを達成し、複雑な画像の詳細と重要な診断情報を正確に表現していることを示している。
関連論文リスト
- Graph-Augmented Topological Internalization with Dual-Stream Classifiers for Medical Report Generation [3.3887144970801555]
トポロジカル内部化を用いたグラフ拡張型デュアルストリーム医療レポート生成法(GDMRG)を提案する。
本フレームワークでは,グローバルな疾患の共起を前提としたパラメータ化重み行列を生成するトポロジカル・ナレッジ・インサイナライゼーション・モジュールであるTKIを導入する。
MIMIC-CXRデータセットの実験は、GDMRGが自然言語の流速を維持しながら競争力のある臨床効果CEを達成することを示した。
論文 参考訳(メタデータ) (2026-05-04T09:17:27Z) - Layout-Guided Controllable Pathology Image Generation with In-Context Diffusion Transformers [57.54843029965778]
制御可能な病理画像合成には、空間配置、組織形態、意味的詳細の信頼できる規制が必要である。
In-Context Diffusion Transformer (IC-DiT) は,空間レイアウト,テキスト記述,視覚的埋め込みを統合拡散変換器に組み込んだレイアウト認識生成モデルである。
IC-DiTは既存の方法よりも忠実度が高く、空間制御性が強く、診断の整合性が良くなる。
論文 参考訳(メタデータ) (2026-03-11T06:14:11Z) - Deep Expert Injection for Anchoring Retinal VLMs with Domain-Specific Knowledge [66.67024684187915]
LVLM(Large Vision Language Models)は、眼科における自動診断の可能性を秘めている。
彼らの臨床展開は、ドメイン固有の知識の欠如によって著しく妨げられている。
EyExInは、Deep Expert Injectionメカニズムを通じて専門知識で網膜VLMを固定するように設計されたフレームワークである。
論文 参考訳(メタデータ) (2026-03-07T09:43:49Z) - A Semantically Enhanced Generative Foundation Model Improves Pathological Image Synthesis [82.01597026329158]
本稿では,組織合成のための相関調整フレームワーク(CRAFTS)について紹介する。
CRAFTSは、生物学的精度を確保するためにセマンティックドリフトを抑制する新しいアライメント機構を組み込んでいる。
本モデルは,30種類の癌にまたがる多彩な病理像を生成する。
論文 参考訳(メタデータ) (2025-12-15T10:22:43Z) - GROVER: Graph-guided Representation of Omics and Vision with Expert Regulation for Adaptive Spatial Multi-omics Fusion [8.680469644745463]
本稿では,適応型空間マルチオミクス融合のエキスパートレギュレーションによるオミとビジョンのグラフ誘導表現を提案する。
GROVERは空間マルチオミクスデータの適応的統合のための新しいフレームワークである。
GROVERは最先端のベースラインより優れていることを示す。
論文 参考訳(メタデータ) (2025-11-13T06:20:37Z) - Self-Supervised Anatomical Consistency Learning for Vision-Grounded Medical Report Generation [61.350584471060756]
医用画像の臨床的に正確な記述を作成することを目的とした医用レポート生成。
本稿では, 自己監督型解剖学的一貫性学習(SS-ACL)を提案し, 生成された報告を対応する解剖学的領域と整合させる。
SS-ACLは、ヒト解剖学の不変のトップダウン包摂構造にインスパイアされた階層的な解剖学的グラフを構築する。
論文 参考訳(メタデータ) (2025-09-30T08:59:06Z) - Self-Supervised Cross-Encoder for Neurodegenerative Disease Diagnosis [6.226851122403944]
縦型MRIスキャンにおける時間的連続性を利用した自己監督型クロスエンコーダフレームワークを提案する。
このフレームワークは、学習した表現を2つのコンポーネントに分解する: 静的表現は、対照的な学習によって制約され、安定した解剖学的特徴を捉え、動的表現は、時間的変化を反映する入力漸進正規化によってガイドされる。
アルツハイマー病神経画像イニシアチブデータセットの実験結果から,本手法は分類精度が向上し,解釈性が向上することが示された。
論文 参考訳(メタデータ) (2025-09-09T11:52:24Z) - Improving Medical Visual Representation Learning with Pathological-level Cross-Modal Alignment and Correlation Exploration [21.260659596426184]
画像と報告の両方から病理観察の一貫性を最大化するために,新しい病理レベルの相互アライメント(PCMA)手法を提案する。
PCMAモジュールは外部の疾患アノテーションとは独立して動作し,本手法の汎用性と堅牢性を高める。
実験により,提案するフレームワークは,複数の下流タスクにおいて,新しい最先端性能を実現することを示す。
論文 参考訳(メタデータ) (2025-06-12T11:01:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。