論文の概要: Explaining BiomedCLIP with Weighted Banzhaf Interactions Supported by Tree-Gram Parsing
- arxiv url: http://arxiv.org/abs/2607.23368v1
- Date: Sat, 25 Jul 2026 21:17:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.084943
- Title: Explaining BiomedCLIP with Weighted Banzhaf Interactions Supported by Tree-Gram Parsing
- Title(参考訳): 木-グラム解析による重み付きバンジャフ相互作用を用いたバイオメディカルCLIPの解説
- Abstract要約: 本稿では、FIxLIPが使用するTree-Gram Parsingインタラクションゲームを組み込んだ拡張であるParseFIxLIPを紹介する。
spaCyトークン依存ツリーに従ってトークンをマージするスマート_depthグループ戦略は、概念の断片化をうまく軽減します。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-Language Models (VLMs) are demonstrating significant capabilities in medical tasks like radiology analysis, yet providing faithful and interpretable explanations remains a key consideration for their responsible deployment in clinical settings. However, existing explanation methods, such as the widely used FIxLIP framework, often struggle with the fine-grained nature of modern tokenizers. The tokenization problem fragments clinical concepts---splitting terms like "saddle embolus" into scattered, meaningless subwords---which leads to noisy, semantically incoherent cross-modal attributions. Such fragmentation also results in a combinatorial explosion of interaction possibilities, obscuring the model's true reasoning. To address this, we introduce ParseFIxLIP, an extension that incorporates the Tree-Gram Parsing into the Banzhaf interaction game used by FIxLIP. This semantically informed strategy utilizes dependency parsing trees to define explanation players by grouping related text tokens into semantically coherent units. Our smart_depth grouping strategy, merging tokens according to spaCy token dependency tree, successfully mitigates concept fragmentation, yielding substantially more interpretable cross-modal interactions by unifying complex medical concepts. Quantitatively, while baselines struggled with the high dimensionality of long captions, our parsing approach maintained statistical robustness and semantic parsimony. Qualitative analysis on BiomedCLIP, validated on medical imagery (ROCOv2) and general examples, confirms that the approach accurately captures the synergistic influence of grouped words on model predictions. In conclusion, our work offers intuitive and clinically relevant insights into VLM decision-making, fulfilling the critical need for coherent explanations in the medical domain.
- Abstract(参考訳): VLM(Vision-Language Models)は、放射線学分析などの医学的タスクにおいて重要な機能を示しているが、忠実で解釈可能な説明を提供することは、臨床環境におけるその責任を負うための重要な考慮事項である。
しかし、広く使われているFIxLIPフレームワークのような既存の説明法は、しばしば現代のトークン化器の微細な性質に苦しむ。
トークン化問題は、"saddle embolus"のような用語を散在する意味のないサブワードに分割する、臨床的概念を断片化する。
このような断片化はまた、相互作用可能性の組合せ爆発を引き起こし、モデルの真の推論を無視する。
これを解決するために、我々は、Tree-Gram ParsingをFIxLIPが使用するBanzhafインタラクションゲームに組み込む拡張であるParseFIxLIPを紹介した。
このセマンティックインフォメーション戦略は、依存性解析木を用いて、関連するテキストトークンをセマンティックコヒーレントなユニットにグループ化することで、説明プレイヤーを定義する。
我々のスマート_depthグループ化戦略は、paCyトークン依存ツリーに従ってトークンをマージすることで、概念の断片化を軽減し、複雑な医療概念を統一することで、より解釈可能なクロスモーダルな相互作用を生み出す。
ベースラインは長文キャプションの高次元性に苦しむ一方で,解析手法は統計的頑健性と意味的パーシモニーを維持した。
医用画像(ROCOv2)で検証されたBiomedCLIPの質的分析により,モデル予測におけるグループ単語の相乗効果を正確に把握できることが確認された。
結論として,本研究はVLM意思決定における直感的かつ臨床的な知見を提供し,医療領域におけるコヒーレントな説明の必要性を満たすものである。
関連論文リスト
- Concept-Grounded Reasoning with Prompt-Driven Localization for Interpretable Structured Report Generation [66.62662330558906]
CORALは、空間的接地と概念レベルの監督を統一的な推論プロセスに統合するマルチモーダルフレームワークである。
コーラルは、疾患の局所化とコンセプション・ボトルネックモジュールによる多クラス臨床属性の予測のために、プロンプト駆動型医療セグメンテーションモデルを採用している。
BUS-CoTとIU X線データセットの実験では、診断精度、概念整合性、報告品質が強力な汎用および医療MLLMよりも一貫した改善が示されている。
論文 参考訳(メタデータ) (2026-09-14T10:21:23Z) - DrugReason: Dynamic Multi-View Reasoning over Knowledge Graph and Language Evidence for Drug Repurposing [55.45112712244231]
DrugReasonはマルチビュー推論フレームワークであり、LLMが生成する薬物再精製の機械的推論と接地KG推論を統合している。
PharmaDB, DDInter, DrugBankの実験によると、DragonReasonは強力な単一ビュー推論ベースラインよりも平均的なパフォーマンスを向上させる。
論文 参考訳(メタデータ) (2026-09-06T18:54:26Z) - SCALPEL: Semantic Cross-modal Alignment via LLM-Powered Encoder Learning for Medical Vision-Language Representation [5.487826115955642]
ビジョン言語による事前訓練は、医学的マルチモーダル表現学習の基盤となる。
textbfLLM-textbfPowered textbfEncoder textbfLearning による textbfSemantic textbfCross-modal textbfAlignment フレームワーク textbfSCALPEL を提案する。
論文 参考訳(メタデータ) (2026-07-29T13:12:32Z) - ReportMedSAM: Guiding Segmentation Through Radiology Reports [44.07905920142891]
ReportMedSAMは、個別の抽出を学習可能なコンセプトバンクに置き換えるレポート駆動フレームワークである。
本手法は, 臓器レベルでの意味的崩壊を緩和し, 多様な臨床同義語に対して高い堅牢性を確保する。
ReportMedSAMは、フリーフォームレポートを効果的に解釈し、競合セグメンテーションの精度を達成し、新しい臨床タスクへのシームレスで非干渉的な拡張を示す。
論文 参考訳(メタデータ) (2026-05-08T13:32:15Z) - DCG-Net: Dual Cross-Attention with Concept-Value Graph Reasoning for Interpretable Medical Diagnosis [14.035057926904559]
概念ボトルネックモデル (Concept Bottleneck Models, CBM) は、人間の解釈可能な臨床概念による構造予測である。
既存のCBMは、コンセプト間のコンテキスト依存を概ね見落としている。
本稿では,マルチモーダルアライメントと構造化概念推論を統合した,エンドツーエンドの解釈可能なフレームワークであるemphDCG-Netを提案する。
論文 参考訳(メタデータ) (2026-03-20T01:11:58Z) - MIRNet: Integrating Constrained Graph-Based Reasoning with Pre-training for Diagnostic Medical Imaging [67.74482877175797]
MIRNetは、自己教師付き事前学習と制約付きグラフベースの推論を統合する新しいフレームワークである。
TongueAtlas-4Kは,22の診断ラベルを付した4,000枚の画像からなるベンチマークである。
論文 参考訳(メタデータ) (2025-11-13T06:30:41Z) - Explaining multimodal LLMs via intra-modal token interactions [55.27436637894534]
MLLM(Multimodal Large Language Models)は、様々な視覚言語タスクにおいて顕著な成功を収めているが、その内部決定機構は十分に理解されていない。
モーダル内相互作用を利用した解釈可能性の向上を提案する。
論文 参考訳(メタデータ) (2025-09-26T14:39:13Z) - NEARL-CLIP: Interacted Query Adaptation with Orthogonal Regularization for Medical Vision-Language Understanding [51.63264715941068]
textbfNEARL-CLIP (iunderlineNteracted quunderlineEry underlineAdaptation with ounderlineRthogonaunderlineL regularization)は、VLMベースの新しい相互モダリティ相互作用フレームワークである。
論文 参考訳(メタデータ) (2025-08-06T05:44:01Z) - Modeling Hierarchical Reasoning Chains by Linking Discourse Units and
Key Phrases for Reading Comprehension [80.99865844249106]
本稿では,論理的推論の基盤として,対話レベルと単語レベルの両方の文脈を扱う総合グラフネットワーク(HGN)を提案する。
具体的には、ノードレベルの関係とタイプレベルの関係は、推論過程におけるブリッジと解釈できるが、階層的な相互作用機構によってモデル化される。
論文 参考訳(メタデータ) (2023-06-21T07:34:27Z) - Multi-Relational Hyperbolic Word Embeddings from Natural Language
Definitions [5.763375492057694]
本稿では、そのような構造を明示的に活用し、定義から単語埋め込みを導出するマルチリレーショナルモデルを提案する。
経験的な分析は、フレームワークが望ましい構造的制約を課すのに役立つことを示している。
実験により、ユークリッド語よりもハイパーボリック語の埋め込みの方が優れていることが示された。
論文 参考訳(メタデータ) (2023-05-12T08:16:06Z) - Multi-Granularity Cross-modal Alignment for Generalized Medical Visual
Representation Learning [24.215619918283462]
本報告では, 医用画像の表現を直接学習するための新しい枠組みについて述べる。
本フレームワークは,医用画像と放射線学レポートの自然に現れる意味的対応を3段階に分けて活用する。
論文 参考訳(メタデータ) (2022-10-12T09:31:39Z) - Design considerations for a hierarchical semantic compositional
framework for medical natural language understanding [3.7003326903946756]
NLP性能曲線を跳躍する試みとして,人間の認知のメカニズムにインスパイアされた枠組みについて述べる。
セマンティックメモリ、セマンティックコンポジション、セマンティックアクティベーションを含む4つの重要な側面からの洞察について述べる。
本稿では,自由文文を意味の論理的表現に変換するための生成意味モデルと関連する意味モデルの設計について論じる。
論文 参考訳(メタデータ) (2022-04-05T09:04:34Z) - Deep Co-Attention Network for Multi-View Subspace Learning [73.3450258002607]
マルチビューサブスペース学習のための深層コアテンションネットワークを提案する。
共通情報と相補情報の両方を敵意で抽出することを目的としている。
特に、新しいクロス再構成損失を使用し、ラベル情報を利用して潜在表現の構築を誘導する。
論文 参考訳(メタデータ) (2021-02-15T18:46:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。