論文の概要: Token-Based Dual-view Fusion and Adaptation of Large Vision Models for Breast Cancer Classification
- arxiv url: http://arxiv.org/abs/2607.06309v1
- Date: Tue, 07 Jul 2026 14:11:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.548895
- Title: Token-Based Dual-view Fusion and Adaptation of Large Vision Models for Breast Cancer Classification
- Title(参考訳): 乳がん鑑別のためのトークンベースデュアルビューフュージョンと大型ビジョンモデルの適応
- Abstract要約: マルチビュー学習アプローチは通常、機能レベルの集約やシングルステージのクロスアテンションに依存します。
本稿では,凍結した視覚変換器のバックボーン内で,プロンプトベースの適応とクロスビュー融合を統一するトークン中心のデュアルビュー学習フレームワークを提案する。
VinDr-MammoとCMMDデータセットの実験では、線形探索、プロンプトのみ適応、従来の融合ベースラインよりも一貫した改善が示されている。
- 参考スコア(独自算出の注目度): 0.8029049649310211
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Accurate breast cancer classification from mammography requires effective integration of complementary information from craniocaudal (CC) and mediolateral oblique (MLO) views, which provide a more complete characterization of breast abnormalities. However, existing multi-view learning approaches typically rely on feature-level aggregation or single-stage cross-attention, which can entangle view-specific and shared representations and restrict interaction to limited network depths. To address these limitations, we propose a token-centric dual-view learning framework that unifies prompt-based adaptation and cross-view fusion within a frozen vision transformer backbone. The framework reformulates inter-view interaction as structured token-level communication, where dedicated fusion tokens explicitly encode bidirectional information exchange between CC and MLO views via cross-attention, serving as intermediate carriers of cross-view dependencies rather than relying on direct feature fusion. Unlike conventional methods that apply fusion at a single layer, fusion modules are inserted at multiple transformer depths, enabling progressive and repeated interaction across the encoder hierarchy. Fusion tokens are reintegrated into the token sequence and refined by subsequent transformer layers, facilitating hierarchical propagation of complementary information while preserving view-specific structure. Experiments on VinDr-Mammo and CMMD datasets demonstrate consistent improvements over linear probing, prompt-only adaptation, and conventional fusion baselines. On the VinDr-Mammo BI-RADS classification task, the framework achieves 50.40% F1-score and 0.8090 AUC, including a 0.10 AUC improvement over a dual-view fusion baseline in the binary setting. Ablation studies further validate the effectiveness of token-based fusion and multi-depth interaction design.
- Abstract(参考訳): マンモグラフィーによる乳がんの正確な分類には,頭蓋骨 (CC) と側方斜視 (MLO) からの相補的情報を効果的に統合する必要がある。
しかし、既存のマルチビュー学習アプローチは、通常、機能レベルの集約やシングルステージのクロスアテンションに依存しており、ビュー固有の共有表現を絡み合わせることができ、ネットワークの深さを制限することができる。
これらの制約に対処するため、フリーズされた視覚変換器のバックボーン内で、プロンプトベースの適応とクロスビュー融合を統一するトークン中心のデュアルビュー学習フレームワークを提案する。
このフレームワークは、構造化されたトークンレベルの通信としてビュー間相互作用を再構成し、専用の融合トークンはCCとMLOビュー間の双方向情報交換を、直接的特徴融合に頼るのではなく、相互アテンションを介して明示的に符号化する。
単一の層に核融合を適用する従来の方法とは異なり、核融合モジュールは複数のトランスフォーマー深さに挿入され、エンコーダ階層間のプログレッシブかつ反復的な相互作用を可能にする。
融合トークンはトークンシーケンスに再統合され、その後のトランスフォーマー層によって洗練され、ビュー固有の構造を保持しながら相補的な情報の階層的伝播を容易にする。
VinDr-MammoとCMMDデータセットの実験では、線形探索、プロンプトのみ適応、従来の融合ベースラインよりも一貫した改善が示されている。
VinDr-Mammo BI-RADS分類タスクでは、このフレームワークは50.40%のF1スコアと0.8090 AUCを達成する。
アブレーション研究はトークンベースの核融合と多層相互作用設計の有効性をさらに検証する。
関連論文リスト
- CtrlFuse: Mask-Prompt Guided Controllable Infrared and Visible Image Fusion [51.060328159429154]
赤外線と可視画像の融合は、相補的なモダリティを組み合わせることで、全天候の知覚可能な画像を生成する。
我々は,マスクプロンプトによって誘導されるインタラクティブな動的融合を可能にする,制御可能な画像融合フレームワークであるCtrlFuseを提案する。
実験では、融合制御性とセグメンテーション精度の両立を実証し、適応されたタスク分岐は元のセグメンテーションモデルよりも優れていた。
論文 参考訳(メタデータ) (2026-01-12T13:36:48Z) - A Multi-scale Fused Graph Neural Network with Inter-view Contrastive Learning for Spatial Transcriptomics Data Clustering [7.214595408714774]
畳み込み後の空間的特徴と遺伝子的特徴を動的に統合するために,階層的に相互に注目するマルチスケールな相互融合グラフネットワークstMFGを提案する。
最先端の手法よりも優れており、特定のスライスで最大14%のARI改善を実現している。
論文 参考訳(メタデータ) (2025-12-18T05:13:55Z) - Hierarchical Identity Learning for Unsupervised Visible-Infrared Person Re-Identification [81.3063589622217]
教師なし可視赤外線人物再識別(USVI-ReID)は、ラベルのないクロスモーダルな人物データセットからモダリティ不変の画像特徴を学習することを目的としている。
論文 参考訳(メタデータ) (2025-09-15T05:10:43Z) - DART: Dual Adaptive Refinement Transfer for Open-Vocabulary Multi-Label Recognition [59.203152078315235]
Open-Vocabulary Multi-Label Recognition (OV-MLR)は、画像内の複数の見えないオブジェクトカテゴリを識別することを目的としている。
ビジョンランゲージ事前学習モデルは強力なオープン語彙基盤を提供するが、弱い監督下では微粒な局所化に苦慮する。
本稿では,これらの制約を克服するためのDART(Dual Adaptive Refinement Transfer)フレームワークを提案する。
論文 参考訳(メタデータ) (2025-08-07T17:22:33Z) - Unleashing Vision Foundation Models for Coronary Artery Segmentation: Parallel ViT-CNN Encoding and Variational Fusion [12.839049648094893]
冠動脈セグメンテーションは冠動脈疾患(CAD)のコンピュータ診断に重要である
並列符号化アーキテクチャを用いて,視覚基盤モデル(VFM)のパワーを利用する新しいフレームワークを提案する。
提案手法は, 精度の高い冠動脈セグメンテーションにおいて, 最先端の手法よりも優れ, 優れた性能を発揮する。
論文 参考訳(メタデータ) (2025-07-17T09:25:00Z) - Co-AttenDWG: Co-Attentive Dimension-Wise Gating and Expert Fusion for Multi-Modal Offensive Content Detection [0.0]
マルチモーダル学習は重要な研究の方向性として浮上している。
既存のアプローチは、しばしばクロスモーダル相互作用の不足と固い融合戦略に悩まされる。
本稿では,Co-AttenDWGを提案する。
我々は,Co-AttenDWGが最先端性能と優れたクロスモーダルアライメントを実現することを示す。
論文 参考訳(メタデータ) (2025-05-25T07:26:00Z) - Cross Paradigm Representation and Alignment Transformer for Image Deraining [40.66823807648992]
クロスパラダイム表現・アライメント変換器(CPRAformer)を提案する。
その中心となる考え方は階層的な表現とアライメントであり、両方のパラダイムの強みを活用して画像再構成を支援する。
トランスフォーマーブロックでは,スパースプロンプトチャネル自己アテンション(SPC-SA)と空間画素改善自己アテンション(SPR-SA)の2種類の自己アテンションを使用する。
論文 参考訳(メタデータ) (2025-04-23T06:44:46Z) - XFMamba: Cross-Fusion Mamba for Multi-View Medical Image Classification [31.897467054280504]
XFMambaは、マルチビュー医療画像分類の課題を解決するために、純粋なマンバベースのクロスフュージョンアーキテクチャである。
XFMambaは、新しい2段階融合戦略を導入し、シングルビューの特徴の学習と、それらの相互ビューの相違を容易にする。
その結果、既存の畳み込みベースおよびトランスフォーマーベースのマルチビュー手法よりも優れた結果が得られた。
論文 参考訳(メタデータ) (2025-03-04T13:38:58Z) - Dual-scale Enhanced and Cross-generative Consistency Learning for Semi-supervised Medical Image Segmentation [49.57907601086494]
医用画像のセグメンテーションはコンピュータ支援診断において重要な役割を担っている。
半教師型医用画像(DEC-Seg)のための新しいDual-scale Enhanced and Cross-generative consistency learning frameworkを提案する。
論文 参考訳(メタデータ) (2023-12-26T12:56:31Z) - Improving Misaligned Multi-modality Image Fusion with One-stage
Progressive Dense Registration [67.23451452670282]
多モード画像間の相違は、画像融合の課題を引き起こす。
マルチスケールプログレッシブ・センス・レジストレーション方式を提案する。
このスキームは、一段階最適化のみで粗大な登録を行う。
論文 参考訳(メタデータ) (2023-08-22T03:46:24Z) - Efficient Bilateral Cross-Modality Cluster Matching for Unsupervised Visible-Infrared Person ReID [56.573905143954015]
本稿では, クラスタ間マッチングによるモダリティギャップを低減するための, クラスタマッチングに基づく新たな学習フレームワークを提案する。
このような監視信号の下では、クラスタレベルで特徴を協調的に整列させるために、モダリティ・特定・モダリティ・非依存(MSMA)コントラスト学習フレームワークが提案されている。
公開SYSU-MM01とRegDBデータセットの実験により,提案手法の有効性が示された。
論文 参考訳(メタデータ) (2023-05-22T03:27:46Z) - FER-former: Multi-modal Transformer for Facial Expression Recognition [14.219492977523682]
本稿では,表情認識のための多孔性監視ステアリングトランスを提案する。
提案手法は,多粒性埋め込み統合,ハイブリッド自己アテンション方式,及びヘテロジニアス・ドメイン・ステアリング・インスペクションを特徴とする。
人気のあるベンチマークの実験では、既存の最先端技術よりも提案されたFER-formerの方が優れていることが示されている。
論文 参考訳(メタデータ) (2023-03-23T02:29:53Z) - Cascaded Human-Object Interaction Recognition [175.60439054047043]
マルチステージで粗大なHOI理解のためのカスケードアーキテクチャを提案する。
各段階で、インスタンスローカライゼーションネットワークは、HOI提案を段階的に洗練し、インタラクション認識ネットワークにフィードする。
慎重に設計された人間中心の関係機能により、これらの2つのモジュールは効果的な相互作用理解に向けて協調的に機能する。
論文 参考訳(メタデータ) (2020-03-09T17:05:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。