論文の概要: MedARC: Training-Free Adaptive Redundancy Compression of Visual Tokens for 3D Medical Vision-Language Models
- arxiv url: http://arxiv.org/abs/2607.26554v1
- Date: Wed, 29 Jul 2026 07:27:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.56601
- Title: MedARC: Training-Free Adaptive Redundancy Compression of Visual Tokens for 3D Medical Vision-Language Models
- Title(参考訳): MedARC:3次元医用ビジョンランゲージモデルのための訓練不要な視覚トークンの適応冗長圧縮
- Authors: Yitao Zhu, Mengjun Liu, Yingji Fu, Haowen Pang, Anqi Qiu,
- Abstract要約: 本稿では、3次元医用視覚言語モデルにおける視覚トークンの適応冗長圧縮のためのフレームワークであるMedARCを提案する。
MedARCは3つの補完的手がかりを統合することでトークンの重要性を推定する。
CT-RATEとMR-RATEの実験により、MedARCは診断性能を保留または改善しながら、視覚的トーケンのオーバーヘッドと推論時間を短縮することが示された。
- 参考スコア(独自算出の注目度): 3.8740159612186265
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Integrating 3D medical images with vision-language models (VLMs) holds substantial promise for computer-aided diagnosis. However, volumetric images generate prohibitively long visual-token sequences with considerable spatial and inter-slice redundancy. Existing token compression methods typically apply uniform reduction or rely on a single importance signal, increasing the risk of removing regions that are clinically relevant to the query or structurally distinctive. To address this limitation, we propose MedARC, a unified, training-free framework for Adaptive Redundancy Compression of visual tokens in 3D medical VLMs. MedARC estimates token importance by integrating three complementary cues: self-attention from the VLM vision encoder, which reflects the model's intrinsic visual focus; similarity between projected visual tokens and text embeddings, which identifies query-relevant regions; and deviations of local visual foundation model features from the volume-level feature center, which highlight structurally distinctive anatomy. The resulting importance distribution guides a saliency-aware merging strategy that preserves informative tokens while consolidating redundant ones rather than simply discarding them. Experiments on CT-RATE and MR-RATE show that MedARC reduces visual-token overhead and inference time while preserving or improving diagnostic performance. Its multi-cue scoring cost is outweighed by the savings from processing fewer tokens, with greater benefits expected for larger language models.
- Abstract(参考訳): 3次元医用画像と視覚言語モデル(VLM)を統合することは、コンピュータ支援診断にかなり有望である。
しかし、ボリューム画像は、空間的およびスライス間冗長性の高い、非常に長い視覚的トーケンシーケンスを生成する。
既存のトークン圧縮法は、一般に一様還元または単一の重要信号に依存し、クエリに臨床的に関連がある領域を除去するリスクを増大させる。
この制限に対処するため、3D医療用VLMにおける視覚トークンの適応冗長圧縮のための統一的学習自由フレームワークであるMedARCを提案する。
MedARCは、VLMビジョンエンコーダからの自己注意、クエリ関連領域を識別する投影された視覚トークンとテキスト埋め込みの類似性、ボリュームレベルの特徴中心からの局所的な視覚基盤モデルの特徴の偏差、構造的に特徴的な解剖学を反映した3つの補完的手がかりを統合することでトークンの重要性を見積もっている。
結果として生じる重要性の分布は、単に捨てるのではなく、冗長なトークンを集約しながら情報的トークンを保存する、唾液を意識したマージ戦略を導く。
CT-RATEとMR-RATEの実験により、MedARCは診断性能を保留または改善しながら、視覚的トーケンのオーバーヘッドと推論時間を短縮することが示された。
マルチキュースコアのコストは、より少ないトークンの処理による節約よりも優れており、より大きな言語モデルにより大きなメリットが期待できる。
関連論文リスト
- SCALPEL: Semantic Cross-modal Alignment via LLM-Powered Encoder Learning for Medical Vision-Language Representation [5.487826115955642]
ビジョン言語による事前訓練は、医学的マルチモーダル表現学習の基盤となる。
textbfLLM-textbfPowered textbfEncoder textbfLearning による textbfSemantic textbfCross-modal textbfAlignment フレームワーク textbfSCALPEL を提案する。
論文 参考訳(メタデータ) (2026-07-29T13:12:32Z) - Disease-Centric Vision-Language Pretraining with Hybrid Visual Encoding for 3D Computed Tomography [75.7789001619107]
ビジョン言語による事前トレーニングは、汎用医療AIにとって大きな可能性を秘めている。
3つの主要なコンポーネントを特徴とするフレームワークを提案する。
診断対応プロンプト戦略では、トレーニング前の推論ギャップを埋めるために、実際の臨床用語と集約された疾患プロトタイプを用いている。
論文 参考訳(メタデータ) (2026-06-24T08:24:45Z) - Med-DisSeg: Dispersion-Driven Representation Learning for Fine-Grained Medical Image Segmentation [3.182068203318624]
分散駆動型医用画像分割フレームワークであるMed DisSegを提案する。
Med DisSegは、軽量のDispersive Lossと、微粒な構造セグメンテーションのための適応的な注意を組み合わせる。
我々は,Med DisSegが多臓器CTのセグメンテーションにおいて,その堅牢性とクロスタスク適用性をサポートして競合的な結果を得ることを示す。
論文 参考訳(メタデータ) (2026-05-14T08:49:36Z) - MedPruner: Training-Free Hierarchical Token Pruning for Efficient 3D Medical Image Understanding in Vision-Language Models [59.180043227905294]
MedPrunerは、3次元医用画像の効率的な理解のためのトレーニング不要でモデルに依存しない階層的トークンプレーニングフレームワークである。
我々は、MedPrunerによって、MedGemmaのようなモデルが元の性能を維持したり、超えたりすることが可能であり、ビジュアルトークンの5%以下を維持していることを示す。
論文 参考訳(メタデータ) (2026-03-12T07:37:00Z) - Look Carefully: Adaptive Visual Reinforcements in Multimodal Large Language Models for Hallucination Mitigation [51.743225614196774]
マルチモーダル大言語モデル (MLLM) は視覚言語推論において顕著な進歩を遂げている。
彼らは幻覚に弱いままであり、そこで生成されたコンテンツは視覚的証拠から逸脱する。
近年の視覚強調法では、復号時に視覚トークンを補強することでこの問題に対処しようとしている。
本稿では,MLLMのトレーニングフリーフレームワークであるAdaptive Visual Reinforcement (AIR)を提案する。
論文 参考訳(メタデータ) (2026-02-27T14:18:51Z) - Staged Voxel-Level Deep Reinforcement Learning for 3D Medical Image Segmentation with Noisy Annotations [4.581671524490035]
本稿では,ノイズの多いアノテーションの下での堅牢な医用画像分割のためのエンドツーエンドのVoxel-Level Deep Reinforcement Learningフレームワークを提案する。
このフレームワークは動的反復的な更新戦略を使用して,手作業による介入を必要とせずに,誤ったラベルの影響を自動的に緩和する。
論文 参考訳(メタデータ) (2026-01-07T12:39:54Z) - MIRNet: Integrating Constrained Graph-Based Reasoning with Pre-training for Diagnostic Medical Imaging [67.74482877175797]
MIRNetは、自己教師付き事前学習と制約付きグラフベースの推論を統合する新しいフレームワークである。
TongueAtlas-4Kは,22の診断ラベルを付した4,000枚の画像からなるベンチマークである。
論文 参考訳(メタデータ) (2025-11-13T06:30:41Z) - VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine [11.993301266706139]
我々は,3次元CTや関連する放射線学報告など,限られたボリュームデータを対象とした視覚言語事前学習フレームワーク「textbfVELVET-Med」を提案する。
本研究は,ボリューム医療画像とそれに対応する臨床物語に埋め込まれた,豊かな空間的・意味的関係を明らかにすることを目的としている。
結果として得られるエンコーダは強い転送可能性を示し、幅広い下流タスクで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2025-08-16T17:08:43Z) - Mitigating Hallucination for Large Vision Language Model by Inter-Modality Correlation Calibration Decoding [66.06337890279839]
大規模視覚言語モデル(LVLM)は、下流のマルチモーダルタスクに対する視覚言語理解において顕著な能力を示している。
LVLMは、複雑な生成タスクにおいて幻覚を生じさせ、視覚入力と生成されたコンテンツの間に矛盾が生じている。
本研究では,LVLMにおける幻覚を無訓練で緩和するIMCCD法を提案する。
論文 参考訳(メタデータ) (2025-01-03T17:56:28Z) - Disruptive Autoencoders: Leveraging Low-level features for 3D Medical
Image Pre-training [51.16994853817024]
本研究は、3Dラジオグラフィ画像のための効果的な事前学習フレームワークの設計に焦点をあてる。
ローカルマスキングと低レベルの摂動の組み合わせによって生成された破壊から、オリジナルのイメージを再構築しようとする事前トレーニングフレームワークであるDisruptive Autoencodersを紹介する。
提案する事前トレーニングフレームワークは、複数のダウンストリームタスクでテストされ、最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2023-07-31T17:59:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。