論文の概要: CARVE: Cross-Slice Anisotropic Reallocation of Visual Evidence for Efficient 3D Medical Volume Understanding
- arxiv url: http://arxiv.org/abs/2608.04515v1
- Date: Wed, 05 Aug 2026 06:49:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.764668
- Title: CARVE: Cross-Slice Anisotropic Reallocation of Visual Evidence for Efficient 3D Medical Volume Understanding
- Title(参考訳): CARVE:効率的な3次元医用ボリューム理解のための視覚的証拠のクロススライス異方性再配置
- Authors: Zhenyu Yi, Qiang Hu, Zhenhao Li, Jiaxuan Zhao, Yusong Sun, Lichi Zhang,
- Abstract要約: スライスベースのMLLMは、成熟した2Dエンコーダを利用して、3Dボリュームを2Dスライスシーケンスとして表現する。
このスライス的な定式化は、LCMのバックボーンを負担する数千の視覚トークンを生成する。
我々は、LCMの推論に先立って視覚トークンを圧縮し、トークンの削減を予算制約2.5D割当としてキャストするトレーニングフリーフレームワークであるCARVEを提案する。
- 参考スコア(独自算出の注目度): 8.918770994951872
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Slice-based MLLMs leverage mature 2D encoders by representing 3D volumes as sequences of 2D slices. However, this slice-wise formulation produces thousands of visual tokens that burden the LLM backbone, many of which capture overlapping visual evidence across adjacent slices. To understand how effectively a growing visual token budget improves performance, we perform scaling analyses on two 3D medical VQA benchmarks and find diminishing returns: cost keeps rising while accuracy saturates, and improving in-plane resolution is more effective than adding slices at comparable budgets. The budget should therefore be allocated more selectively rather than simply enlarged, yet most token compression methods are designed for 2D images or videos, where redundancy arises from spatial layout or temporal motion rather than from near-duplicate content along the depth axis. We present CARVE, a training-free framework that compresses visual tokens prior to LLM inference and casts token reduction as budget-constrained 2.5D allocation. CARVE partitions the depth axis into coherent windows and allocates tokens non-uniformly according to normalized cross-slice evidence. Under a shared budget, CARVE builds spatial anchors on representative slices and retrieves locally varying evidence from the full volume, then merges remaining eligible tokens into nearby anchors within each window. Removing roughly 80% of the visual tokens on Hulu-Med-7B, CARVE leads all compression baselines on every AMOS-MM report-generation metric, with 6.2 points higher retention of full-token quality than the strongest baseline, and preserves 98.1% of full-token performance across three VQA benchmarks.
- Abstract(参考訳): スライスベースのMLLMは、成熟した2Dエンコーダを利用して、3Dボリュームを2Dスライスシーケンスとして表現する。
しかし、このスライス的な定式化は、LCMのバックボーンを負担する数千の視覚トークンを生成し、その多くが隣接するスライスにまたがる重なり合う視覚的証拠を捉えている。
視覚的トークン予算の増大がパフォーマンスをいかに効果的に向上させるかを理解するため、我々は2つの3次元医療用VQAベンチマークのスケーリング分析を行い、コストが上昇し続け、精度が飽和し、面内解像度の改善は、同等の予算でスライスを追加するよりも効果的であることを示す。
したがって、予算は単に拡大するのではなく、より選択的に配分されるべきであるが、ほとんどのトークン圧縮方法は、2D画像やビデオのために設計されている。
我々は、LCMの推論に先立って視覚トークンを圧縮し、トークンの削減を予算制約2.5D割当としてキャストするトレーニングフリーフレームワークであるCARVEを提案する。
CARVEは、深さ軸をコヒーレントウィンドウに分割し、正規化されたクロススライス証拠に従ってトークンを一様に割り当てる。
共有予算の下で、CARVEは代表スライスに空間的アンカーを構築し、全ボリュームから局所的に異なる証拠を回収し、各ウィンドウ内の周辺アンカーに残ったトークンをマージする。
CARVEはHulu-Med-7Bの視覚トークンの約80%を取り除き、AMOS-MMレポート生成基準のすべての圧縮ベースラインをリードする。
関連論文リスト
- HiSC: Hierarchical Spatial Clustering Token Compression for Efficient 3D Scene Understanding [16.080049512272026]
3次元視覚言語モデル(3次元VLM)は、多視点シーン上の空間的推論を可能にするが、相当なトークン冗長性に悩まされる。
3次元VLMにおける階層的空間クラスタリングトークン圧縮のためのトレーニングフリーフレームワークである textbfHiSC を提案する。
HiSCはトークンレベルの選択から、トークンを空間的に接地されたクラスタに整理することで、クラスタレベルの処理までトークン圧縮を解除する。
論文 参考訳(メタデータ) (2026-08-05T09:15:43Z) - MedARC: Training-Free Adaptive Redundancy Compression of Visual Tokens for 3D Medical Vision-Language Models [3.8740159612186265]
本稿では、3次元医用視覚言語モデルにおける視覚トークンの適応冗長圧縮のためのフレームワークであるMedARCを提案する。
MedARCは3つの補完的手がかりを統合することでトークンの重要性を推定する。
CT-RATEとMR-RATEの実験により、MedARCは診断性能を保留または改善しながら、視覚的トーケンのオーバーヘッドと推論時間を短縮することが示された。
論文 参考訳(メタデータ) (2026-07-29T07:27:09Z) - Efficient3D: A Unified Framework for Adaptive and Debiased Token Reduction in 3D MLLMs [37.792545310147965]
本稿では,視覚的トークンプルーニングのための統合フレームワークであるEfficient3Dを提案する。
Scan2CapデータセットのCIDErは+2.57%向上した。
論文 参考訳(メタデータ) (2026-04-03T03:32:55Z) - MedPruner: Training-Free Hierarchical Token Pruning for Efficient 3D Medical Image Understanding in Vision-Language Models [59.180043227905294]
MedPrunerは、3次元医用画像の効率的な理解のためのトレーニング不要でモデルに依存しない階層的トークンプレーニングフレームワークである。
我々は、MedPrunerによって、MedGemmaのようなモデルが元の性能を維持したり、超えたりすることが可能であり、ビジュアルトークンの5%以下を維持していることを示す。
論文 参考訳(メタデータ) (2026-03-12T07:37:00Z) - Prune Redundancy, Preserve Essence: Vision Token Compression in VLMs via Synergistic Importance-Diversity [54.95089105944234]
視覚言語モデル(VLM)は、過剰な視覚トークンの生成によって引き起こされる計算の非効率性に直面する。
2段階パイプラインを特徴とする訓練不要なSynergistic Importance-DiversityアプローチPruneSIDを提案する。
LLaVA-NeXTでは11.1%のトークン保持率で96.3%の精度、極端な圧縮速度(5.6%)で92.8%の精度を実現した。
論文 参考訳(メタデータ) (2026-03-10T10:31:58Z) - Nüwa: Mending the Spatial Integrity Torn by VLM Token Pruning [82.39668822222386]
ビジョントークンプルーニングは、効率的なビジョン言語モデル(VLM)のための効果的なアクセラレーション手法であることが証明された。
空間的整合性を維持しつつ,効率的な特徴集約を実現するための2段階のトークンプルーニングフレームワークである$textNwa$を提案する。
実験によると、textNwa$は複数のVQAベンチマーク(94%から95%)でSOTAのパフォーマンスを達成し、視覚的グラウンドタスク(7%から47%)を大幅に改善している。
論文 参考訳(メタデータ) (2026-02-03T00:51:03Z) - Multimodal Visual Surrogate Compression for Alzheimer's Disease Classification [69.87877580725768]
MVSC(Multimodal Visual Surrogate Compression)は、大規模な3D sMRIボリュームをコンパクトな2D機能に圧縮し、適応させることを学ぶ。
MVSCには2つの重要なコンポーネントがある: テキストガイダンスの下でグローバルなクロススライスコンテキストをキャプチャするボリュームコンテキストと、テキストエンハンスでパッチワイズな方法でスライスレベルの情報を集約するAdaptive Slice Fusionモジュール。
論文 参考訳(メタデータ) (2026-01-29T13:05:46Z) - HCC-3D: Hierarchical Compensatory Compression for 98% 3D Token Reduction in Vision-Language Models [19.63602285036466]
ポイントクラウドとテキストデータ間のマルチモーダル推論を可能にするために、VLM(Vision-Language Models)を活用している。
現在の3D-VLMは、3Dポイントの雲を直接3Dトークンに埋め込む。
このフレームワークはアプリケーションを制限する計算コストが非常に高く、LLM(Large Language Model)の全ての3Dトークンの処理にボトルネックがあることを特定します。
重要な情報の完全性を維持しながら、3Dトークンによってもたらされる計算オーバーヘッドをどうやって削減できるのか?
論文 参考訳(メタデータ) (2025-11-13T02:28:10Z) - econSG: Efficient and Multi-view Consistent Open-Vocabulary 3D Semantic Gaussians [56.85804719947]
3DGSを用いたオープン語彙セマンティックセマンティックセグメンテーションのためのeconSGを提案する。
筆者らのeconSGは,既存手法と比較して,4つのベンチマークデータセット上での最先端性能を示す。
論文 参考訳(メタデータ) (2025-04-08T13:12:31Z) - UNETR++: Delving into Efficient and Accurate 3D Medical Image Segmentation [93.88170217725805]
本稿では,高画質なセグメンテーションマスクと,パラメータ,計算コスト,推論速度の両面での効率性を提供するUNETR++という3次元医用画像セグメンテーション手法を提案する。
我々の設計の核となるのは、空間的およびチャネル的な識別的特徴を効率的に学習する、新しい効率的な対注意ブロック(EPA)の導入である。
Synapse, BTCV, ACDC, BRaTs, Decathlon-Lungの5つのベンチマークで評価した結果, 効率と精度の両面で, コントリビューションの有効性が示された。
論文 参考訳(メタデータ) (2022-12-08T18:59:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。