論文の概要: ORCA: ORgan-Centroid Aggregation for Training-Free 3D CT Visual Token Compression
- arxiv url: http://arxiv.org/abs/2608.00345v1
- Date: Fri, 31 Jul 2026 23:27:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:24.605053
- Title: ORCA: ORgan-Centroid Aggregation for Training-Free 3D CT Visual Token Compression
- Title(参考訳): ORCA-ORgan-Centroid aggregation for training-free 3D CT Visual Token Compression
- Abstract要約: 視覚言語モデルに入る3次元CTスキャンは、視覚トークンの長いシーケンスを生成する。
トーケン圧縮は一般的な視覚ではよく研究されているが、特に3次元CTを対象とするものはほとんどない。
3次元CT用トークン圧縮機 textbfORCA (ORgan-Centroid Aggregation) を提案する。
- 参考スコア(独自算出の注目度): 14.376246048056379
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A 3D CT scan entering a vision-language model produces a long sequence of visual tokens, often thousands to tens of thousands per volume, and this sequence must be compressed before a language model can consume it. Token compression is well studied in general vision, but little of it targets 3D CT specifically. A common baseline is grid average, which pools regular grid cells and can blend distinct anatomy, lesion, and air into one token. We present \textbf{ORCA} (ORgan-Centroid Aggregation), a token compressor for 3D CT. It merges adjacent tokens with organ guidance and adds a sinusoidal encoding of each region's centroid to preserve spatial layout. This preserves the anatomical information a downstream model needs. ORCA is training-free and plug-and-play, producing an adjustable token set without any model change or text query. We evaluate it across two datasets (CT-RATE and Merlin) and five encoders. The evaluation spans two task types: attribute prediction over five families (size, density, location, texture, and disease) and text generation (visual question answering and report generation). At matched token budgets, ORCA improves consistently over existing compression methods. It shrinks the visual context $64\times$ and its KV-cache $50\times$, and is $31\times$ faster to process each volume. Code released at https://github.com/renjie-liang/ORCA-3DCT.
- Abstract(参考訳): 視覚言語モデルに入る3D CTスキャンは、しばしば数万から数万のボリュームの長い視覚トークン列を生成し、このシーケンスは言語モデルがそれを消費する前に圧縮されなければならない。
トーケン圧縮は一般的な視覚ではよく研究されているが、特に3次元CTを対象とするものはほとんどない。
一般的なベースラインはグリッド平均であり、通常のグリッド細胞をプールし、解剖学、病変、空気を1つのトークンにブレンドすることができる。
本稿では,3次元CT用トークン圧縮機であるtextbf{ORCA} (Organ-Centroid Aggregation) について述べる。
隣接するトークンと臓器誘導を結合し、各領域のセントロイドの正弦波符号化を加えて空間的レイアウトを保存する。
これは下流モデルに必要な解剖学的情報を保存する。
ORCAはトレーニングフリーでプラグアンドプレイで、モデル変更やテキストクエリなしで調整可能なトークンセットを生成する。
我々はCT-RATEとMerlinの2つのデータセットと5つのエンコーダで評価した。
評価は5つのファミリー(サイズ、密度、位置、テクスチャ、病気)に対する属性予測と、テキスト生成(視覚的質問応答とレポート生成)の2つのタスクタイプにまたがる。
一致するトークン予算では、ORCAは既存の圧縮方法よりも一貫して改善される。
ビジュアルコンテキストの640\times$とKV-cache 50\times$を縮小し、各ボリュームの処理速度を311\times$に短縮する。
https://github.com/renjie-liang/ORCA-3DCTで公開されている。
関連論文リスト
- CoVeR: Coverage-Based Token Pruning for Multi-View 3D Reasoning in VLMs [58.22241532542095]
3Dシーンをマルチビュー画像として表現することで、2D VLMは事前学習の事前知識を再利用し、注釈付き3Dデータの不足を補うことで3Dを推論することができる。
既存の視覚トークンプルーナーは2つのファミリーに分かれ、それぞれが3Dマルチビュー設定に制限される。
空間被覆は3次元推論性能と関連し,トークン座標のみを用いた決定論的学習自由セレクタであるCoVeRを導入し,学習信号を持たないことを示す。
論文 参考訳(メタデータ) (2026-09-08T07:16:37Z) - CARVE: Cross-Slice Anisotropic Reallocation of Visual Evidence for Efficient 3D Medical Volume Understanding [8.918770994951872]
スライスベースのMLLMは、成熟した2Dエンコーダを利用して、3Dボリュームを2Dスライスシーケンスとして表現する。
このスライス的な定式化は、LCMのバックボーンを負担する数千の視覚トークンを生成する。
我々は、LCMの推論に先立って視覚トークンを圧縮し、トークンの削減を予算制約2.5D割当としてキャストするトレーニングフリーフレームワークであるCARVEを提案する。
論文 参考訳(メタデータ) (2026-08-05T06:49:49Z) - Cheap Probes Predict Expensive Training in 3D-CT Vision--Language Models [1.3198689566654107]
イメージグラウンドのプローブベンチマークを (エンコーダ$times$ compression) セル上に構築します。
予備研究では、各プローブを一致した下流タスクとペアリングする。
ホールドアップすると、エンコーダと圧縮の選択はフリーズトーケンプローブで数分でスクリーニングできる。
論文 参考訳(メタデータ) (2026-07-24T04:28:33Z) - Artifact Reduction in Undersampled 3D Cone-Beam CTs using a Hybrid 2D-3D CNN Framework [3.460998655164144]
アンダーサンプドCTボリュームは、画像品質と診断ユーティリティを劣化させるアーティファクトを導入します。
本稿では,2次元モデルと3次元モデルの強みを組み合わせたハイブリッドディープラーニングフレームワークを提案する。
提案手法は2次元処理の計算効率と3次元モデリングによる整合性とのバランスをとる。
論文 参考訳(メタデータ) (2026-02-09T14:36:05Z) - Better Tokens for Better 3D: Advancing Vision-Language Modeling in 3D Medical Imaging [19.44554736205812]
BTB3D(Better Tokens for Better 3D)は2Dと3Dのトレーニングと推論を統一した因果畳み込みエンコーダである。
3段階の訓練カリキュラムでは、(i)局所的な再構築、(ii)オーバーラップウインドウタイリング、(iii)ロングコンテクストデコーダリファインメントが可能である。
BLEUスコアを向上し、CT2Rep、CT-CHAT、Merlinよりも臨床F1を40%向上させる。
GenerateCTやMedSynと比べて、FIDを75%削減し、FVDを半減する。
論文 参考訳(メタデータ) (2025-10-23T15:13:13Z) - Self-Supervised and Generalizable Tokenization for CLIP-Based 3D Understanding [87.68271178167373]
凍結したCLIPバックボーンを用いたスケール不変表現学習のためのユニバーサル3Dトークン化器を提案する。
S4Tokenは、シーンスケールに関係なくセマンティックインフォームドトークンを生成するトークン化パイプラインである。
論文 参考訳(メタデータ) (2025-05-24T18:26:30Z) - DCFormer: Efficient 3D Vision-Language Modeling with Decomposed Convolutions [6.464464511743737]
我々は,3次元畳み込みを深さ,高さ,幅の3つの平行1次元畳み込みに分解する,効率的な3次元画像エンコーダDCFormerを紹介する。
ゼロショットと微調整による18の病理診断では、DCFormerは最先端の3Dビジョンエンコーダよりも一貫して優れている。
論文 参考訳(メタデータ) (2025-02-07T17:10:22Z) - VoxelKP: A Voxel-based Network Architecture for Human Keypoint
Estimation in LiDAR Data [53.638818890966036]
textitVoxelKPは、LiDARデータにおける人間のキーポイント推定に適した、完全にスパースなネットワークアーキテクチャである。
本研究では,人間の各インスタンス内のキーポイント間の空間的相関を学習するために,スパースボックスアテンションを導入する。
鳥の視線を符号化する2次元格子に3次元ボクセルを投影する際に, 絶対的な3次元座標を利用するために空間符号化を組み込んだ。
論文 参考訳(メタデータ) (2023-12-11T23:50:14Z) - Multi-View Vertebra Localization and Identification from CT Images [57.56509107412658]
我々は,CT画像からの多視点椎体局在と同定を提案する。
本研究では,3次元問題を異なる視点における2次元局所化および識別タスクに変換する。
本手法は,多視点グローバル情報を自然に学習することができる。
論文 参考訳(メタデータ) (2023-07-24T14:43:07Z) - EPCL: Frozen CLIP Transformer is An Efficient Point Cloud Encoder [60.52613206271329]
本稿では,冷凍CLIP変換器を用いて高品質のクラウドモデルをトレーニングするための textbfEfficient textbfPoint textbfCloud textbfLearning (EPCL) を提案する。
我々のEPCLは、2D-3Dデータをペア化せずに画像の特徴と点雲の特徴を意味的に整合させることで、2Dと3Dのモダリティを接続する。
論文 参考訳(メタデータ) (2022-12-08T06:27:11Z) - Two-Stream Graph Convolutional Network for Intra-oral Scanner Image
Segmentation [133.02190910009384]
本稿では,2ストリームグラフ畳み込みネットワーク(TSGCN)を提案する。
TSGCNは3次元歯(表面)セグメンテーションにおいて最先端の方法よりも優れています。
論文 参考訳(メタデータ) (2022-04-19T10:41:09Z) - Not All Tokens Are Equal: Human-centric Visual Analysis via Token
Clustering Transformer [91.49837514935051]
我々はToken Clustering Transformer(TCFormer)と呼ばれる新しいビジョントランスを提案する。
TCTCerはトークンをプログレッシブクラスタリングによってマージし、トークンはフレキシブルな形状とサイズで異なる場所からマージすることができる。
実験によると、TCFormerは人間中心のさまざまなタスクやデータセットにおいて、一貫してその能力を上回っている。
論文 参考訳(メタデータ) (2022-04-19T05:38:16Z) - Cherry-Picking Gradients: Learning Low-Rank Embeddings of Visual Data
via Differentiable Cross-Approximation [53.95297550117153]
本稿では,大規模な視覚データテンソルの処理を行うエンドツーエンドのトレーニング可能なフレームワークを提案する。
提案手法は大規模多次元グリッドデータや,大規模受容領域上のコンテキストを必要とするタスクに特に有用である。
論文 参考訳(メタデータ) (2021-05-29T08:39:57Z) - Learning Hybrid Representations for Automatic 3D Vessel Centerline
Extraction [57.74609918453932]
3次元医用画像からの血管の自動抽出は血管疾患の診断に不可欠である。
既存の方法では、3次元画像からそのような細い管状構造を分割する際に、抽出された容器の不連続に悩まされることがある。
抽出された船舶の連続性を維持するためには、地球的幾何学を考慮に入れる必要があると論じる。
この課題を解決するためのハイブリッド表現学習手法を提案します。
論文 参考訳(メタデータ) (2020-12-14T05:22:49Z) - Uniformizing Techniques to Process CT scans with 3D CNNs for
Tuberculosis Prediction [5.270882613122642]
深部2次元畳み込みニューラルネットワーク(CNN)を用いたボリュームデータにおける医用画像解析への共通アプローチ
個々のスライスを2D CNNで独立に扱うと、意図したタスクのパフォーマンスが低下する深度情報を意図的に破棄する。
上記の問題に対処するためのボリューム均一化手法のセットを評価する。
画像情報のみを活用する全手法に勝るテストセットに対して,曲線下面積 (AUC) と二分分類精度 (ACC) を67.5%と報告した。
論文 参考訳(メタデータ) (2020-07-26T21:53:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。