論文の概要: 3DZip: Spatial-Aware Feature Diversity-Guided Token Compression for 3D Question Answering
- arxiv url: http://arxiv.org/abs/2608.01185v1
- Date: Sun, 02 Aug 2026 12:11:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.114002
- Title: 3DZip: Spatial-Aware Feature Diversity-Guided Token Compression for 3D Question Answering
- Title(参考訳): 3DZip:3D質問応答のための空間的特徴の多様性をガイドしたToken Compression
- Authors: Changwoo Baek, Kyeongbo Kong,
- Abstract要約: 最近の3次元視覚言語モデルは、2次元視覚特徴を世界座標に投影することで幾何学的認識トークンを構築する。
この設計はシーンごとに数千のトークンを生成し、計算とメモリのオーバーヘッドを大幅に増大させる。
3DZipは3段階のトークン圧縮フレームワークで、まず粗いボキセル化を適用して点レベルの冗長性を除去し、次に特徴空間の多様性に基づいてアンカートークンを選択し、最後に空間制約下で残ったトークンをマージして幾何学的コヒーレンスを保存する。
- 参考スコア(独自算出の注目度): 8.79576142391319
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent 3D vision-language models (3D VLMs) construct geometry aware tokens by projecting 2D visual features into world coordinates, enabling spatial reasoning for tasks such as 3D question answering. However, this design generates thousands of tokens per scene, resulting in substantial computational and memory overhead. While token compression has been extensively studied in 2D VLMs, existing approaches rely on semantic relevance or attention-based selection that overlook the structured spatial nature of 3D tokens. Moreover, redundancy in 3D representations cannot be resolved by spatial proximity alone, as object-level token imbalance persists even after spatial aggregation. To address this, we propose 3DZip, a three-stage token compression framework that first applies coarse voxelization to remove point-level redundancy, then selects anchor tokens based on feature-space diversity via a Determinantal Point Process, and finally merges remaining tokens under spatial constraints to preserve geometric coherence. Experiments on three 3D question answering benchmarks demonstrate that 3DZip consistently outperforms existing compression methods, retaining 94.7% of the original performance with only 128 tokens, achieving a $1.92\times$ faster inference speed.
- Abstract(参考訳): 最近の3次元視覚言語モデル(3D VLM)は、2次元視覚特徴を世界座標に投影することで幾何学的認識トークンを構築し、3次元質問応答などのタスクに対する空間的推論を可能にする。
しかし、この設計ではシーンごとに数千のトークンが生成され、計算とメモリのオーバーヘッドが大幅に増大する。
トークン圧縮は2次元VLMで広く研究されているが、既存のアプローチは3次元トークンの構造的な空間的性質を無視する意味的関連性や注意に基づく選択に依存している。
さらに、3次元表現の冗長性は、空間的アグリゲーション後にもオブジェクトレベルのトークン不均衡が持続するため、空間的近接だけでは解決できない。
この問題を解決するために3DZipを提案する。これは3段階のトークン圧縮フレームワークで、まず粗いボキセル化を適用して点レベルの冗長性を除去し、次に決定点プロセスを介して特徴空間の多様性に基づいてアンカートークンを選択し、最後に空間的制約の下で残ったトークンをマージして幾何学的コヒーレンスを保存する。
3D質問応答ベンチマークの実験では、3DZipは既存の圧縮手法を一貫して上回り、128のトークンで94.7%の性能を維持し、1.92\times$高速な推論速度を達成した。
関連論文リスト
- SToRe3D: Sparse Token Relevance in ViTs for Efficient Multi-View 3D Object Detection [2.148411555253816]
ビジョントランスフォーマー(ViT)は強力なマルチビュー3D検出を可能にするが、高密度トークンからの高い推論遅延と、複数のビューと大きな3D領域にわたるクエリ処理によって制限される。
SToRe3Dは2次元画像トークンと3次元オブジェクトクエリを協調的に選択し、再活性化のためのフィルタ機能を格納する。
論文 参考訳(メタデータ) (2026-05-13T20:53:03Z) - SeGPruner: Semantic-Geometric Visual Token Pruner for 3D Question Answering [18.541639027941198]
SeGPrunerは、多視点画像を用いた効率的な3Dのための意味認識および幾何学誘導型トークン還元フレームワークである。
推論効率を大幅に改善し、ビジュアルトークンの予算を91%削減し、推論遅延を86%削減する。
論文 参考訳(メタデータ) (2026-03-31T08:44:04Z) - Cog3DMap: Multi-View Vision-Language Reasoning with 3D Cognitive Maps [77.63233146945718]
マルチビュー画像から明示的な3Dメモリを連続的に構築するフレームワークであるCog3DMapを紹介する。
本フレームワークは空間的に構造化された3次元マップ上での直接推論を可能にし,様々な空間推論ベンチマーク上で最先端の性能を実現する。
論文 参考訳(メタデータ) (2026-03-24T10:05:32Z) - VolumeDP: Modeling Volumetric Representation for Manipulation Policy Learning [29.62906091681386]
VolumeDPは空間アライメントを3Dで明示的に推論することで復元するポリシーアーキテクチャである。
LIBEROシミュレーションベンチマークでは、最先端の平均成功率は88.8%に達する。
論文 参考訳(メタデータ) (2026-03-18T13:40:24Z) - HCC-3D: Hierarchical Compensatory Compression for 98% 3D Token Reduction in Vision-Language Models [19.63602285036466]
ポイントクラウドとテキストデータ間のマルチモーダル推論を可能にするために、VLM(Vision-Language Models)を活用している。
現在の3D-VLMは、3Dポイントの雲を直接3Dトークンに埋め込む。
このフレームワークはアプリケーションを制限する計算コストが非常に高く、LLM(Large Language Model)の全ての3Dトークンの処理にボトルネックがあることを特定します。
重要な情報の完全性を維持しながら、3Dトークンによってもたらされる計算オーバーヘッドをどうやって削減できるのか?
論文 参考訳(メタデータ) (2025-11-13T02:28:10Z) - SeqAffordSplat: Scene-level Sequential Affordance Reasoning on 3D Gaussian Splatting [85.87902260102652]
本稿では, 連続3次元ガウシアン・アフラマンス推論の課題について紹介する。
次に,SeqSplatNetを提案する。SqSplatNetは,命令を直接3Dアベイランスマスクのシーケンスにマッピングするエンドツーエンドフレームワークである。
本手法は,1段階のインタラクションから,シーンレベルでの複雑なシーケンシャルなタスクへの可利用性推論を効果的に向上させる。
論文 参考訳(メタデータ) (2025-07-31T17:56:55Z) - Self-Supervised and Generalizable Tokenization for CLIP-Based 3D Understanding [87.68271178167373]
凍結したCLIPバックボーンを用いたスケール不変表現学習のためのユニバーサル3Dトークン化器を提案する。
S4Tokenは、シーンスケールに関係なくセマンティックインフォームドトークンを生成するトークン化パイプラインである。
論文 参考訳(メタデータ) (2025-05-24T18:26:30Z) - NDC-Scene: Boost Monocular 3D Semantic Scene Completion in Normalized
Device Coordinates Space [77.6067460464962]
SSC(Monocular 3D Semantic Scene Completion)は、単一の画像から複雑なセマンティックスや幾何学的形状を予測し、3D入力を必要としないため、近年大きな注目を集めている。
我々は,3次元空間に投影された2次元特徴の特徴的曖昧さ,3次元畳み込みのPose Ambiguity,深さの異なる3次元畳み込みにおける不均衡など,現在の最先端手法におけるいくつかの重要な問題を明らかにする。
シーン補完ネットワーク(NDC-Scene)を考案し,2を直接拡張する。
論文 参考訳(メタデータ) (2023-09-26T02:09:52Z) - EP2P-Loc: End-to-End 3D Point to 2D Pixel Localization for Large-Scale
Visual Localization [44.05930316729542]
本稿では,3次元点雲の大規模可視化手法EP2P-Locを提案する。
画像中の見えない3D点を除去する簡単なアルゴリズムを提案する。
このタスクで初めて、エンドツーエンドのトレーニングに差別化可能なツールを使用します。
論文 参考訳(メタデータ) (2023-09-14T07:06:36Z) - Learning Joint 2D-3D Representations for Depth Completion [90.62843376586216]
2Dおよび3Dの関節の特徴を抽出することを学ぶシンプルで効果的なニューラルネットワークブロックを設計します。
具体的には、画像画素に2D畳み込みと3D点に連続畳み込みを施した2つのドメイン固有のサブネットワークから構成される。
論文 参考訳(メタデータ) (2020-12-22T22:58:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。