論文の概要: HiSC: Hierarchical Spatial Clustering Token Compression for Efficient 3D Scene Understanding
- arxiv url: http://arxiv.org/abs/2608.04610v1
- Date: Wed, 05 Aug 2026 09:15:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.79672
- Title: HiSC: Hierarchical Spatial Clustering Token Compression for Efficient 3D Scene Understanding
- Title(参考訳): HiSC: 効率的な3次元シーン理解のための階層的空間クラスタリングトーケン圧縮
- Authors: Jiuhe Qu, Yingping Liang, Ying Fu,
- Abstract要約: 3次元視覚言語モデル(3次元VLM)は、多視点シーン上の空間的推論を可能にするが、相当なトークン冗長性に悩まされる。
3次元VLMにおける階層的空間クラスタリングトークン圧縮のためのトレーニングフリーフレームワークである textbfHiSC を提案する。
HiSCはトークンレベルの選択から、トークンを空間的に接地されたクラスタに整理することで、クラスタレベルの処理までトークン圧縮を解除する。
- 参考スコア(独自算出の注目度): 16.080049512272026
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: 3D vision-language models (3D VLMs) enable spatial reasoning over multi-view scenes but suffer from substantial token redundancy due to duplicated observations and large uninformative regions, leading to high computational cost. Although visual token compression has shown promise in accelerating 2D VLMs, it fails to capture the structured nature of 3D scenes and leads to incomplete spatial coverage and loss of fine-grained details. In this paper, we propose \textbf{HiSC}, a training-free framework for hierarchical spatial clustering token compression in 3D VLMs. HiSC lifts token compression from token-level selection to cluster-level processing by organizing tokens into spatially grounded clusters using joint geometric and semantic cues. Specifically, we first introduce a \textbf{spatial graph-based merging (SGraM) strategy} that models cross-view redundancy as spatial connectivity and consolidates physically consistent regions, effectively merging extremely similar redundant tokens prior to LLM inference. We then propose a \textbf{spatial clustering-based pruning (SCluP) paradigm} within LLM inference, which performs hierarchical compression across clusters and within clusters, preserving object instance completeness while retaining fine-grained details for important regions. Extensive experiments on diverse 3D reasoning benchmarks show validate the effectiveness of HiSC, particularly under high visual token pruning ratios. Besides, HiSC achieves over 90\% token reduction with minimal performance degradation. Code is accessible at https://github.com/elecreak/HiSC.
- Abstract(参考訳): 3次元視覚言語モデル(3D VLM)は、多視点シーンでの空間的推論を可能にするが、重複した観察と大きな非形式領域によるトークンの冗長性に悩まされ、計算コストが高い。
視覚的トークン圧縮は2D VLMを加速させる可能性を示しているが、3Dシーンの構造的性質を捉えず、不完全な空間的カバレッジと細かな詳細の喪失をもたらす。
本稿では,3次元VLMにおける階層的空間クラスタリングトークン圧縮のためのトレーニングフリーフレームワークであるtextbf{HiSC}を提案する。
HiSCはトークンレベルの選択からクラスタレベルの処理まで,トークンを空間的に接地したクラスタに整理する。
具体的には、まず、空間接続性としてクロスビュー冗長性をモデル化し、物理的に一貫した領域を統合し、LLM推論に先立って非常に類似した冗長トークンをマージする、SGraM(textbf{spatial graph-based merging)戦略を導入する。
次に、LLM推論において、クラスタ間およびクラスタ内における階層的圧縮を行い、重要な領域の詳細な詳細を維持しながら、オブジェクトインスタンスの完全性を保ちながら、オブジェクトインスタンスの完全性を保ちながら、オブジェクトインスタンスの階層的圧縮を行う、textbf{spatial clustering-based pruning (SCluP)パラダイムを提案する。
多様な3次元推論ベンチマークの広範囲な実験は、特に高い視覚トークンプルーニング比下で、HiSCの有効性を実証している。
さらに、HiSCは、パフォーマンスの低下を最小限に抑えて、90\%以上のトークン削減を実現している。
コードはhttps://github.com/elecreak/HiSCでアクセスできる。
関連論文リスト
- Unfolding 3D Gaussian Splatting via Iterative Gaussian Synopsis [48.743921535513635]
イテレーティブ・ガウス・シンプシス(Iterative Gaussian Synopsis)は、トップダウンの「展開」スキームを通じてコンパクトでプログレッシブなレンダリングを行うための新しいフレームワークである。
提案手法は3DGSモデルから始まり,適応的かつ学習可能なマスクベースプルーニング機構を用いて,粗いLODを反復的に導出する。
この組み合わせはコンパクトで表現力のある特徴表現を生み出し、冗長性を最小化し、効率よく、レベル固有の適応をサポートするように設計されている。
論文 参考訳(メタデータ) (2026-04-13T16:28:35Z) - Towards Foundation Models for 3D Scene Understanding: Instance-Aware Self-Supervised Learning for Point Clouds [53.82500407523346]
PointINSは、幾何学的学習を通じてポイントクラウド表現を豊かにする、インスタンス指向の自己組織化フレームワークである。
PointINSは、屋内のインスタンスセグメンテーションで平均+3.5%のmAP改善、屋外のパン光学セグメンテーションで+4.1%のPQゲインを達成している。
論文 参考訳(メタデータ) (2026-03-26T08:31:06Z) - LaSSM: Efficient Semantic-Spatial Query Decoding via Local Aggregation and State Space Models for 3D Instance Segmentation [21.566771922153027]
競争性能を維持しつつ、シンプルさと効率性を優先するLaSSMを紹介します。
また、問合せを段階的に洗練する座標誘導状態空間モデル(SSM)デコーダを提案する。
LaSSMは最新のScanNet++ V2リーダーボードで1位にランクインし、以前のベストメソッドよりも2.5% mAP、1/3 FLOPを上回っている。
論文 参考訳(メタデータ) (2026-02-11T16:34:12Z) - Deep Global Clustering for Hyperspectral Image Segmentation: Concepts, Applications, and Open Challenges [1.9116784879310027]
ハイパースペクトルイメージング(HSI)解析は、利用可能なメモリを超える大量のデータ量のために計算ボトルネックに直面している。
本稿では,メモリ効率の高いHSIセグメンテーションの概念フレームワークであるDeep Global Clustering (DGC)について述べる。
DGCは、重複するリージョンを持つ小さなパッチを使用して一貫性を強制し、コンシューマハードウェア上で30分未満のトレーニングを可能にする。
論文 参考訳(メタデータ) (2025-12-30T12:10:43Z) - C3G: Learning Compact 3D Representations with 2K Gaussians [55.04010158339562]
近年の手法では3次元ガウススプラッティングを再構成に用い, シーン理解のための2D-to-3D機能昇降ステージが提案されている。
提案するC3Gは,空間的にのみコンパクトな3次元ガウスを推定する新しいフィードフォワードフレームワークである。
論文 参考訳(メタデータ) (2025-12-03T17:59:05Z) - CORE: Compact Object-centric REpresentations as a New Paradigm for Token Merging in LVLMs [29.08277140543501]
視覚的トークン圧縮のための新しいパラダイムであるCORE(Compact Object-centric Representation)を紹介する。
COREは効率的なセグメンテーションデコーダを利用してオブジェクトマスクを生成する。
実験により、COREは固定レート圧縮のための6つの信頼性ベンチマークに対して新しい最先端のベンチマークを確立するだけでなく、適応レート設定において劇的な効率向上を達成することが示された。
論文 参考訳(メタデータ) (2025-11-18T03:02:23Z) - Have We Scene It All? Scene Graph-Aware Deep Point Cloud Compression [18.40946383877556]
セマンティックシーングラフに基づくディープ圧縮フレームワークを提案する。
このフレームワークは最先端の圧縮速度を実現し,データサイズを最大98%削減することを示す。
マルチロボットのポーズグラフ最適化やマップマージといった下流アプリケーションをサポートする。
論文 参考訳(メタデータ) (2025-10-09T17:45:09Z) - Point Linguist Model: Segment Any Object via Bridged Large 3D-Language Model [51.02616473941499]
大規模言語モデル(LLM)による3Dオブジェクトのセグメンテーションは、その広範囲なセマンティクス、タスクの柔軟性、強力な一般化により、広く普及しているパラダイムとなっている。
LLMは高レベルなセマンティックトークンを処理し、3次元の点雲は密度の高い幾何学的構造のみを伝達する。
本稿では,LLMと高密度3次元点雲の間の表現ギャップを橋渡しする一般フレームワークであるポイント言語モデル(PLM)を提案する。
論文 参考訳(メタデータ) (2025-09-09T15:01:28Z) - Self-Supervised and Generalizable Tokenization for CLIP-Based 3D Understanding [87.68271178167373]
凍結したCLIPバックボーンを用いたスケール不変表現学習のためのユニバーサル3Dトークン化器を提案する。
S4Tokenは、シーンスケールに関係なくセマンティックインフォームドトークンを生成するトークン化パイプラインである。
論文 参考訳(メタデータ) (2025-05-24T18:26:30Z) - ClusteringSDF: Self-Organized Neural Implicit Surfaces for 3D Decomposition [32.99080359375706]
ClusteringSDFは、ニューラルな暗黙の表面表現を通して3次元のセグメンテーションと再構成を実現するための新しいアプローチである。
ScanNetとReplicaのデータセットから得られた挑戦的なシーンにおける実験結果から,ClusteringSDFが競争力を発揮することを示す。
論文 参考訳(メタデータ) (2024-03-21T17:59:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。