論文の概要: ZipTok3D: High-Fidelity 3D Tokenization with Compact Token Prefixes
- arxiv url: http://arxiv.org/abs/2609.01740v1
- Date: Tue, 01 Sep 2026 18:07:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 17:53:17.80084
- Title: ZipTok3D: High-Fidelity 3D Tokenization with Compact Token Prefixes
- Title(参考訳): ZipTok3D:コンパクトトークンプリフィックスによる高忠実度3Dトークン化
- Abstract要約: ZipTok3Dは、非常に短いトークンシーケンスからの高忠実度再構成のために設計された3Dトークンライザである。
同じトークン次元でZipTok3Dは32token COD-VAEベースラインに匹敵する再現性を実現する。
- 参考スコア(独自算出の注目度): 38.735159381505014
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Compact token sequences are essential for efficient 3D generation. However, existing 3D tokenizers typically organize latent representations either over spatial regions or as fixed-size sets of global tokens, both suffering sharp reconstruction degradation when compressed to extremely low token budgets. In this paper, we present ZipTok3D, a 3D tokenizer designed for high-fidelity reconstruction from extremely short token sequences. Its key idea is to organize object geometry into progressively informative global-token prefixes and unfold these compact representations through iterative decoding. Specifically, nested dropout randomly truncates the latent sequence after encoding during training and requires each retained prefix to reconstruct the complete object, thereby prioritizing essential geometric information in the leading tokens. The decoder then repeatedly applies a parameter-shared Transformer block to recover fine-grained geometry from each prefix without a separate generative sampling stage. With the same token dimension, ZipTok3D achieves reconstruction quality comparable to the 32-token COD-VAE baseline using only one token on ShapeNet and four on TRELLIS, yielding $32\times$ and $8\times$ shorter token sequences, respectively.
- Abstract(参考訳): コンパクトトークンシーケンスは効率的な3D生成に不可欠である。
しかし、既存の3Dトークンライザは、通常、空間領域または固定サイズのグローバルトークンのセットとして遅延表現を整理する。
本稿では,極短トークン列からの高忠実度再構成を目的とした3DトークンマイザZipTok3Dを提案する。
その鍵となる考え方は、オブジェクト幾何学を進歩的に情報に富んだグローバルな接頭辞に整理し、反復的復号によってこれらのコンパクトな表現を広げることである。
具体的には、ネストされたドロップアウトは、トレーニング中にエンコーディングされた後、ランダムに潜伏シーケンスを切断し、保持された各プレフィックスが完全なオブジェクトを再構築する必要があるため、リードトークンに必須の幾何学的情報を優先順位付けする。
その後、デコーダはパラメータ共有トランスフォーマーブロックを繰り返し適用し、別個の生成サンプリングステージなしで各プレフィックスから微細な幾何を復元する。
同じトークン次元でZipTok3Dは、ShapeNet上の1トークンとTRELLIS上の4トークンのみを使用して、32tokenのCOD-VAEベースラインに匹敵する再構築品質を達成し、それぞれ32\times$と8\times$ショートトークンシーケンスを生成する。
関連論文リスト
- 3DZip: Spatial-Aware Feature Diversity-Guided Token Compression for 3D Question Answering [8.79576142391319]
最近の3次元視覚言語モデルは、2次元視覚特徴を世界座標に投影することで幾何学的認識トークンを構築する。
この設計はシーンごとに数千のトークンを生成し、計算とメモリのオーバーヘッドを大幅に増大させる。
3DZipは3段階のトークン圧縮フレームワークで、まず粗いボキセル化を適用して点レベルの冗長性を除去し、次に特徴空間の多様性に基づいてアンカートークンを選択し、最後に空間制約下で残ったトークンをマージして幾何学的コヒーレンスを保存する。
論文 参考訳(メタデータ) (2026-08-02T12:11:51Z) - DynaTok: Token-Based 4D Reconstruction from Partial Point Clouds [86.5916611076068]
DynaTokは、画像のない部分点列からの対応のない4D再構成のための点ベースフレームワークである。
フローマッチングデコーダは、完全な時間的に一貫した4次元の点時間観測を再構成する。
論文 参考訳(メタデータ) (2026-06-10T15:13:14Z) - Spark3R: Asymmetric Token Reduction Makes Fast Feed-Forward 3D Reconstruction [47.55355615080919]
視覚変換器に基づくフィードフォワード3D再構成モデルは,少数の入力画像からシーン形状とカメラポーズを推定することができる。
数百から数千フレームのビデオ入力にスケールすることは、グローバルアテンションレイヤーの二次的なコストのため、依然として難しい。
本稿では,クエリトークンとキー値トークンの圧縮を分離する,トレーニング不要なアクセラレーションフレームワークSpark3Rを提案する。
再トレーニングを必要としないプラグアンドプレイフレームワークとして、Spark3Rは、事前トレーニングされた複数のフィードフォワード3D再構築モデルに直接統合される。
論文 参考訳(メタデータ) (2026-05-07T13:45:37Z) - LoST: Level of Semantics Tokenization for 3D Shapes [50.847769883816085]
State-of-the-artメソッドは、もともとレンダリングと圧縮のために設計された幾何学的なレベル・オブ・ディテール(LoD)階層に依存している。
本稿では,初期接頭辞が完全かつ可塑性な形状をデコードするように,サリエンスを指示するレベル・オブ・セマンティックス・トークン化(LoST)を提案する。
LoSTはSOTA再構成を実現し、幾何的および意味的再構成のメトリクスにおいて、従来のLoDベースの3次元形状トークン化器を大きなマージンで上回っている。
論文 参考訳(メタデータ) (2026-03-18T17:56:06Z) - SceneTok: A Compressed, Diffusable Token Space for 3D Scenes [18.094424146923892]
SceneTokは、シーンのビューセットを圧縮・拡散可能な非構造化トークンセットにエンコードする新しいトークンである。
圧縮が他の表現よりも1~3桁強く、なおも最先端の復元品質に到達していることを示す。
論文 参考訳(メタデータ) (2026-02-21T16:08:17Z) - How Many Tokens Do 3D Point Cloud Transformer Architectures Really Need? [56.09721366421187]
トークンは極めて冗長であり、実質的な非効率性をもたらすことを示す。
本稿では,最大90~95%のトークン数を削減できるグローバルなグラフトークンマージ手法であるgitmerge3Dを紹介する。
この研究は、大規模な3Dトランスフォーマーモデルの冗長性を初めて評価し、より効率的な3D基盤アーキテクチャの開発に関する洞察を提供する。
論文 参考訳(メタデータ) (2025-11-07T17:38:01Z) - Self-Supervised and Generalizable Tokenization for CLIP-Based 3D Understanding [87.68271178167373]
凍結したCLIPバックボーンを用いたスケール不変表現学習のためのユニバーサル3Dトークン化器を提案する。
S4Tokenは、シーンスケールに関係なくセマンティックインフォームドトークンを生成するトークン化パイプラインである。
論文 参考訳(メタデータ) (2025-05-24T18:26:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。