論文の概要: Beyond Global Latents: Chunk-Based Sparse Grid VAE for Scalable 3D Modeling
- arxiv url: http://arxiv.org/abs/2608.02016v1
- Date: Mon, 03 Aug 2026 10:15:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.483898
- Title: Beyond Global Latents: Chunk-Based Sparse Grid VAE for Scalable 3D Modeling
- Title(参考訳): グローバルラテントを超えて: スケーラブルな3DモデリングのためのチャンクベースのスパースグリッドVAE
- Authors: Kaiyi Zhang, Zhihao Liang, Haolin Liu, Qingxiang Lin, Zeqiang Lai, Yunfei Zhao, Bowen Zhang, Xianghui Yang, Zibo Zhao, Chunchao Guo, Long Quan,
- Abstract要約: ChunkVAEは、グローバルな潜在ボリュームではなく、局所的なチャンクを中心に構成されたスパースグリッド変分自動エンコーダである。
下流で必要なグローバルインターフェースを維持しながら,局所圧縮が幾何を拡張可能であることを示す。
- 参考スコア(独自算出の注目度): 30.640147037595572
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Sparse voxel grids preserve the spatial structure needed for detailed 3D reconstruction, but their memory still grows rapidly with resolution as active surface cells increase. We introduce ChunkVAE, a sparse grid variational autoencoder organized around local chunks rather than a global latent volume. Local learned operators permit independently chosen encoder and decoder partitions and allow inference chunk sizes to differ from training. Two complementary data operators make this flexibility practical: Balanced Binary Object Partitioning distributes active cells while limiting replicated overlap, while S-Curve weighted stitching attenuates unreliable boundary features when assembling a global latent or reconstruction. Across three object benchmarks, ChunkVAE is competitive with or better than strong baselines from $512^3$ to $1536^3$; smaller chunks lower peak allocated memory and shorten per-chunk compute, enabling faster parallel inference. Stable stitched latents and improved image to 3D metrics indicate that local compression can scale geometry while retaining the global interface required downstream.
- Abstract(参考訳): スパース・ボクセル・グリッドは、詳細な3次元再構成に必要な空間構造を保っているが、活性表面細胞の増加に伴い、その記憶は分解能とともに急速に成長する。
我々は,グローバルな潜在ボリュームではなく,局所チャンクを中心に構成されたスパースグリッド変分自動エンコーダであるChunkVAEを紹介する。
ローカル学習オペレータは、独立して選択されたエンコーダとデコーダのパーティションを許可し、推論チャンクのサイズをトレーニングと異なるものにすることができる。
Balanced Binary Object Partitioningは、複製された重複を制限しながらアクティブなセルを配布し、S-Curve重み付けは、グローバルな潜伏や再構成を組み立てるときに、信頼できない境界特性を減衰させる。
3つのオブジェクトベンチマークで、ChunkVAEは512^3$から1536^3$までの強力なベースラインと競合している。
安定な縫製潜水器と3Dメトリクスの改善は、下流に必要なグローバルインターフェースを維持しながら、局所圧縮が幾何をスケール可能であることを示している。
関連論文リスト
- Scal3R: Scalable Test-Time Training for Large-Scale 3D Reconstruction [50.5449251266956]
本稿では,長い映像シーケンスから大規模3Dシーンを再構築する作業について述べる。
近年のフィードフォワード再構成モデルでは,RGB画像からの3次元幾何を,明示的な3次元先行や幾何学的制約なく直接回帰することで,有望な結果を示している。
本稿では,長距離シーン情報を効率よく圧縮し,保持するニューラルグローバルコンテキスト表現を提案する。
論文 参考訳(メタデータ) (2026-04-09T17:59:50Z) - StructKV: Preserving the Structural Skeleton for Scalable Long-Context Inference [38.75965915663233]
構造対応のKVキャッシュ圧縮フレームワークであるStructKVを提案する。
まず、Global In-Degree Centralityは、ネットワーク奥行きの注意パターンを集約し、グローバルな情報ハブを特定する。
第二に、Dynamic Pivot Detectionは情報理論のメトリクスを使って、圧縮のための最適な層を適応的に見つける。
論文 参考訳(メタデータ) (2026-04-08T07:10:35Z) - Enhancing Floor Plan Recognition: A Hybrid Mix-Transformer and U-Net Approach for Precise Wall Segmentation [0.0]
本研究では,Mix-TransformerエンコーダとU-Netデコーダを組み合わせたハイブリッドニューラルネットワークMitUNetを紹介する。
我々の手法は精度とリコールのバランスを保ち、正確な境界回復を保証する。
CubiCasa5kデータセットと独自の地域データセットの実験は、構造的に正しいマスクを生成する上でのMitUNetの優位性を示している。
論文 参考訳(メタデータ) (2025-12-02T04:47:53Z) - LoG3D: Ultra-High-Resolution 3D Shape Modeling via Local-to-Global Partitioning [26.88556500272625]
非符号距離場(UDF)に基づく新しい3次元変分オートエンコーダフレームワークを提案する。
私たちの中心となるイノベーションは、UDFを統一サブボリュームであるUBlockに分割することで処理する、ローカルからグローバルなアーキテクチャです。
再現精度と生成品質の両面での最先端性能を実証し,表面の滑らかさと幾何学的柔軟性を向上した。
論文 参考訳(メタデータ) (2025-11-13T07:34:43Z) - UniMamba: Unified Spatial-Channel Representation Learning with Group-Efficient Mamba for LiDAR-based 3D Object Detection [53.785766442201094]
LiDAR 3D検出の最近の進歩は、ポイントクラウド空間からグローバルな依存関係をキャプチャするTransformerベースのフレームワークの有効性を示している。
トランスフォーマーのかなりの数の3Dボクセルと二次的な複雑さのため、トランスフォーマーに供給する前に複数のシーケンスがグループ化され、受容野が制限される。
2次元視覚タスクの分野で達成された状態空間モデル(SSM)の印象的な性能に触発されて、我々は新しい統一マンバ(UniMamba)を提案する。
特に、UniMambaブロックは、主にローカリティモデリング、Zオーダーシリアライゼーション、局所グローバルシーケンシャルアグリゲータで構成されている。
論文 参考訳(メタデータ) (2025-03-15T06:22:31Z) - DSVT: Dynamic Sparse Voxel Transformer with Rotated Sets [95.84755169585492]
本研究では,屋外3次元知覚のためのシングルストライドウィンドウベースのボクセルトランスであるDynamic Sparse Voxel Transformer (DSVT)を提案する。
本モデルでは,3次元認識タスクを多岐にわたって行うことにより,最先端の性能を実現する。
論文 参考訳(メタデータ) (2023-01-15T09:31:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。