論文の概要: CoSAG: Compact Semantic Anchor Gaussians via Training-Free Rate-Distortion Coding
- arxiv url: http://arxiv.org/abs/2607.10237v1
- Date: Sat, 11 Jul 2026 09:53:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 15:40:48.346101
- Title: CoSAG: Compact Semantic Anchor Gaussians via Training-Free Rate-Distortion Coding
- Title(参考訳): CoSAG:訓練自由率歪み符号化によるコンパクトなセマンティックアンカーガウシアン
- Abstract要約: オープン語彙の3Dシーン理解は、CLIPのような2D視覚言語機能を3Dガウススプレイティングシーンに埋め込むことで、一般的に達成される。
既存の方法は、各シーン、オートエンコーダ、量子化されたコードブック、蒸留された特徴フィールドを学習して出荷する。
本稿では,閉形式トランスミッション重み付きリフトを用いて,シーンごとのトレーニングを行なわずにフィールドを構築するCoSAGについて述べる。
- 参考スコア(独自算出の注目度): 11.786191617966331
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Open-vocabulary 3D scene understanding is commonly achieved by embedding 2D vision-language features such as CLIP into a 3D Gaussian Splatting scene, turning it into a text-queryable semantic field. However, attaching a high-dimensional feature to each of millions of Gaussians inflates a single scene to gigabytes, which makes storage and deployment the real bottleneck of these fields. Existing compact methods each learn and ship a per-scene codec, an autoencoder, a quantized codebook, or a distilled feature field, entangling field construction with field storage and never compressing the per-Gaussian assignment that holds the bulk of the cost. We argue that construction and storage should be decoupled, and that storage is a rate-distortion problem over the per-Gaussian binding to a small anchor table, a structure no prior open-vocabulary method compresses. We present CoSAG, which constructs the field without any per-scene training through a closed-form transmittance-weighted lift, spatially grounded semantic anchors, and multi-view denoising, and stores it with a spatially predictive entropy coder that ships no decoder. Because the anchors are spatially grounded, the binding is predictable and therefore highly compressible. The transmittance-weighted lift and multi-view denoising yield a clean, view-consistent assignment, so the entropy coder spends almost no rate on correcting noise and instead codes only the residual against its spatial prediction. CoSAG reaches sub-megabyte storage while matching or exceeding the state of the art across the 2D-rendered, 3D-selection, and dense-LSeg protocols, reducing field size by 37 to 76x relative to LangSplatV2 at higher accuracy.
- Abstract(参考訳): オープン語彙の3Dシーン理解は、CLIPのような2D視覚言語機能を3Dガウススプティングシーンに埋め込み、テキストクエリ可能なセマンティックフィールドに変換することで、一般的に達成される。
しかし、数百万のガウシアンそれぞれに高次元の機能を付加すると、単一のシーンがギガバイトに膨らみ、ストレージとデプロイメントがこれらのフィールドの本当のボトルネックとなる。
既存のコンパクトな方法は、各シーンごとのコーデック、オートエンコーダ、量子化されたコードブック、または蒸留された特徴体を学習して出荷し、フィールドを格納し、コストの大部分を保持するガウス単位の割り当てを決して圧縮しない。
我々は、構築と記憶は分離されるべきであり、ストレージはガウス当たりの小さなアンカーテーブルへの結合に対する速度歪みの問題であり、事前のオープンボキャブラリ法が圧縮されない構造であると主張している。
本稿では,空間的に接地されたセマンティックアンカー,マルチビューデノベーションを通じて,シーンごとのトレーニングを伴わないフィールドを構築し,デコーダを搭載しない空間予測エントロピーコーダで格納する。
アンカーは空間的に接地されているため、結合は予測可能であり、圧縮性が高い。
透過性重み付きリフトとマルチビューデノイングはクリーンでビュー一貫性のある割り当てをもたらすため、エントロピーコーダはノイズの補正にほとんど時間を費やすことなく、その空間的予測に対して残余のみを符号化する。
CoSAGは2Dレンダリング、3D選択、高密度LSegプロトコルにまたがる最先端の処理を整えながら、サブメガバイトのストレージに到達し、より高精度でLangSplatV2と比較して、フィールドサイズを37から76倍に削減する。
関連論文リスト
- ATSplat: Compact Feed-forward 3D Gaussian Splatting with Adaptive Token Expansion [60.00320387969695]
ATSplatはフィードフォワード3DGSフレームワークで、3DGS最適化のアダプティブアロケーション機能を復元する。
12の入力画像の解像度が512倍の960ドルから、ATSplatは1つの商用GPUを使用して1秒未満で再構築を完了した。
論文 参考訳(メタデータ) (2026-07-22T17:54:44Z) - Bridging 3D Gaussians and Semantic Occupancy for Comprehensive Open-Vocabulary Scene Understanding from Unposed Images [62.31892851760248]
COVSceneはポーズレスセマンティックガウスフレームワークで、レンダリング可能なプリミティブと密接なセマンティック占有フィールドを結合する。
我々は、COVSceneは、競争力のあるレンダリング品質を維持し、オープン語彙のセグメンテーションを改善し、自己教師付きベースラインよりも強力なセマンティック占有率予測を実現することを示す。
論文 参考訳(メタデータ) (2026-07-02T03:00:23Z) - CodecSplat: Ultra-Compact Latent Coding for Feed-Forward 3D Gaussian Splatting [53.50198425973128]
フィードフォワード3Dガウススプラッティングのための超コンパクト遅延符号化フレームワークであるCodecSplatを紹介する。
CodecSplatは23.56-26.36 dB、24.76-27.05 dB、PSNRは20.00-10777、PSNRは3.37-12、PSNRは3.37-12である。
論文 参考訳(メタデータ) (2026-05-25T08:17:35Z) - MesonGS++: Post-training Compression of 3D Gaussian Splatting with Hyperparameter Searching [27.114461961869782]
3D Gaussian Splatting(3DGS)は、リアルタイムレンダリングによる高品質なノベルビューを実現するが、そのストレージコストは実用的デプロイメントでは禁止されている。
本稿では,3次元ガウス圧縮のためのサイズ対応ポストトレーニングであるMesonGSを提案する。一方,MesonGSは,共同重要度に基づくプルーニング,オクツリー幾何学,変換,高次球面高調波に対する選択ベクトル量子化,エントロピー符号化によるグループワイド混合精度量子化を併用する。
論文 参考訳(メタデータ) (2026-04-29T15:30:06Z) - LG-HCC: Local Geometry-Aware Hierarchical Context Compression for 3D Gaussian Splatting [77.81227097905865]
アンカーベースの3DGS圧縮スキームは、いくつかの高度な文脈モデルを通してガウスの冗長性を減少させる。
本稿では, アンカープルーニングとエントロピー符号化にアンカー幾何学的相関を組み込んだ3DGSのための局所幾何学的階層型コンテキスト圧縮フレームワークを提案する。
実験の結果、LG-HCCは構造保存の問題を効果的に緩和し、Mip-NeRF360データセット上のScaffold-GSベースラインと比較して最大30.85倍のストレージを削減した。
論文 参考訳(メタデータ) (2026-03-30T13:39:35Z) - C3G: Learning Compact 3D Representations with 2K Gaussians [55.04010158339562]
近年の手法では3次元ガウススプラッティングを再構成に用い, シーン理解のための2D-to-3D機能昇降ステージが提案されている。
提案するC3Gは,空間的にのみコンパクトな3次元ガウスを推定する新しいフィードフォワードフレームワークである。
論文 参考訳(メタデータ) (2025-12-03T17:59:05Z) - Image-Conditioned 3D Gaussian Splat Quantization [5.995277983968318]
画像合成ガウススプラット量子化器(ICGS-Quantizer)
ICGS-Quantizerは圧縮効率を大幅に向上し、アーカイブ後のシーン変更への適応性を提供する。
私たちのコード、モデル、データはGitHubで公開されます。
論文 参考訳(メタデータ) (2025-08-21T09:07:26Z) - CAT-3DGS: A Context-Adaptive Triplane Approach to Rate-Distortion-Optimized 3DGS Compression [10.869104603083676]
3D Gaussian Splatting (3DGS)は、最近、有望な3D表現として登場した。
リモート側への3DGS表現の圧縮と送信の必要性は見落としている。
この新しいアプリケーションは、レート歪みを最適化した3DGS圧縮を要求する。
論文 参考訳(メタデータ) (2025-03-01T05:42:52Z) - HAC: Hash-grid Assisted Context for 3D Gaussian Splatting Compression [55.6351304553003]
3D Gaussian Splatting (3DGS) は、新しいビュー合成のための有望なフレームワークとして登場した。
高速な3DGS表現のためのHash-grid Assisted Context (HAC) フレームワークを提案する。
私たちの研究は、コンテキストベースの3DGS表現の圧縮を探求するパイオニアです。
論文 参考訳(メタデータ) (2024-03-21T16:28:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。