論文の概要: QVGGT: Post-Training Quantized Visual Geometry Grounded Transformer
- arxiv url: http://arxiv.org/abs/2605.31124v1
- Date: Fri, 29 May 2026 10:32:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-01 20:56:50.542154
- Title: QVGGT: Post-Training Quantized Visual Geometry Grounded Transformer
- Title(参考訳): QVGGT: 後処理型量子幾何接地変圧器
- Abstract要約: 我々は、VGGT(Visual Geometry Grounded Transformer)を圧縮するための調整量子化フレームワークであるQVGGTを紹介する。
QVGGTは、ほぼロスレスなW4A16量子化を実現し、FP32上で3$sim$4.9$times$メモリの削減と2.8$times$実際のハードウェアスピードアップを実現した。
提案手法により,エッジデバイス上での高忠実度3次元認識の実現が可能となり,実世界の制約環境におけるフィードフォワード3次元再構成モデルの実践的展開が可能となった。
- 参考スコア(独自算出の注目度): 5.7977296539841845
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Estimating 3D attributes directly from images has advanced rapidly with the Visual Geometry Grounded Transformer (VGGT), which predicts camera parameters, depth maps, and point clouds in a single forward pass. However, its 1.2B-parameter scale severely limits deployment on resource-constrained platforms such as UAVs and mobile AR devices. To address this limitation, we introduce QVGGT, a tailored quantization framework designed to compress VGGT. Our approach starts from the observation that transformer blocks within VGGT exhibit heterogeneous sensitivity to quantization. We thus analyze per-block quantization sensitivity and propose a selective mixed-precision strategy that allocates higher precision to the most fragile transformer blocks. To address the amplification of quantization error caused by high-variance camera and register tokens, we further introduce token filtering with camera information compensation, which removes these outliers from activation calibration and restores their geometric cues using a PCA-derived global compensation token. Finally, we develop a task-aware scale search mechanism that evaluates candidate quantization scales not only through layer reconstruction but also through multi-head supervision and cross-head geometric consistency among camera poses, depth maps, and point maps. Extensive experiments on multiple geometry perception benchmarks demonstrate that QVGGT achieves near-lossless W4A16 quantization, preserving the accuracy of all 3D prediction heads while delivering 3$\sim$4.9$\times$ memory reduction and up to 2.8$\times$ real hardware speedup over FP32. Our approach makes high-fidelity 3D perception feasible on edge devices, enabling practical deployment of feed-forward 3D reconstruction models in real-world constrained environments.
- Abstract(参考訳): 画像から直接3D属性を推定するVisual Geometry Grounded Transformer (VGGT)は、カメラパラメータ、深度マップ、点雲を単一の前方通過で予測する。
しかし、1.2Bパラメータスケールは、UAVやモバイルARデバイスのようなリソース制限されたプラットフォームへの展開を著しく制限している。
この制限に対処するために、VGGTを圧縮するように設計された量子化フレームワークであるQVGGTを紹介する。
我々のアプローチは、VGGT内の変圧器ブロックが量子化に対して不均一な感度を示すという観察から始まる。
そこで我々は、ブロックごとの量子化感度を分析し、最も脆弱な変圧器ブロックに高い精度を割り当てる選択的な混合精度戦略を提案する。
高分散カメラとレジスタトークンによる量子化誤差の増幅に対処するため、さらにカメラ情報補償によるトークンフィルタリングを導入し、アクティベーションキャリブレーションからこれらの外れ値を取り除き、PCA由来のグローバル補償トークンを用いて幾何学的手がかりを復元する。
最後に,階層再構築だけでなく,カメラポーズ,深度マップ,点マップ間の多面的幾何整合性を通じて,候補量子化尺度を評価するタスク対応尺度探索機構を開発した。
QVGGTは3$\sim$4.9$\times$メモリ削減とFP32上の2.8$\times$実際のハードウェアスピードアップを達成しながら、全ての3D予測ヘッドの精度を保ちながら、ほぼロスレスなW4A16量子化を実現している。
提案手法により,エッジデバイス上での高忠実度3次元認識の実現が可能となり,実世界の制約環境におけるフィードフォワード3次元再構成モデルの実践的展開が可能となった。
関連論文リスト
- OmniPoint: Universal Monocular Metric Pointcloud from Any Camera [79.24417597712802]
OmniPointは、様々な画像センサにまたがるメートル法再構成を一般化するために設計された統合されたフレームワークである。
射影剛性を克服するため、OmniPointは従来の平面深度回帰を放棄する。
代わりに、分離された訓練目標とともに、分離された光線と距離の表現を採用する。
論文 参考訳(メタデータ) (2026-09-08T19:45:58Z) - Not All Tasks Quantize Equally: Fisher-Guided Quantization for Visual Geometry Transformer [26.28481512169773]
フィードフォワード3次元再構成モデルのためのFGQ(Fisher-Guided Quantization)を提案する。
FGQは対角的なフィッシャー情報マトリックスを使用して、タスク、ブロック、チャネル間で異なる感度を定量化する。
カメラポーズ推定、ポイントマップ再構成、深さ推定による実験は、FGQが一貫して最先端の量子化ベースラインを上回っていることを示している。
論文 参考訳(メタデータ) (2026-05-15T10:27:10Z) - TokenGS: Decoupling 3D Gaussian Prediction from Pixels with Learnable Tokens [25.44390249542703]
我々は、カメラ線に沿った奥行きが最適であるとして、ガウスを退避させる一般的な実践は、準最適であると主張する。
本稿では,自己教師付きレンダリング損失のみを用いて,3次元平均座標を直接回帰する手法を提案する。
提案手法であるTokenGSは、ノイズやマルチビューの不整合に対処するための堅牢性の向上を実証する。
論文 参考訳(メタデータ) (2026-04-16T17:12:37Z) - Quantized Visual Geometry Grounded Transformer [67.15451442018258]
本稿では,VGGTの最初の量子化フレームワーク,すなわちQuantVGGTを提案する。
球状前アダマール回転と局所流路平滑化を統合したDual-Smoothed Fine-Grained Quantizationを導入する。
また、重層統計量を用いて外周をフィルタするノイズフィルタディバースサンプリングを設計する。
論文 参考訳(メタデータ) (2025-09-25T15:17:11Z) - FreeSplatter: Pose-free Gaussian Splatting for Sparse-view 3D Reconstruction [69.63414788486578]
FreeSplatterはスケーラブルなフィードフォワードフレームワークで、キャリブレーションされていないスパースビュー画像から高品質な3Dガウシアンを生成する。
当社のアプローチでは,自己注意ブロックが情報交換を容易にする合理化トランスフォーマーアーキテクチャを採用している。
包括的データセットに基づいて,オブジェクト中心とシーンレベルの再構築のための2つの特殊な変種を開発する。
論文 参考訳(メタデータ) (2024-12-12T18:52:53Z) - PF3plat: Pose-Free Feed-Forward 3D Gaussian Splatting [54.7468067660037]
PF3platは、設計選択を検証した包括的なアブレーション研究によってサポートされた、すべてのベンチマークに新しい最先端を設定します。
本フレームワークは,3DGSの高速,スケーラビリティ,高品質な3D再構成とビュー合成機能を活用している。
論文 参考訳(メタデータ) (2024-10-29T15:28:15Z) - Towards Model Generalization for Monocular 3D Object Detection [57.25828870799331]
我々は,Mono3Dオブジェクト検出に有効な統合カメラ一般化パラダイム(CGP)を提案する。
また,インスタンスレベルの拡張によりギャップを埋める2D-3D幾何一貫性オブジェクトスケーリング戦略(GCOS)を提案する。
DGMono3Dと呼ばれる手法は、評価された全てのデータセットに対して顕著な性能を達成し、SoTAの教師なしドメイン適応スキームを上回ります。
論文 参考訳(メタデータ) (2022-05-23T23:05:07Z) - Reinforced Axial Refinement Network for Monocular 3D Object Detection [160.34246529816085]
モノクロ3次元物体検出は、2次元入力画像から物体の位置と特性を抽出することを目的としている。
従来のアプローチでは、空間から3D境界ボックスをサンプリングし、対象オブジェクトと各オブジェクトの関係を推定するが、有効サンプルの確率は3D空間で比較的小さい。
我々は,まず最初の予測から始めて,各ステップで1つの3dパラメータだけを変えて,基礎的真理に向けて徐々に洗練することを提案する。
これは、いくつかのステップの後に報酬を得るポリシーを設計する必要があるため、最適化するために強化学習を採用します。
論文 参考訳(メタデータ) (2020-08-31T17:10:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。