Glass Surface Detection Grounded in 3D Visual Geometry
Abstractの概要
本論文は、ガラス表面検出を主に2Dの外観手がかりに依存する手法から、3D視覚幾何学に基づくタスクへと再構成しています。提案されたフレームワークはVisual Geometry Grounded Transformer(VGGT)を基盤とし、その3D事前知識を活用しつつ、境界を基準とした平面補間によってガラス領域内の深度および点群の教師信号を補正します。このアーキテクチャには、ガラスに起因する周波数パターンを捉える周波数自己アテンションモジュール(FSAM)と、2D特徴量を3D深度および点群表現と融合する幾何グラウンディングブロック(GeGB)を組み合わせた専用のガラス検出ヘッドが組み込まれています。モデルは、ガラスマスク、境界、深度、点群を対象とするマルチタスク損失のもとで、Low-Rank Adaptation(LoRA)を介して学習されます。
新規性
主な新規性は、ガラス表面検出を2Dの外観のみではなく、大規模事前学習済みの3D視覚幾何学に明示的に根付けるというパラダイムシフトにあります。また、ガラス領域に対する平面深度・点群の補正を行う学習スキームと、周波数領域アテンションおよび3D幾何グラウンディングを統合した検出ヘッドを導入しています。
成果
本手法は、単一画像、マルチモーダル、動画に関する7つの標準的なガラス表面検出ベンチマークにおいて最先端の性能を達成しました。追加の物理センサーを必要とせずに動画やマルチモーダルデータセットに対する高い汎化性を示し、NVIDIA RTX 4090 GPU上で約8.5 FPSの対話的な速度で動作します。
論文の注目点
- LoRAを用いて事前学習済みVGGTの3D事前知識を適応させ、平面補間によってガラス領域内の深度および点群の疑似教師データを補正する手法を提案。
- 周波数特性に基づくガラス位置特定のための周波数自己アテンションモジュール(FSAM)と、幾何誘導型の特徴融合を行う幾何グラウンディングブロック(GeGB)を組み合わせた検出ヘッドを開発。
- 7つのベンチマークにおける一貫した性能向上、ガラス周辺の単眼3Dシーン再構成精度の改善、および対話的な実行効率を確認。