論文の概要: VLRC: Vision-Language Reprojection Consistency as a scalable signal for better feed-forward 3D pretraining
- arxiv url: http://arxiv.org/abs/2607.02707v3
- Date: Wed, 08 Jul 2026 14:37:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 12:30:34.624218
- Title: VLRC: Vision-Language Reprojection Consistency as a scalable signal for better feed-forward 3D pretraining
- Title(参考訳): VLRC: フィードフォワード3D事前学習のためのスケーラブルな信号としてのビジョン・ランゲージ・リジェクション整合性
- Abstract要約: Vision-Language Reprojection Consistency (VLRC)は、凍結した視覚言語表現をセマンティックなマルチビュー監視として利用する。
VLRCは、自己教師付き単分子再構成と教師付き前向きフィードフォワードモデルの両方とシームレスに統合する。
室内および屋外のベンチマーク実験では、3D再構成精度とゼロショットオープンな3Dセマンティックセマンティックセグメンテーションが一貫した向上を示した。
- 参考スコア(独自算出の注目度): 8.146936489399293
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Feed-forward 3D models are commonly trained using either expensive geometric supervision or self-supervised photometric objectives, both of which provide incomplete learning signals. We introduce Vision-Language Reprojection Consistency (VLRC), a scalable auxiliary objective that exploits frozen vision-language representations as semantic multi-view supervision. Given a predicted 3D reconstruction, VLRC reprojects dense vision-language features across views and enforces feature consistency between corresponding image locations, requiring no additional 3D annotations. The objective integrates seamlessly with both self-supervised monocular reconstruction and supervised-pretrained feed-forward 3D models during unlabeled adaptation. By aligning geometry with language-grounded features, VLRC not only improves depth and camera estimation but also enables more coherent multi-view semantic fusion for open-vocabulary 3D scene understanding. Experiments on indoor and outdoor benchmarks demonstrate consistent gains in 3D reconstruction accuracy and zero-shot open-vocabulary 3D semantic segmentation.
- Abstract(参考訳): フィードフォワード3Dモデルは、高価な幾何学的監督または自己監督された測光目標を用いて訓練され、どちらも不完全な学習信号を提供する。
我々は,凍結した視覚言語表現を意味的多視点監視として活用する,スケーラブルな補助的目的であるビジョンランゲージ・リジェクション・コンシステンシー(VLRC)を紹介した。
予測された3D再構成により、VLRCはビュー全体にわたって高密度な視覚言語機能を再計画し、対応する画像位置間の機能一貫性を強制し、追加の3Dアノテーションを必要としない。
この目的は、ラベルなし適応中に自己教師付き単分子再構成と教師付き前向き3次元モデルの両方とシームレスに統合される。
VLRCは、幾何学と言語的特徴を整合させることで、深度とカメラ推定を改善するだけでなく、オープンな3Dシーン理解のためのより一貫性のあるマルチビューセマンティックフュージョンを可能にする。
室内および屋外のベンチマーク実験では、3D再構成精度とゼロショットオープンな3Dセマンティックセマンティックセグメンテーションが一貫した向上を示した。
関連論文リスト
- Think, Act, Build: An Agentic Framework with Vision Language Models for Zero-Shot 3D Visual Grounding [34.1504914582344]
3D Visual Groundingは、自然言語記述を通じてオブジェクトを3Dシーンにローカライズすることを目的としている。
生のRGB-Dストリーム上で直接動作する2次元から3次元の再生パラダイムである"Think, Act, Build (TAB)"を提案する。
厳密なVLMセマンティックトラッキングによる多視点カバレッジ障害を克服するために,セマンティックアンコレッド幾何拡張を導入する。
論文 参考訳(メタデータ) (2026-04-01T06:12:16Z) - Loc3R-VLM: Language-based Localization and 3D Reasoning with Vision-Language Models [47.045362895601556]
Loc3R-VLMは、モノクロビデオ入力から高度な3D理解機能を備えた2Dビジョンランゲージモデルを備えたフレームワークである。
人間の空間認識にインスパイアされたLoc3R-VLMは、グローバルなレイアウト再構築と明示的な状況モデリングという2つの共同目的に依存している。
幾何学的整合性と計量スケールの整合性を確保するために,事前学習した3次元基礎モデルから抽出した軽量カメラポーズの先行情報を活用する。
論文 参考訳(メタデータ) (2026-03-18T17:59:10Z) - Abstract 3D Perception for Spatial Intelligence in Vision-Language Models [100.13033631690114]
視覚言語モデル(VLM)は、空間認識や物理的理解といった3D関連課題に苦しむ。
我々は,VLMの幾何学的構造と物理力学を符号化するために,抽象的境界ボックスを利用するフレームワークであるSandboxVLMを紹介した。
提案手法は空間知能を常に向上させ,SAT Realの8.3%のゲインをベースライン法と比較して達成する。
論文 参考訳(メタデータ) (2025-11-14T04:16:09Z) - VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction [86.82819259860186]
本稿では,視覚言語モデル(VLM)のための統合フレームワークであるVLM-3Rについて紹介する。
VLM-3Rは、空間的理解を表す暗黙の3Dトークンを導出する幾何学エンコーダを用いて、モノクロビデオフレームを処理する。
論文 参考訳(メタデータ) (2025-05-26T17:56:30Z) - g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks [62.74304008688472]
Generalizable 3D-Language Feature Fields (g3D-LF)は、大規模な3D言語データセットで事前訓練された3D表現モデルである。
論文 参考訳(メタデータ) (2024-11-26T01:54:52Z) - Volumetric Environment Representation for Vision-Language Navigation [66.04379819772764]
視覚言語ナビゲーション(VLN)は、視覚的な観察と自然言語の指示に基づいて、エージェントが3D環境をナビゲートする必要がある。
本研究では,物理世界を3次元構造細胞にボクセル化するボリューム環境表現(VER)を提案する。
VERは3D占有率、3D部屋レイアウト、および3Dバウンディングボックスを共同で予測する。
論文 参考訳(メタデータ) (2024-03-21T06:14:46Z) - AutoDecoding Latent 3D Diffusion Models [95.7279510847827]
本稿では,3次元オートデコーダをコアとした静的・明瞭な3次元アセットの生成に対して,新しいアプローチを提案する。
3D Autodecoderフレームワークは、ターゲットデータセットから学んだプロパティを潜時空間に埋め込む。
次に、適切な中間体積潜在空間を特定し、ロバストな正規化と非正規化演算を導入する。
論文 参考訳(メタデータ) (2023-07-07T17:59:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。