論文の概要: GeoScaffold: Learning Compact Geometric Latents via Reconstruction for Efficient Vision-Language Navigation
- arxiv url: http://arxiv.org/abs/2610.02697v1
- Date: Fri, 02 Oct 2026 02:24:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.165372
- Title: GeoScaffold: Learning Compact Geometric Latents via Reconstruction for Efficient Vision-Language Navigation
- Title(参考訳): GeoScaffold:効率的な視覚・言語ナビゲーションのための再構成によるコンパクトな幾何学的潜在物体の学習
- Abstract要約: 近年のヴィジュアル・アンド・ランゲージナビゲーション(VLN)システムは、エゴセントリックなRGB観測と指示を直接低レベルアクションにマッピングするストリーミングビデオLLMポリシーを採用するようになっている。
既存のジオメトリ対応拡張は、深度センサー、3Dエンコーダ、ステップ単位の認識ツールコールといった、永続的な推論時間価格を課金する。
我々は,幾何を政策自体に内在化することで,この価格をトレーニング時に1回だけ支払う幾何学的監視フレームワークGeoScaffoldを提案する。
- 参考スコア(独自算出の注目度): 22.907324632173033
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent vision-and-language navigation (VLN) systems increasingly adopt streaming Video-LLM policies that map egocentric RGB observations and instructions directly to low-level actions. Yet these policies inherit weak 3D geometric priors from 2D pretraining. Existing geometry-aware extensions charge a persistent inference-time price: depth sensors, 3D encoders, or per-step perception tool calls. We propose GeoScaffold, a geometric supervision framework that pays this price once, at training time, by internalizing geometry into the policy itself. It first learns a compact depth tokenizer on depth maps from the training trajectories and freezes it. It then fine-tunes the policy with a handful of learnable geometry query tokens, training their hidden states to reconstruct navigation-critical geometry such as depth, connectivity, and traversability. This supervision turns the query states into compact geometric latents for action decoding, and through the shared weights also internalizes geometry into the backbone's own representations. Like a scaffold, the tokenizer, target generators, and reconstruction heads are discarded after training, leaving the backbone and action interface unchanged. Extensive experiments show that GeoScaffold consistently outperforms leading vision-only navigators on continuous VLN benchmarks, offering a practical paradigm for lightweight edge deployment of spatially aware embodied navigation models.
- Abstract(参考訳): 近年のヴィジュアル・アンド・ランゲージナビゲーション(VLN)システムは、エゴセントリックなRGB観測と指示を直接低レベルアクションにマッピングするストリーミングビデオLLMポリシーを採用するようになっている。
しかし、これらのポリシーは2次元事前学習から弱い3次元幾何学的事前学習を継承する。
既存のジオメトリ対応拡張は、深度センサー、3Dエンコーダ、ステップ単位の認識ツールコールといった、永続的な推論時間価格を課金する。
我々は,幾何を政策自体に内在化することで,この価格をトレーニング時に1回だけ支払う幾何学的監視フレームワークGeoScaffoldを提案する。
まず、訓練軌道から深度マップのコンパクトな深度トークン化器を学習し、凍結する。
その後、いくつかの学習可能な幾何クエリトークンでポリシーを微調整し、隠れた状態をトレーニングして、深さ、接続性、およびトラバータビリティといったナビゲーションクリティカルな幾何学を再構築する。
この監督により、クエリ状態はアクション復号のためのコンパクトな幾何学的潜在状態へと変換され、共有重み付けを通して、幾何学をバックボーン自身の表現に内部化する。
足場と同様に、トークンー、ターゲットジェネレータ、再構築ヘッドは訓練後に破棄され、バックボーンとアクションインターフェースは変わらない。
大規模な実験により、GeoScaffoldは連続的なVLNベンチマークにおいて視覚のみのナビゲータよりも一貫して優れており、空間的に認識されたナビゲーションモデルの軽量なエッジ展開のための実用的なパラダイムを提供する。
関連論文リスト
- StrataVLA: Hierarchical and Efficient 3D Geometric Grounding for Vision-Language-Action Models [10.057878395484833]
Vision-Language-Action (VLA)モデルは、大規模な視覚言語事前学習から強力なセマンティック・プレトレーニングを継承する。
既存のアプローチでは、明示的な深さやポイントクラウド入力を必要とするか、トレーニング時の監視に幾何学を圧縮するか、モデル入力やアクションエキスパートにのみ注入する。
階層的幾何学的接地のためのプラグアンドプレイフレームワークであるStrataVLAを紹介する。
論文 参考訳(メタデータ) (2026-08-03T13:58:37Z) - IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer [64.5765465030666]
オンライン4Dシーン理解のためのストリーミングインスタンスグラウンド幾何変換器IGGT4Dを提案する。
IGGT4Dは、ビデオフレームを逐次処理し、因果時空間モデリングを通じて歴史的コンテキストを再利用し、カメラモーション、幾何学、オブジェクトアイデンティティの統一表現を漸進的に更新する。
3次元再構成、ポーズ推定、例空間追跡、オープンボキャブラリセグメンテーションの実験は、IGGT4Dが既存のストリーミングベースラインより優れていることを示した。
論文 参考訳(メタデータ) (2026-07-21T16:00:01Z) - GA-VLN: Geometry-Aware BEV Representation for Efficient Vision-Language Navigation [75.85672467847631]
本稿では,3次元のコンパクトな特徴表現であるGeometry-Aware BEV (GA-BEV)を紹介する。
視覚的特徴を3次元空間に投影することで,RGB-D入力からBEV空間マップを構築する。
我々は,BEV空間に事前訓練された3Dファンデーションモデルの特徴を取り入れ,大規模3D再構築作業から学んだ構造的先行を注入する。
論文 参考訳(メタデータ) (2026-05-21T06:20:17Z) - IVGT: Implicit Visual Geometry Transformer for Neural Scene Representation [76.36174247570716]
ポーズレス多視点画像から連続的かつ一貫性のある幾何を暗黙的にモデル化するインプリシトビジュアル幾何変換器IVGTを提案する。
IVGTは標準座標系で連続的なニューラルネットワークシーン表現を学習し、任意の3D位置での連続的な空間クエリをサポートする。
連続的かつコヒーレントな表面形状の直接抽出を可能にし、任意の視点からRGB画像、深度マップ、表面正規写像のレンダリングを可能にする。
論文 参考訳(メタデータ) (2026-05-15T17:59:57Z) - Make Geometry Matter for Spatial Reasoning [62.61667611352403]
視覚言語モデル(VLM)は、強いイメージと映像理解を実現するが、静的シーンとダイナミックビデオの両方で空間的推論を行う能力は限られている。
近年の進歩は、事前訓練された3次元基礎モデルから幾何学トークンをVLMに注入することで、この制限に対処しようとしている。
我々は、VLMが幾何トークンで積極的に推論するように促すことにより、幾何学的問題を作るためのフレームワークGeoSRを提案する。
論文 参考訳(メタデータ) (2026-03-27T17:45:12Z) - GeoPurify: A Data-Efficient Geometric Distillation Framework for Open-Vocabulary 3D Segmentation [57.8059956428009]
2次元視覚言語モデルから3次元セマンティックセグメンテーションへ機能を移行しようとする最近の試みは、永続的なトレードオフを露呈している。
3次元教師モデルから抽出した幾何学的事前情報を用いて2次元VLM生成した3次元点特徴に小さな学生親和性ネットワークを適用したGeoPurifyを提案する。
遅延幾何学情報と学習された親和性ネットワークから恩恵を受けることで、GeoPurifyはトレードオフを効果的に軽減し、優れたデータ効率を実現する。
論文 参考訳(メタデータ) (2025-10-02T16:37:56Z) - Geometry-guided Feature Learning and Fusion for Indoor Scene Reconstruction [14.225228781008209]
本稿では3次元シーン再構成のための新しい幾何学的統合機構を提案する。
提案手法は,特徴学習,特徴融合,ネットワーク監視という3段階の3次元幾何学を取り入れている。
論文 参考訳(メタデータ) (2024-08-28T08:02:47Z) - Depth Completion using Geometry-Aware Embedding [22.333381291860498]
本稿では,幾何認識の埋め込みを効率的に学習する手法を提案する。
局所的および大域的な幾何学的構造情報を、例えば、シーンレイアウト、オブジェクトのサイズと形状などの3Dポイントから符号化し、深度推定を導く。
論文 参考訳(メタデータ) (2022-03-21T12:06:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。