論文の概要: VOIM: Training-Free Open-Vocabulary 3D Instance Mapping for RGB-D and Monocular SLAM
- arxiv url: http://arxiv.org/abs/2609.00775v1
- Date: Tue, 01 Sep 2026 06:07:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.409863
- Title: VOIM: Training-Free Open-Vocabulary 3D Instance Mapping for RGB-D and Monocular SLAM
- Title(参考訳): VOIM:RGB-Dと単眼SLAMのための学習不要なオープンボキャブラリ3Dインスタンスマッピング
- Abstract要約: Voxel-Grounded Online Instance Managerは、オープン語彙の3DインスタンスマップをRGB-Dまたは単眼RGBから構築する。
オンラインシステムは通常、オブジェクトインスタンスをセグメント化し、最初の検出時にラベル付けする。
VOIMは代わりにラベルとインスタンスの決定を否定するが、修正されていない既成の知覚によるソフトな証拠がボクセルごとに蓄積される。
- 参考スコア(独自算出の注目度): 3.3470015550759737
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: We present Voxel-Grounded Online Instance Manager (VOIM), a training-free voxel-grounded instance manager that builds open-vocabulary 3D instance maps from RGB-D or from monocular RGB alone, a regime no prior training-free system addresses. Online systems typically segment object instances and label them at first detection, committing when evidence is weakest. VOIM instead defers label and instance decisions until soft evidence from unmodified, off-the-shelf perception has accumulated per voxel across views. We show that the mapping stage, rather than the particular perception models, carries the result: across four perception configurations on ScanNet++, varying the region descriptor, the detector label prior and the mask source, the map exceeds the strongest online RGB-D system, OVO-SLAM, by between 4.8 and 11.7 mIoU. Perception is not neutral, and substituting that baseline's own descriptor family costs 4.1 of the margin, yet the baseline carries the marginally better 2D descriptor (33.7 vs. 31.5 mIoU over three scenes) and still realizes the weaker map. Under a like-for-like protocol VOIM reaches 44.07 mIoU on ScanNet++ against 32.37, winning all ten scenes and both aggregations (pooled 33.31 vs. 25.97), and the same system runs unchanged to fully monocular RGB, matching that baseline pooled on Replica (27.80 vs. 27.50). The advantage is regime-specific: under Replica's all-classes scoring, matched inputs give a split result, 28.60 vs. 27.50 pooled against 24.59 vs. 30.11 on the per-scene mean. Room scale is label-limited and building scale drift-limited. Labeling does not run in real time, dominated by per-class detection over the full vocabulary. The maps export occupancy grids and resolve free-form queries to object instances.
- Abstract(参考訳): トレーニング不要のvoxel-Grounded Online Instance Manager (VOIM) は、RGB-Dまたは単分子RGBのみからオープンな3Dインスタンスマップを構築する、トレーニング不要のvoxel-grounded instance Managerである。
オンラインシステムは通常、オブジェクトインスタンスを分割し、最初の検出時にラベル付けし、最も証拠が弱いときにコミットする。
VOIMは代わりにラベルとインスタンスの決定を否定するが、修正されていない既成の知覚によるソフトエビデンスが、ビュー全体にわたって1対1のボクセルに蓄積される。
ScanNet++上の4つの知覚構成は、領域記述子、先行検出器ラベル、マスク情報源によって異なり、この地図は、4.8moUから11.7moUまでの最も強力なオンラインRGB-DシステムであるOVO-SLAMを超えている。
知覚は中立的ではなく、ベースラインのディスクリプタファミリーの代用はマージンの4.1だが、ベースラインはより良質な2Dディスクリプタ(33.7対31.5 mIoU)を持ち、依然として弱いマップを実現している。
同様のプロトコルでは、VOIMはScanNet++上で32.37に対して44.07 mIoUに達し、10つのシーンと2つのアグリゲーション(プール33.31対25.97)を勝ち取り、同じシステムは完全な単分子のRGBに変化せず、Replica(27.80対27.50)でプールされたベースラインと一致する。
Replicaのオールクラスのスコアでは、マッチした入力は分割結果を与え、28.60対27.50対24.59対30.11対シーン平均でプールされる。
ルームスケールはラベルリミテッドで、ビルスケールはドリフトリミテッドである。
ラベリングはリアルタイムでは動作せず、完全な語彙上のクラスごとの検出に支配される。
マップは占有グリッドをエクスポートし、自由形式のクエリをオブジェクトインスタンスに解決する。
関連論文リスト
- Exploring 2D backbone effects for indoor semantic occupancy prediction [3.4985539398371235]
EmbodiedScanのようなRGB-Dパイプラインでは、イメージエンコーダはしばしばデフォルトモジュールとして残される。
我々はこの設計選択を直接研究する。
メインのRGB-Dプロジェクション、奥行き枝、占有頭部を固定し、画像バックボーンのみを置き換える。
論文 参考訳(メタデータ) (2026-09-15T14:37:40Z) - Instance-Guided Report Anchoring for Text-Free 3D Abnormality Segmentation in Chest CT [1.3890393030771435]
本稿では,各アノテート異常インスタンスとそれを記述するレポート発見との対応性を保持するモデルに依存しないモジュールIGRAを提案する。
IGRAはイメージのみのベースライン(30.93対25.25)よりも22.5%改善し、シングルフィンディングサブセット(30.29対30.43)のVoxTellに匹敵する。
論文 参考訳(メタデータ) (2026-08-31T22:38:11Z) - MuViSeg: Multi-View Segment Correspondences from Dense Geometry Priors [2.4956060473718407]
凍結MASt3RディスクリプタにDoubleSoftmaxスコアを付けたLightGlueスタイルのアテンションヘッドと、プール前にVGGTファンデーションモデルから層状空間詳細を公開するDPTスタイルのマルチスケールフュージョンモジュール、そして、我々の主な貢献として、複数のビューから抽出されたセグメントに対して同時自己アテンションを行うマルチビュー拡張である。
私たちのマルチビューモデルは成功率を50%から70%に引き上げ、LightGlueスタイルのヘッドはSPLを45.7から59.1に引き上げます。
論文 参考訳(メタデータ) (2026-07-20T13:35:48Z) - PROSE: Training-Free Egocentric Scene Registration with Vision-Language Models [48.66414784633783]
PROSE(Prompted Scene rEgistration)は、各RGBシーケンスをオブジェクトレベルの3Dシーングラフにリフトする。
PROSEは学習したパラメータを追加せず、深度センサーやトレーニング、注釈付きグラフを必要としない。
エゴセントリックなAria Digital TwinとAria Everyday Activityベンチマークでは、幾何学的および学習されたシーングラフのベースラインを、登録精度で上回っている。
論文 参考訳(メタデータ) (2026-06-15T11:11:14Z) - Mono-Hydra++: Real-Time Monocular Scene Graph Construction with Multi-Task Learning for 3D Indoor Mapping [4.329662126907974]
室内のメカニカルセマンティックマッピングと階層的な3Dシーングラフ構築のためのリアルタイム単眼RGBとIMUパイプラインであるMono-Hydra++を提案する。
Mono-Hydra++は、アクティブな深度センサーに頼ることなく、リソース制約のあるロボットプラットフォームに対してリアルタイムなメトリックセマンティックマッピングとシーングラフ構築を提供する。
論文 参考訳(メタデータ) (2026-05-17T21:36:29Z) - SegRAG: Training-Free Retrieval-Augmented Semantic Segmentation [13.665861251747144]
SegRAGは、トレーニング不要の検索拡張セグメンテーションフレームワークである。
SAM3には、DINOv3機能バンクから派生したクラス固有のポイントプロンプトがある。
4つの標準ベンチマークでは、SegRAGはテキストのみのベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2026-05-17T19:51:32Z) - INSIGHT: Indoor Scene Intelligence from Geometric-Semantic Hierarchy Transfer for Public~Safety [41.99844472131922]
本稿では、登録RGB-Dデータを用いて、2次元画像理解を3次元距離空間に投影するパイプラインであるINSIGHTを提案する。
7つの共有クラスに対してポイントごとのラベル付け精度を報告し、コードでカプセル化されたデプロイ可能な推定値とともに、公開3Dベンチマークから欠落した15の安全クリティカルクラスに対する検出感度を報告した。
論文 参考訳(メタデータ) (2026-04-25T01:17:45Z) - MVGGT: Multimodal Visual Geometry Grounded Transformer for Multiview 3D Referring Expression Segmentation [59.75554954111619]
マルチビュー3D参照表現(MV-3DRES)を導入し、モデルがシーン構造を復元し、参照対象をスパースなマルチビュー画像から直接セグメント化する必要がある。
本稿では,言語情報をスパースビュー幾何学的推論に組み込む,効率的なエンドツーエンドフレームワークであるMultimodal Visual Geometry Grounded Transformer (MVGGT)を提案する。
実験により、MVGGTは最初の強力なベースラインを確立し、高精度かつ高速な推論を達成し、既存の選択肢よりも優れていることが示された。
論文 参考訳(メタデータ) (2026-01-11T11:44:07Z) - GeoSAM2: Unleashing the Power of SAM2 for 3D Part Segmentation [81.0871900167463]
GeoSAM2は3次元部分分割のためのプロンプト制御可能なフレームワークである。
テクスチャのないオブジェクトが与えられた場合、事前に定義された視点から正規写像とポイントマップを描画する。
部品の選択をガイドするシンプルな2Dプロンプト(クリックやボックス)を受け入れます。
予測されたマスクはオブジェクトにバックプロジェクションされ、ビューに集約される。
論文 参考訳(メタデータ) (2025-08-19T17:58:51Z) - VoxDet: Rethinking 3D Semantic Occupancy Prediction as Dense Object Detection [67.09867723723934]
3Dのセマンティック占有予測は,周囲環境の3D形状とセマンティックスを再構築することを目的としている。
密接なボクセルラベルでは、以前の研究は通常、これを密接なセグメンテーションタスクとして定式化し、それぞれのボクセルを独立に分類する。
本稿では,Voxelレベルの占有率予測を高密度オブジェクト検出として再構成する,インスタンス中心のフレームワークであるVoxDetを提案する。
論文 参考訳(メタデータ) (2025-06-05T04:31:55Z) - Towards Human-Level 3D Relative Pose Estimation: Generalizable, Training-Free, with Single Reference [65.42565481489132]
人間は、単一のクエリ参照イメージペアのみを前提として、ラベル付けやトレーニングをすることなく、これまで見られなかったオブジェクトの相対的なポーズを容易に推論することができる。
RGB-D参照から3D/2.5D形状認識と2.5D形状認識を併用した新しい3次元一般化可能な相対ポーズ推定法を提案する。
RGBとセマンティックマップ(DINOv2がRGB入力から取得)によってテクスチャ化された2.5Dの回転可能なメッシュを識別し、新しいRGBとセマンティックマップを新しい回転ビューの下でレンダリングする。
論文 参考訳(メタデータ) (2024-06-26T16:01:10Z) - Navya3DSeg -- Navya 3D Semantic Segmentation Dataset & split generation
for autonomous vehicles [63.20765930558542]
3Dセマンティックデータは、障害物検出やエゴ-車両の局所化といった中核的な認識タスクに有用である。
そこで我々は,大規模生産段階の運用領域に対応する多様なラベル空間を持つ新しいデータセットであるNavala 3D(Navya3DSeg)を提案する。
ラベルのない23のラベル付きシーケンスと25の補足シーケンスが含まれており、ポイントクラウド上の自己教師付きおよび半教師付きセマンティックセマンティックセグメンテーションベンチマークを探索するために設計された。
論文 参考訳(メタデータ) (2023-02-16T13:41:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。