論文の概要: PGL-3D: Towards Progressive Geometric Learning for 3D Visual Query Localization
- arxiv url: http://arxiv.org/abs/2609.33558v1
- Date: Sun, 27 Sep 2026 13:29:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:46.677683
- Title: PGL-3D: Towards Progressive Geometric Learning for 3D Visual Query Localization
- Title(参考訳): PGL-3D:3次元ビジュアルクエリローカライゼーションのためのプログレッシブな幾何学的学習を目指して
- Abstract要約: 3DVQLは、RGBポイントクラウドシーケンスにおけるクエリ対象の最新の連続的な発生を検索する。
応答フレーム毎に9-DoFキューブを予測します。
本稿では,予測-選択-再定義-予測フレームワークである3DVQL(PGL-3D)について紹介する。
- 参考スコア(独自算出の注目度): 60.842562471209995
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: 3D Visual Query Localization (3DVQL) retrieves the latest contiguous occurrence of a queried object in an RGB--point-cloud sequence and predicts a 9-DoF cuboid for every response frame. The query is captured independently of the search sequence, so its annotated pose may differ from how the object appears in the search frames. The benchmark baseline predicts cuboids after feature modeling, leaving their geometry unused for subsequent feature refinement. We investigate whether complete intermediate cuboids can improve query and proposal representations before final decoding. We introduce Progressive Geometric Learning for 3DVQL (PGL-3D), a predict--select--refine--re-predict framework that uses intermediate cuboids to guide the aggregation of search evidence and update query and proposal representations. A shared head first predicts a complete cuboid for every proposal. Query--Tube--Memory (QTM) then selects reference observations by combining proposal association, cuboid quality, frame response, and target absence, since association confidence alone establishes neither target presence nor geometric accuracy. The center, size, and orientation of each selected cuboid define soft pooling weights over query-conditioned proposal features. The pooled memory updates the query and proposal representations, and the head re-predicts from the updated features. A training-only objective, ST-D9O, supervises cuboid geometry at every stage by adding boundary, signed-distance, and soft-overlap terms to parameter regression. PGL-3D achieves a mean stAP of $0.270 \pm 0.004$ on 3DVQL, compared with $0.044$ reported for LaF. Ablations support the benefits of geometry-guided feature updates, while stage-wise analyses show improved cuboid accuracy. Replacing the geometry objective in our PROT3D reproduction with ST-D9O improves mAO on GSOT3D from $21.63\%$ to $25.78\%$. Our code and models will be released.
- Abstract(参考訳): 3Dビジュアルクエリローカライゼーション(3DVQL)は、RGBポイントクラウドシーケンスにおけるクエリ対象の最新の連続した発生を検索し、応答フレーム毎に9-DoFキューブを予測します。
クエリは検索シーケンスとは独立してキャプチャされるため、アノテーション付きのポーズは、オブジェクトが検索フレームにどのように現れるかとは異なる可能性がある。
ベンチマークベースラインは、機能モデリングの後にキュービイドを予測し、その後の機能改善のためにその幾何学を未使用のまま残している。
完全中間立方体が最終復号前にクエリおよび提案表現を改善することができるかどうかを検討する。
本稿では,3DVQL(Progressive Geometric Learning for 3DVQL, PGL-3D)について紹介する。
共有ヘッドはまず、提案毎に完全な立方体を予測する。
QTM(Query-Tube-Memory)は,提案されたアソシエーション,カブイド品質,フレーム応答,目標不在を組み合わせて参照観測を選択する。
選択された立方体の中心、大きさ、配向は、クエリ条件付き提案機能よりもソフトプーリング重みを定義する。
プールされたメモリは、クエリと提案表現を更新し、ヘッドは更新された機能から再予測する。
トレーニングのみの目的であるST-D9Oは、パラメータ回帰に境界、符号付き距離、ソフトオーバーラップ項を追加することで、各段階における立方体幾何学を監督する。
PGL-3D は 3DVQL 上で 0.270 \pm 0.004$ の平均 stAP を達成する。
アブレーションは幾何誘導された特徴更新の利点をサポートし、ステージワイズ分析では立方体精度が改善されている。
ST-D9OによるProt3D再現における幾何学的目的の置き換えにより,GSOT3D上のmAOは21.63\%から25.78\%に改善される。
コードとモデルはリリースされます。
関連論文リスト
- UniPose9D: Universal Category-Agnostic Object Pose Estimation [10.964744555206243]
UniPose9Dは9次元オブジェクトのポーズ推定のためのカテゴリに依存しない基礎モデルである。
カテゴリーラベル、CADモデル、平均形事前、参照ビューのない回転、翻訳、およびメートル法サイズを推定する。
精度を向上させるために,適応しきい値を持つRANSAC N-hop Kabsch-Umeyamaアルゴリズムを導入する。
論文 参考訳(メタデータ) (2026-07-10T21:24:23Z) - Free Geometry: Refining 3D Reconstruction from Longer Versions of Itself [38.95274911975506]
Free Geometryは、フィードフォワードの3D再構成モデルが3D基底の真理なしにテスト時に自己進化することを可能にするフレームワークである。
当社のアプローチは、4つのベンチマークデータセットにまたがって、Depth Anything 3やVGGTといった最先端の基礎モデルを継続的に改善しています。
論文 参考訳(メタデータ) (2026-04-15T16:24:03Z) - UniQueR: Unified Query-based Feedforward 3D Reconstruction [68.01984215138098]
提案するUniQueRは,未提示画像からの3次元再構成を効率よく正確に行うための,クエリベースの統合フィードフォワードフレームワークである。
我々のモデルは、明示的な幾何学的クエリとして機能する3Dアンカー点のコンパクトな集合を学習する。
Mip-NeRF 360とVR-NeRFの実験により、UniQueRはレンダリング品質と幾何学的精度の両方において最先端のフィードフォワード法を上回ることを示した。
論文 参考訳(メタデータ) (2026-03-24T06:42:02Z) - Dens3R: A Foundation Model for 3D Geometry Prediction [44.13431776180547]
Dens3Rは幾何学的密度予測のための3次元基礎モデルである。
画像対マッチング機能と本質的不変性モデリングを統合することにより、Dens3Rは複数の幾何学的量を正確に回帰する。
論文 参考訳(メタデータ) (2025-07-22T07:22:30Z) - E3D-Bench: A Benchmark for End-to-End 3D Geometric Foundation Models [78.1674905950243]
3次元幾何学基礎モデル(GFM)の総合ベンチマークを初めて提示する。
GFMは、単一のフィードフォワードパスで密度の高い3D表現を直接予測し、スローまたは未使用のカメラパラメータを不要にする。
我々は16の最先端GFMを評価し、タスクやドメイン間の長所と短所を明らかにした。
すべてのコード、評価スクリプト、処理されたデータは公開され、3D空間インテリジェンスの研究が加速される。
論文 参考訳(メタデータ) (2025-06-02T17:53:09Z) - CAGroup3D: Class-Aware Grouping for 3D Object Detection on Point Clouds [55.44204039410225]
本稿では,CAGroup3Dという新しい2段階完全スパース3Dオブジェクト検出フレームワークを提案する。
提案手法は,まず,オブジェクト表面のボクセル上でのクラス認識型局所群戦略を活用することによって,高品質な3D提案を生成する。
不正なボクセルワイドセグメンテーションにより欠落したボクセルの特徴を回復するために,完全にスパースな畳み込み型RoIプールモジュールを構築した。
論文 参考訳(メタデータ) (2022-10-09T13:38:48Z) - Optimal and Robust Category-level Perception: Object Pose and Shape
Estimation from 2D and 3D Semantic Keypoints [24.232254155643574]
与えられたカテゴリ(例えば車)のオブジェクトを撮影する2Dまたは3Dセンサデータを取得し、オブジェクトの3Dポーズと形状を再構築する必要がある問題を考える。
最初の貢献は PACE3D* と PACE2D* を開発することである。
2つ目のコントリビューションは、PACE3D#とPACE2D#という名前の、両方のソルバの開発バージョンです。
論文 参考訳(メタデータ) (2022-06-24T21:58:00Z) - Robust 6D Object Pose Estimation by Learning RGB-D Features [59.580366107770764]
本稿では、この局所最適問題を解くために、回転回帰のための離散連続的な新しい定式化を提案する。
我々はSO(3)の回転アンカーを均一にサンプリングし、各アンカーから目標への制約付き偏差を予測し、最適な予測を選択するための不確実性スコアを出力する。
LINEMOD と YCB-Video の2つのベンチマーク実験により,提案手法が最先端の手法より優れていることが示された。
論文 参考訳(メタデータ) (2020-02-29T06:24:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。