論文の概要: OmniAct3D: Leveraging Foundation Geometry and Evidence-Grounded Reasoning for Panoramic 3D Detection
- arxiv url: http://arxiv.org/abs/2610.03015v1
- Date: Fri, 02 Oct 2026 08:49:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.288672
- Title: OmniAct3D: Leveraging Foundation Geometry and Evidence-Grounded Reasoning for Panoramic 3D Detection
- Title(参考訳): OmniAct3D:パノラマ3D検出のための基礎形状とエビデンス周辺推論
- Abstract要約: OmniAct3Dは、透過性VFM前駆体を保存しながら、視点学習型VFM検出器をERPに適応させるフレームワークである。
実験の結果、OmniAct3DはSpheriverseで2.96 NDS、PanoMMOccで24.87 mAPで未適応のVFMベースラインで改善された。
- 参考スコア(独自算出の注目度): 18.929988672643827
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Accurate 3D detection is essential for mobile embodied agents, while Vision Foundation Models (VFMs) offer transferable visual and geometric priors. Yet existing VFM-based 3D detectors rely on narrow-view monocular images or discrete perspective views, limiting coherent surround perception; equirectangular projection (ERP) instead encodes a continuous 360 scene in a single image. Direct transfer remains difficult because ERP organizes geometry and visual information differently, making object-relevant cues hard to model, localize, and preserve. We propose OmniAct3D, a framework that adapts perspective-trained VFM detectors to ERP while preserving transferable VFM priors. To resolve geometric mismatch, the ERP-Ray Geometry Adapter (ERGA-Ray) models spherical viewing rays and periodic spatial structure. To localize evidence in scene-wide context, the Visual-Action Reasoning Chain (VARC) grounds each hypothesis in relevant panoramic evidence and converts it into a structured geometric action. To recover local cues lost under fixed token budgets, the Appearance-Guided Heading Expert (AGHE) re-encodes object regions at higher resolution for heading estimation. Experiments show that OmniAct3D improves over the previous best 3D detector by 2.96 NDS points on Spheriverse and over the unadapted VFM baseline by 24.87 mAP points on PanoMMOcc. With target-specific geometry adaptation, VARC retains 95--98% of the same-configuration mAP, indicating reusable object-level 3D reasoning across sensing configurations. The source code will be made publicly available at https://github.com/FeiT-FeiTeng/OmniAct3D.
- Abstract(参考訳): 正確な3D検出は、移動体エンボディエージェントに必須であり、Vision Foundation Models (VFM) は転送可能な視覚的および幾何学的先行情報を提供する。
しかし、既存のVFMベースの3D検出器は、狭視野のモノクラー画像や離散視点のビューに依存しており、コヒーレントな周囲の知覚を制限している。
直接転送は、ERPが幾何学と視覚情報を異なる方法で整理し、オブジェクト関連キューをモデル化、ローカライズ、保存することが困難になるため、依然として困難である。
OmniAct3Dは、透過性VFM前駆体を保存しながら、視点学習型VFM検出器をERPに適応させるフレームワークである。
幾何学的ミスマッチを解決するため、ERGA-ray Geometry Adapter (ERGA-Ray) は球面観察線と周期的な空間構造をモデル化する。
シーン全体の文脈で証拠をローカライズするために、Visual-Action Reasoning Chain (VARC)は、各仮説を関連するパノラマ的証拠に根拠付け、構造化された幾何学的アクションに変換する。
固定されたトークン予算の下で失われたローカルキューを回復するために、ageearance-Guided Heading Expert (AGHE)は、方向推定のための高解像度でオブジェクトリージョンを再エンコードする。
実験の結果、OmniAct3DはSpheriverseで2.96 NDS、PanoMMOccで24.87 mAPで未適応のVFMベースラインで改善された。
ターゲット固有の幾何学的適応では、VARCは同じ構成のmAPの95-98%を保持しており、センシング構成全体にわたって再利用可能なオブジェクトレベルの3D推論を示している。
ソースコードはhttps://github.com/FeiT-FeiTeng/OmniAct3Dで公開されている。
関連論文リスト
- Map-Det3D: Metric Feed-Forward 3D Reconstruction Prior for Multi-view 3D Object Detection from Streaming Inputs [62.865932175477035]
計量3Dオブジェクト検出は、エンボディエージェントのコア機能であるが、最も信頼性の高いシステムは深度センサーに頼っている。
提案するMap-Det3Dは,RGBから再構成した3次元空間に直接検出を行うオンラインマルチビュー3Dオブジェクト検出モデルである。
論文 参考訳(メタデータ) (2026-08-12T15:33:42Z) - Think, Act, Build: An Agentic Framework with Vision Language Models for Zero-Shot 3D Visual Grounding [34.1504914582344]
3D Visual Groundingは、自然言語記述を通じてオブジェクトを3Dシーンにローカライズすることを目的としている。
生のRGB-Dストリーム上で直接動作する2次元から3次元の再生パラダイムである"Think, Act, Build (TAB)"を提案する。
厳密なVLMセマンティックトラッキングによる多視点カバレッジ障害を克服するために,セマンティックアンコレッド幾何拡張を導入する。
論文 参考訳(メタデータ) (2026-04-01T06:12:16Z) - Bridging 3D Anomaly Localization and Repair via High-Quality Continuous Geometric Representation [1.4763103835215192]
新しいフレームワークは、連続的なポーズ不変の形状表現を学習することで、3D異常の検出と修復を統合する。
Real3D-ADとAnomaly-ShapeNetの実験は最先端の性能を示している。
論文 参考訳(メタデータ) (2025-05-30T10:11:49Z) - VFMM3D: Releasing the Potential of Image by Vision Foundation Model for Monocular 3D Object Detection [80.62052650370416]
モノクル3Dオブジェクト検出は、自律運転やロボティクスなど、さまざまなアプリケーションにおいて重要な役割を担っている。
本稿では,VFMM3Dを提案する。VFMM3Dは,ビジョンファウンデーションモデル(VFM)の機能を利用して,単一ビュー画像を正確にLiDARポイントクラウド表現に変換する,革新的なフレームワークである。
論文 参考訳(メタデータ) (2024-04-15T03:12:12Z) - GPA-3D: Geometry-aware Prototype Alignment for Unsupervised Domain
Adaptive 3D Object Detection from Point Clouds [19.1949602403668]
既存の領域適応型3D検出法では,特徴空間における分布差の問題を適切に考慮していない。
本研究では, 点雲オブジェクトからの固有幾何学的関係を明示的に活用し, 特徴差を低減した, 教師なし領域適応型textbf3D 検出フレームワークを提案する。
nuScenes や KITTI など,様々なベンチマークで得られた評価結果は,GPA-3D の適応シナリオに対する最先端アプローチよりも優れていることを示す。
論文 参考訳(メタデータ) (2023-08-16T04:15:21Z) - Viewpoint Equivariance for Multi-View 3D Object Detection [35.4090127133834]
最先端の手法は多視点カメラ入力からのオブジェクト境界ボックスの推論と復号化に重点を置いている。
本稿では,3次元多視点幾何を利用した新しい3次元オブジェクト検出フレームワークであるVEDetを紹介する。
論文 参考訳(メタデータ) (2023-03-25T19:56:41Z) - Progressive Coordinate Transforms for Monocular 3D Object Detection [52.00071336733109]
本稿では,学習座標表現を容易にするために,PCT(Em Progressive Coordinate Transforms)と呼ばれる,新しい軽量なアプローチを提案する。
本稿では,学習座標表現を容易にするために,PCT(Em Progressive Coordinate Transforms)と呼ばれる,新しい軽量なアプローチを提案する。
論文 参考訳(メタデータ) (2021-08-12T15:22:33Z) - Soft Expectation and Deep Maximization for Image Feature Detection [68.8204255655161]
質問をひっくり返し、まず繰り返し可能な3Dポイントを探し、次に検出器を訓練して画像空間にローカライズする、反復的半教師付き学習プロセスSEDMを提案する。
以上の結果から,sdmを用いてトレーニングした新しいモデルでは,シーン内の下位3dポイントのローカライズが容易になった。
論文 参考訳(メタデータ) (2021-04-21T00:35:32Z) - SF-UDA$^{3D}$: Source-Free Unsupervised Domain Adaptation for
LiDAR-Based 3D Object Detection [66.63707940938012]
LiDAR点雲のみに基づく3Dオブジェクト検出器は、現代のストリートビューベンチマークの最先端を保っている。
本稿ではSF-UDA$3D$で最先端のPointRCNN 3D検出器をドメイン適応し、アノテーションのないドメインをターゲットにする。
論文 参考訳(メタデータ) (2020-10-16T08:44:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。