論文の概要: RayLift: Lifting Complementary Ray-Wise Evidence with 3D Geometry Priors for Semantic Scene Completion
- arxiv url: http://arxiv.org/abs/2608.08476v1
- Date: Sun, 09 Aug 2026 04:41:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.839909
- Title: RayLift: Lifting Complementary Ray-Wise Evidence with 3D Geometry Priors for Semantic Scene Completion
- Title(参考訳): RayLift: セマンティックシーンコンプリートに先立つ3次元幾何による補体線量証拠
- Abstract要約: カメラベースの3Dセマンティックシーン補完(SSC)は、自律走行とロボット工学のための総合的なシーン理解を提供する。
既存の方法は、しばしば立体深さ推定を決定論的幾何学的制約として扱い、深さの不確かさと局所対応誤差が直接ボクセル表現に伝播する。
ステレオ幾何をメートル法基準として用いるフレームワークであるRayLiftを提案し, 補的光線証拠を組み込んで信頼性の高い3次元構造を適応的に復元する。
- 参考スコア(独自算出の注目度): 23.7438085195588
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Camera-based 3D semantic scene completion (SSC) provides comprehensive scene understanding for autonomous driving and robotics. However, existing methods often treat stereo depth estimates as deterministic geometric constraints, causing depth uncertainty and local correspondence errors to propagate directly into voxel representations. To address this issue, we propose RayLift, a framework that uses stereo geometry as a metric reference while incorporating complementary ray evidence to recover reliable 3D structures adaptively. RayLift first employs a Complementary Context Encoder that extracts geometry-aware priors from a frozen 3D vision foundation model, thereby enriching the scene context. It then introduces a Depth Ray Evidence Lifter module that jointly models geometric dissimilarity, depth confidence, and spatial uncertainty to adaptively sample and weight candidate surface locations along each camera ray. Finally, a Semantic-Aware Voxel Integrator injects the resulting ray evidence into voxel features by explicitly modeling their spatial support. Extensive experiments on SemanticKITTI and SSCBench-KITTI-360 demonstrate that RayLift achieves competitive performance and consistently outperforms existing methods.
- Abstract(参考訳): カメラベースの3Dセマンティックシーン補完(SSC)は、自律走行とロボット工学のための総合的なシーン理解を提供する。
しかし、既存の手法はしばしば立体深度推定を決定論的幾何学的制約として扱い、深さの不確かさと局所対応誤差がボクセル表現に直接伝播する。
そこで本稿では, ステレオ幾何を計量基準として用いるフレームワークであるRayLiftを提案し, 補間光線エビデンスを組み込んで, 信頼性の高い3次元構造を適応的に復元する。
RayLiftはまずComplementary Context Encoderを使用し、凍結した3D視覚基盤モデルからジオメトリ対応の事前情報を抽出し、シーンコンテキストを豊かにする。
次に、Depth Ray Evidence Lifterモジュールを導入し、幾何学的相似性、深さの信頼性、空間的不確実性を共同でモデル化し、各カメラ線に沿った候補表面の位置を適応的にサンプリングし、重み付けする。
最後に、セマンティック・アウェアのボクセル積分器は、空間的支持を明示的にモデル化することで、得られた光線エビデンスをボクセル特徴に注入する。
SemanticKITTI と SSCBench-KITTI-360 に関する大規模な実験は、RayLift が競争性能を達成し、既存の手法を一貫して上回ることを示した。
関連論文リスト
- RaysUp: Ultra-light Universal Feature Upsampling via Geometry-Aware Ray Representation [11.94699228168484]
RaysUpは超軽量でタスクに依存しない、VFMに依存しない機能アップサンプリングフレームワークである。
任意の密接な一般化で高分解能特徴写像を再構成する。
実験によると、RaysUpはAnyUpのパラメータの16%しか使用していない。
論文 参考訳(メタデータ) (2026-06-22T01:37:56Z) - 3D Consistency Optimization for Self-Supervised Monocular Video Depth Estimation [21.287558280133076]
本稿では,連続的な映像深度推定を制約のないマルチビュー3D再構成問題として再放送する新しいパラダイムを提案する。
我々のアプローチは、画像レベルの測光レンダリング、鮮明な世界座標幾何アライメント、マルチスケールの時間勾配一貫性の3つの制約によって駆動される。
提案手法は,フレームベース,映像ベース深度推定器,多視点3D再構成ベースラインよりも高い精度で,最先端の空間精度を実現する。
論文 参考訳(メタデータ) (2026-06-14T08:56:45Z) - ViPS: Video-informed Pose Spaces for Auto-Rigged Meshes [55.32681167870698]
Video-informed Pose Spaces (ViPS)は、自動リップメッシュのための有効な調律の潜時分布を検出するフィードフォワードフレームワークである。
ViPSは生成ビデオの先行値を所定のリグパラメータ化上の普遍分布に転送する。
評価の結果,VPSは,合成アーティストが作成した4Dデータに基づいて訓練した最先端の手法の性能と,妥当性と多様性の両面で一致していることがわかった。
論文 参考訳(メタデータ) (2026-04-19T21:21:11Z) - Think, Act, Build: An Agentic Framework with Vision Language Models for Zero-Shot 3D Visual Grounding [34.1504914582344]
3D Visual Groundingは、自然言語記述を通じてオブジェクトを3Dシーンにローカライズすることを目的としている。
生のRGB-Dストリーム上で直接動作する2次元から3次元の再生パラダイムである"Think, Act, Build (TAB)"を提案する。
厳密なVLMセマンティックトラッキングによる多視点カバレッジ障害を克服するために,セマンティックアンコレッド幾何拡張を導入する。
論文 参考訳(メタデータ) (2026-04-01T06:12:16Z) - SpatialFly: Geometry-Guided Representation Alignment for UAV Vision-and-Language Navigation in Urban Environments [49.966170814478915]
UAV VLNのための幾何学誘導空間表現フレームワークを提案する。
明示的な3次元再構成を伴わないRGB観測において、SpatialFlyは幾何学誘導2次元表示アライメント機構を導入する。
実験結果から、SpatialFlyは現状のUAV VLNベースラインを目に見える環境と見えない環境の両方で一貫して上回っていることが明らかとなった。
論文 参考訳(メタデータ) (2026-03-22T03:56:58Z) - Generation Models Know Space: Unleashing Implicit 3D Priors for Scene Understanding [50.098085774845195]
本稿では,大規模生成モデルにおいて暗黙の空間的先行性を活用することで,パラダイムシフトを提案する。
GeneEGA-3D (Video Extracted Generative Awareness) は,事前学習した映像拡散モデルを潜在世界シミュレータとして再利用するプラグイン・アンド・プレイ・フレームワークである。
論文 参考訳(メタデータ) (2026-03-19T17:59:58Z) - GLaD: Geometric Latent Distillation for Vision-Language-Action Models [106.53332923530245]
GLaDは、知識蒸留による事前学習中に3次元の幾何学的先行を組み込んだ幾何学的認識型視覚・言語・アクション(VLA)フレームワークである。
GLaDは4つのLIBEROタスクスイートの平均成功率は94.1%で、同じ事前トレーニングデータを使用するUniVLA(92.5%)を上回っている。
論文 参考訳(メタデータ) (2025-12-10T13:07:27Z) - TALO: Pushing 3D Vision Foundation Models Towards Globally Consistent Online Reconstruction [57.46712611558817]
3次元視覚基礎モデルでは、1つのフィードフォワードパスを通して、未校正画像からキー3D属性を再構成する際の強力な一般化が示されている。
近年の戦略は,グローバルトランスフォーメーションの解決によって連続的な予測と整合するが,本分析では,仮定の妥当性,局所的なアライメント範囲,雑音的幾何の下でのロバスト性といった基本的な限界を明らかにしている。
本研究では,グローバルに伝播する制御点を利用して空間的に異なる不整合を補正する,Tin Plate Splineに基づく高DOFおよび長期アライメントフレームワークを提案する。
論文 参考訳(メタデータ) (2025-12-02T02:22:20Z) - PLANA3R: Zero-shot Metric Planar 3D Reconstruction via Feed-Forward Planar Splatting [56.188624157291024]
提案するPLANA3Rは,提案しない2次元画像から平面3次元再構成を計測するためのポーズレスフレームワークである。
トレーニング中に3次元平面アノテーションを必要とする以前のフィードフォワード法とは異なり、PLANA3Rは明確な平面監督なしで平面3次元構造を学習する。
本研究は,複数の室内環境データセットに対するPLANA3Rの有効性を検証するとともに,領域外屋内環境への強力な一般化を実証する。
論文 参考訳(メタデータ) (2025-10-21T15:15:33Z) - ViPOcc: Leveraging Visual Priors from Vision Foundation Models for Single-View 3D Occupancy Prediction [11.312780421161204]
本稿では,視覚基盤モデルからの視覚的先行情報を活用して,詳細な3D占有率予測を行うViPOccを提案する。
また,効率的な実例認識光サンプリングのための意味誘導型非重複ガウス混合サンプリング器を提案する。
本実験は,3次元占有予測と深度推定の両方において,ViPOccの優れた性能を示す。
論文 参考訳(メタデータ) (2024-12-15T15:04:27Z) - Bridging Stereo Geometry and BEV Representation with Reliable Mutual Interaction for Semantic Scene Completion [45.171150395915056]
3Dセマンティックシーン補完(SSC)は、限られた観測から密集した3Dシーンを推定する必要がある不適切な認識課題である。
従来のカメラベースの手法は、固有の幾何学的曖昧さと不完全な観察のため、正確なセマンティックシーンを予測するのに苦労した。
我々は,SSCにおけるステレオマッチング技術と鳥眼ビュー(BEV)表現学習を利用して,そのような問題に対処する。
論文 参考訳(メタデータ) (2023-03-24T12:33:44Z) - Joint stereo 3D object detection and implicit surface reconstruction [39.30458073540617]
本稿では,SO(3)の正確なオブジェクト指向を復元し,ステレオRGB画像から暗黙的な剛性形状を同時に予測できる学習ベースのフレームワークS-3D-RCNNを提案する。
方向推定のためには、局所的な外観を観測角度にマッピングする従来の研究とは対照的に、意味のある幾何学的表現(IGR)を抽出して進歩的なアプローチを提案する。
このアプローチは、知覚強度を1つか2つのビューからオブジェクト部分座標に変換するディープモデルにより、カメラ座標系において、直接自我中心のオブジェクト指向推定を実現する。
3次元境界ボックス内におけるより詳細な記述を実現するため,ステレオ画像からの暗黙的形状推定問題について検討する。
論文 参考訳(メタデータ) (2021-11-25T05:52:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。