論文の概要: RAFT-MSF++: Temporal Geometry-Motion Feature Fusion for Self-Supervised Monocular Scene Flow
- arxiv url: http://arxiv.org/abs/2604.19349v1
- Date: Tue, 21 Apr 2026 11:32:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-22 22:41:49.740819
- Title: RAFT-MSF++: Temporal Geometry-Motion Feature Fusion for Self-Supervised Monocular Scene Flow
- Title(参考訳): RAFT-MSF++: 時間的幾何-運動的特徴融合による単眼一眼の流れの可視化
- Authors: Xunpei Sun, Zuoxun Hou, Yi Chang, Gang Chen, Wei-Shi Zheng,
- Abstract要約: 単眼のシーンフロー推定は画像列から高密度な3次元動きを復元することを目的としている。
RAFT-MSF++は,時間的特徴を融合して深度とシーンフローを推定する自己教師型マルチフレームフレームワークである。
実験の結果、RAFT-MSF++はKITTI Scene Flowベンチマークで24.14%のSF-allを達成した。
- 参考スコア(独自算出の注目度): 51.43025173196566
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Monocular scene flow estimation aims to recover dense 3D motion from image sequences, yet most existing methods are limited to two-frame inputs, restricting temporal modeling and robustness to occlusions. We propose RAFT-MSF++, a self-supervised multi-frame framework that recurrently fuses temporal features to jointly estimate depth and scene flow. Central to our approach is the Geometry-Motion Feature (GMF), which compactly encodes coupled motion and geometry cues and is iteratively updated for effective temporal reasoning. To ensure the robustness of this temporal fusion against occlusions, we incorporate relative positional attention to inject spatial priors and an occlusion regularization module to propagate reliable motion from visible regions. These components enable the GMF to effectively propagate information even in ambiguous areas. Extensive experiments show that RAFT-MSF++ achieves 24.14% SF-all on the KITTI Scene Flow benchmark, with a 30.99% improvement over the baseline and better robustness in occluded regions. The code is available at https://github.com/sunzunyi/RAFT-MSF-PlusPlus.
- Abstract(参考訳): 単眼のシーンフロー推定は画像列から高密度な3次元運動を復元することを目的としているが、既存の手法は2フレームの入力に限られており、時間的モデリングやオクルージョンに対する頑健さが制限されている。
RAFT-MSF++は,時間的特徴を融合して深度とシーンフローを同時推定する自己教師型マルチフレームフレームワークである。
提案手法の中心となるのがGeometry-Motion Feature (GMF) であり、これは運動と幾何学の結合キューをコンパクトに符号化し、効果的な時間的推論のために反復的に更新される。
この時間的融合のオクルージョンに対する堅牢性を確保するために、相対的な位置的注意を取り入れて空間的先行点を注入し、オクルージョン正則化モジュールを用いて、可視領域からの信頼性のある動きを伝搬する。
これらの成分により、GMFは曖昧な領域でも情報を効果的に伝播することができる。
RAFT-MSF++ は KITTI Scene Flow ベンチマークで 24.14% の SF-all を達成した。
コードはhttps://github.com/sunzunyi/RAFT-MSF-PlusPlusで公開されている。
関連論文リスト
- Rethinking Temporal Fusion with a Unified Gradient Descent View for 3D Semantic Occupancy Prediction [62.69089767730514]
視覚に基づく3次元意味的占有予測(VisionOcc)のための時間融合法であるGAFusionを提案する。
これは、VisionOccフレームワーク内の時間融合の未調査の側面を開き、時間的手がかりと融合戦略の両方に焦点を当てる。
論文 参考訳(メタデータ) (2025-04-17T14:05:33Z) - FUSE: Label-Free Image-Event Joint Monocular Depth Estimation via Frequency-Decoupled Alignment and Degradation-Robust Fusion [92.4205087439928]
画像強調共同深度推定法は、頑健な知覚に相補的なモダリティを利用するが、一般化可能性の課題に直面している。
自己監督型転送(PST)と周波数デカップリング型フュージョンモジュール(FreDF)を提案する。
PSTは、画像基盤モデルとの遅延空間アライメントによるクロスモーダルな知識伝達を確立し、データ不足を効果的に軽減する。
FreDFは、低周波構造成分から高周波エッジ特性を明示的に分離し、モード比周波数ミスマッチを解消する。
この組み合わせのアプローチにより、FUSEはターゲットデータセットに対する軽量デコーダ適応のみを必要とするユニバーサルなイメージイベントを構築することができる。
論文 参考訳(メタデータ) (2025-03-25T15:04:53Z) - Leveraging Consistent Spatio-Temporal Correspondence for Robust Visual Odometry [7.517597541959445]
S-Temporal Visual Odometry (STVO) は,マルチフレームフローマッチングの精度と一貫性を高めるための,新しいディープネットワークアーキテクチャである。
我々のSTVOはETH3Dベンチマークの最先端性能とKITTI Odometryベンチマークの38.9%を実現している。
論文 参考訳(メタデータ) (2024-12-22T08:47:13Z) - SRFNet: Monocular Depth Estimation with Fine-grained Structure via Spatial Reliability-oriented Fusion of Frames and Events [5.800516204046145]
従来のフレームベースの手法は、ダイナミックレンジの制限と動きのぼかしによる性能低下に悩まされる。
最近の研究は、新しいイベントカメラを活用して、フレームイベントの特徴融合を通じてフレームのモダリティを補完またはガイドしている。
SRFNetは、昼と夜の両方で微細な構造で深度を推定できる。
論文 参考訳(メタデータ) (2023-09-22T12:59:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。