論文の概要: Robust Multimodal Dynamic Object Segmentation
- arxiv url: http://arxiv.org/abs/2607.18153v1
- Date: Mon, 20 Jul 2026 16:51:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.713481
- Title: Robust Multimodal Dynamic Object Segmentation
- Title(参考訳): 頑健なマルチモーダル動的オブジェクトセグメンテーション
- Authors: Zhe Xin, Hanzhi Chang, Penghui Huang, Yinian Mao, Guoquan Huang,
- Abstract要約: 本稿では,動的マスキングと完全動的マスキングの両方を生成する動的オブジェクトセグメンテーションフレームワークを提案する。
提案手法は,動的オブジェクト分割と静的シーン再構成の両タスクにおいて,最先端の性能を実現する。
- 参考スコア(独自算出の注目度): 14.277810365296071
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Dynamic object segmentation plays a critical role in many visual applications such as static scene reconstruction from dynamic videos. However, existing optical flow-based methods fail to ensure consistent static/dynamic segmentation along object boundaries, while 3D reconstruction-based approaches are highly sensitive to reconstruction errors. To address these limitations, we present a dynamic object segmentation framework that can generate both precise and complete dynamic masks by integrating multimodal cues including 2D point tracks, 3D reconstruction, and semantic information. We design a network combining Transformer architectures with feature clustering aggregation modules to perform static/dynamic classification of multimodal feature trajectories. It enables the model to adaptively determine which type of feature should dominate based on the characteristics of each scene, while also mitigating the impact of feature degradation. Additionally, we introduce a novel point-query-based SAM post-processing method capable of handling multiple objects within a single mask. Extensive experiments demonstrate that our approach achieves state-of-the-art performance in both dynamic object segmentation and static scene reconstruction tasks.
- Abstract(参考訳): 動的オブジェクトセグメンテーションは、動的ビデオからの静的なシーン再構成など、多くの視覚的アプリケーションにおいて重要な役割を果たす。
しかし、既存の光学フローベース手法では、オブジェクト境界に沿った静的/動的セグメンテーションを確実にすることはできず、3次元再構成ベースのアプローチは再構成誤差に非常に敏感である。
これらの制約に対処するために,2Dポイントトラック,3D再構成,意味情報を含む多モードキューを統合することで,正確な動的マスクと完全な動的マスクの両方を生成する動的オブジェクトセグメンテーションフレームワークを提案する。
マルチモーダルな特徴軌跡の静的・動的分類を行うために,Transformerアーキテクチャと特徴クラスタリングアグリゲーションモジュールを組み合わせたネットワークを設計する。
これにより、各シーンの特徴に基づいてどのタイプの機能を優先すべきかを適応的に決定できると同時に、機能劣化の影響を軽減することができる。
さらに,1つのマスク内で複数のオブジェクトを処理可能な新しいポイントクエリベースのSAMポストプロセッシング手法を提案する。
大規模実験により, 動的オブジェクト分割と静的シーン再構成の両タスクにおいて, 最先端の性能を実現することが実証された。
関連論文リスト
- Learning Multi-frame and Monocular Prior for Estimating Geometry in Dynamic Scenes [56.936178608296906]
我々は,MMPと呼ばれる新しいモデルを提案し,その形状をフィードフォワード方式で推定する。
近年のシームズアーキテクチャに基づいて,新しい軌道符号化モジュールを導入する。
MMPはフィードフォワードのポイントマップ予測において最先端の品質を実現することができる。
論文 参考訳(メタデータ) (2025-05-03T08:28:15Z) - SemanticFlow: A Self-Supervised Framework for Joint Scene Flow Prediction and Instance Segmentation in Dynamic Environments [10.303368447554591]
本稿では,全時間点雲のシーンフローとインスタンスセグメンテーションを同時に予測するマルチタスクフレームワークを提案する。
1)静的な背景と動的オブジェクトの最初の粗いセグメンテーションを用いて、共有特徴処理モジュールを介して動きと意味情報を精製するためのコンテキスト情報を提供するマルチタスクスキームの開発,2)シーンフロー推定とインスタンスセグメンテーションの性能を高めるための損失関数セットの開発,そして,交通シーン内の静的および動的オブジェクトの空間的および時間的一貫性を確保することを支援すること,3)粗い学習スキームの開発。
論文 参考訳(メタデータ) (2025-03-19T02:43:19Z) - Vision-based 3D Semantic Scene Completion via Capture Dynamic Representations [37.61183525419993]
動的表現のキャプチャによる視覚に基づくロバストなセマンティックなシーンコンプリートを提案する。
マルチモーダルな大規模モデルを用いて2次元的意味論を抽出し,それらを3次元空間に整列させる。
シーン情報を動的・静的な特徴に分離するために,単眼・立体的深度の特徴を利用する。
論文 参考訳(メタデータ) (2025-03-08T13:49:43Z) - SADG: Segment Any Dynamic Gaussian Without Object Trackers [39.77468734311312]
SADG(Segment Any Dynamic Gaussian Without Object Trackers)は、オブジェクトIDに依存しない動的ガウス分割表現と意味情報を組み合わせた新しいアプローチである。
我々は,Segment Anything Model(SAM)から生成されるマスクを活用し,ハードピクセルマイニングに基づく新しいコントラスト学習目標を活用することで,意味論的特徴を学習する。
提案したベンチマーク上でSADGを評価し,動的シーン内のオブジェクトのセグメンテーションにおけるアプローチの優れた性能を示す。
論文 参考訳(メタデータ) (2024-11-28T17:47:48Z) - ADUGS-VINS: Generalized Visual-Inertial Odometry for Robust Navigation in Highly Dynamic and Complex Environments [7.07379964916809]
ADUGS-VINSを導入し,拡張SORTアルゴリズムと高速化可能な基礎モデルをVIOに統合する。
提案手法は,様々な場面を表現した複数の公開データセットを用いて評価し,多様な動的オブジェクトを含む実世界のシナリオで評価する。
論文 参考訳(メタデータ) (2024-11-28T17:41:33Z) - Dynamic Scene Understanding through Object-Centric Voxelization and Neural Rendering [57.895846642868904]
オブジェクト中心学習が可能な動的シーンのための3次元生成モデルDynaVol-Sを提案する。
ボキセル化は、個々の空間的位置において、物体ごとの占有確率を推定する。
提案手法は2次元セマンティックな特徴を統合して3次元セマンティック・グリッドを作成し,複数の不整合ボクセル・グリッドを通してシーンを表現する。
論文 参考訳(メタデータ) (2024-07-30T15:33:58Z) - Segmenting Moving Objects via an Object-Centric Layered Representation [100.26138772664811]
深層表現を用いたオブジェクト中心セグメンテーションモデルを提案する。
複数のオブジェクトで合成トレーニングデータを生成するスケーラブルなパイプラインを導入する。
標準的なビデオセグメンテーションベンチマークでモデルを評価する。
論文 参考訳(メタデータ) (2022-07-05T17:59:43Z) - TSDF++: A Multi-Object Formulation for Dynamic Object Tracking and
Reconstruction [57.1209039399599]
我々は,シーン全体とその中のすべてのオブジェクトに対して,単一のボリュームを維持できるマップ表現を提案する。
複数の動的オブジェクト追跡および再構成シナリオにおいて,本表現は,近接して移動する他のオブジェクトによって一時的にオクルードされても,表面の正確な再構成を維持できる。
提案したTSDF++の定式化を公開合成データセット上で評価し,標準のTSDFマップ表現と比較した場合の閉塞面の復元性を示す。
論文 参考訳(メタデータ) (2021-05-16T16:15:05Z) - DOT: Dynamic Object Tracking for Visual SLAM [83.69544718120167]
DOTはインスタンスセグメンテーションとマルチビュー幾何を組み合わせて、動的オブジェクトのマスクを生成する。
実際にどのオブジェクトが動いているかを判断するために、DOTは、潜在的にダイナミックなオブジェクトの最初のインスタンスを抽出し、次に推定されたカメラモーションで、測光再投射誤差を最小限にして、そのようなオブジェクトを追跡する。
提案手法はORB-SLAM 2の精度とロバスト性を大幅に向上することを示す。
論文 参考訳(メタデータ) (2020-09-30T18:36:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。