論文の概要: S4VY: Segment Anything in Feed-Forward 4D Visual Geometry
- arxiv url: http://arxiv.org/abs/2609.36875v2
- Date: Sat, 03 Oct 2026 21:52:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-07 04:43:28.424125
- Title: S4VY: Segment Anything in Feed-Forward 4D Visual Geometry
- Title(参考訳): S4VY:フィードフォワード4次元視覚幾何学におけるセグメンテーション
- Abstract要約: S4VYは,フィードフォワード4次元視覚幾何学に基づいて構築されたセグメンテーションモデルである。
一連のRGB観測から、S4VYは共有された視覚的幾何学的特徴を、クラス非依存の4Dインスタンスマスクの徹底的なセットに変換する。
この表現は、プロンプト非依存のセグメンテーションと、ポイント条件とボックス条件の選択をサポートする。
- 参考スコア(独自算出の注目度): 66.9518739525231
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Accurate instance segmentation in dynamic scenes is important for downstream applications such as robotics and autonomous driving. Existing Segment Anything models operate primarily on 2D image or video masks and preserve identity through sequential memory, while promptable 4D instance segmentation built upon feed-forward visual geometry remains underexplored. We introduce S4VY, a Segment Anything model built on feed-forward 4D visual geometry. From a set of RGB observations, S4VY transforms shared visual-geometric features into an exhaustive set of class-agnostic 4D instance masks through a space-time query decoder, with each persistent object query binding one entity across all observations. This representation supports prompt-independent segmentation as well as point- and box- conditioned selection, without requiring a seed mask or temporal ordering. We further develop an agentic harness for natural-language grounding in the large observation space of a 4D scene. Active tree search identifies relevant frames without scanning every fixed window; a dual-stream grounder combines fine-grained VLM visual priors with geometry-consistent instance features through complementary bounding-box prediction and object-query matching; and an independent critic selects the final 4D instance mask from their predictions. Extensive experiments demonstrate state-of-the-art 4D instance segmentation and strong language-guided grounding performance under a unified evaluation spanning static and dynamic scenes.
- Abstract(参考訳): 動的シーンにおける正確なインスタンスセグメンテーションは、ロボット工学や自律運転といった下流アプリケーションにとって重要である。
既存のSegment Anythingモデルは、主に2Dイメージまたはビデオマスクで動作し、シーケンシャルメモリを通じてアイデンティティを保持する。
S4VYは,フィードフォワード4次元視覚幾何学に基づいて構築されたセグメンテーションモデルである。
一連のRGB観測から、S4VYは共有された視覚的幾何学的特徴を、空間時間クエリデコーダを通じてクラス非依存の4Dインスタンスマスクの網羅的なセットに変換する。
この表現は、シードマスクや一時的な順序付けを必要とせずに、プロンプト非依存のセグメンテーションとポイントおよびボックス条件の選択をサポートする。
さらに,4次元シーンの大きな観察空間における自然言語接地のためのエージェントハーネスを開発した。
アクティブツリーサーチは、固定ウィンドウをスキャンせずに関連するフレームを識別する; デュアルストリームグライダーは、相補的バウンディングボックス予測とオブジェクトクエリマッチングによって、細粒度のVLM視覚的先行と幾何一貫性のあるインスタンス特徴を組み合わせる; 独立評論家は、その予測から最後の4Dインスタンスマスクを選択する。
大規模実験では、静的シーンと動的シーンにまたがる統一評価の下で、最先端の4Dインスタンスセグメンテーションと強力な言語誘導グラウンド性能を示す。
関連論文リスト
- IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer [64.5765465030666]
オンライン4Dシーン理解のためのストリーミングインスタンスグラウンド幾何変換器IGGT4Dを提案する。
IGGT4Dは、ビデオフレームを逐次処理し、因果時空間モデリングを通じて歴史的コンテキストを再利用し、カメラモーション、幾何学、オブジェクトアイデンティティの統一表現を漸進的に更新する。
3次元再構成、ポーズ推定、例空間追跡、オープンボキャブラリセグメンテーションの実験は、IGGT4Dが既存のストリーミングベースラインより優れていることを示した。
論文 参考訳(メタデータ) (2026-07-21T16:00:01Z) - IVGT: Implicit Visual Geometry Transformer for Neural Scene Representation [76.36174247570716]
ポーズレス多視点画像から連続的かつ一貫性のある幾何を暗黙的にモデル化するインプリシトビジュアル幾何変換器IVGTを提案する。
IVGTは標準座標系で連続的なニューラルネットワークシーン表現を学習し、任意の3D位置での連続的な空間クエリをサポートする。
連続的かつコヒーレントな表面形状の直接抽出を可能にし、任意の視点からRGB画像、深度マップ、表面正規写像のレンダリングを可能にする。
論文 参考訳(メタデータ) (2026-05-15T17:59:57Z) - PanopticQuery: Unified Query-Time Reasoning for 4D Scenes [53.672906752290665]
4Dシーンでクエリ時間推論を統一するフレームワークであるPanopticQueryを紹介した。
提案手法は高忠実度動的再構成のための4次元ガウススプラッティングに基づいている。
動的シーンにおける言語ベースのクエリのための新しいベンチマークであるPanoptic-L4Dを提案する。
論文 参考訳(メタデータ) (2026-04-07T09:40:05Z) - Canonical Space Representation for 4D Panoptic Segmentation of Articulated Objects [5.7565330936756025]
アーティキュレートされた物体知覚は、コンピュータビジョンにおいて重要な課題を呈している。
既存の方法の多くは、そのような対象の性質が本質的に動的であるにもかかわらず、時間力学を無視する。
提案するCanonSeg4Dは,新しい4Dパノプティカルセグメンテーションフレームワークである。
論文 参考訳(メタデータ) (2025-11-07T15:47:56Z) - Uni4D-LLM: A Unified SpatioTemporal-Aware VLM for 4D Understanding and Generation [61.60600246983274]
既存の3Dおよび4Dアプローチは、通常、シーン幾何学を意味的理解とコンテンツ生成のための拡散モデルのための自己回帰モデルに組み込む。
我々は4次元シーン理解と生成のための時間的認識を備えた最初の統合VLMフレームワークであるUni4D-LLMを提案する。
論文 参考訳(メタデータ) (2025-09-28T12:06:54Z) - Mask4Former: Mask Transformer for 4D Panoptic Segmentation [13.99703660936949]
Mask4Formerは、セマンティックインスタンスのセグメンテーションとトラッキングを統合する最初のトランスフォーマーベースのアプローチである。
本モデルは,手作りの非学習型アソシエーション戦略に頼ることなく,その時間的アソシエーションのセマンティックインスタンスを直接予測する。
Mask4Formerは68.4 LSTQのスコアでSemanticTITIテストセットの最先端を達成している。
論文 参考訳(メタデータ) (2023-09-28T03:30:50Z) - 4DComplete: Non-Rigid Motion Estimation Beyond the Observable Surface [7.637832293935966]
観測されていないジオメトリの非剛体運動を推定する新しいデータ駆動アプローチである4DCompleteを紹介します。
ネットワークトレーニングのために,DeformingThings4Dという大規模合成データセットを構築した。
論文 参考訳(メタデータ) (2021-05-05T07:39:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。