論文の概要: Segmenting, Fast and Slow: Real-Time Open-Vocabulary Video Instance Segmentation with Dual-Path Processing
- arxiv url: http://arxiv.org/abs/2607.00124v1
- Date: Tue, 30 Jun 2026 19:59:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.613662
- Title: Segmenting, Fast and Slow: Real-Time Open-Vocabulary Video Instance Segmentation with Dual-Path Processing
- Title(参考訳): セグメント化,高速,スロー:デュアルパス処理によるリアルタイムオープン語彙ビデオインスタンスセグメンテーション
- Abstract要約: 我々は、精度を犠牲にすることなく効率を大幅に改善するデュアルストリーム高速スローフレームワークであるSegFSを紹介した。
オブジェクトデコーディングから特徴空間コンディショニングへインスタンスの伝搬をシフトすることで,高密度マスク予測からマルチモーダルなセマンティック理解を分離する。
提案した高速分岐は、標準のOV-VISベンチマークで競合セグメンテーション性能を維持しながら、モバイル指向のUSモデルよりも14倍低い。
- 参考スコア(独自算出の注目度): 40.84222109829302
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Object-centric models inspired by DETR have become the dominant paradigm for open-vocabulary video instance segmentation (OV-VIS). While recent efforts have reduced the computational cost of pixel decoding, textual modality fusion, and object decoding to make these architectures more suitable for mobile devices, real-time on-device inference at high frame rates remains an open challenge. In this paper, we introduce SegFS, a dual-stream fast-slow framework that significantly improves efficiency without sacrificing accuracy. On sparse keyframes, an open-vocabulary object-based model predicts instance-level representations. These representations are then projected back into the backbone feature space to condition a lightweight fast network, which efficiently relocalizes and segments the instances in subsequent frames. By shifting instance propagation from object decoding to feature-space conditioning, our approach decouples multimodal semantic understanding from dense mask prediction and enables efficient temporal propagation. The proposed fast branch achieves up to 14x lower latency than the mobile-oriented MOBIUS model, while maintaining competitive segmentation performance on standard OV-VIS benchmarks.
- Abstract(参考訳): DETRにインスパイアされたオブジェクト中心モデルは、オープン語彙ビデオインスタンスセグメンテーション(OV-VIS)の主要なパラダイムとなっている。
最近の試みでは、これらのアーキテクチャをよりモバイルデバイスに適合させるため、ピクセルデコーディング、テキストモダリティ融合、オブジェクトデコーディングの計算コストが削減されているが、高フレームレートでのリアルタイムオンデバイス推論は未解決の課題である。
本稿では、精度を犠牲にすることなく効率を大幅に向上する2ストリーム高速スローフレームワークであるSegFSを紹介する。
スパースキーフレームでは、オープン語彙オブジェクトベースのモデルがインスタンスレベルの表現を予測する。
これらの表現はバックボーン機能空間に投影され、軽量な高速ネットワークを条件として、後続のフレーム内のインスタンスを効率的に再ローカライズし、セグメント化する。
オブジェクトのデコーディングから特徴空間のコンディショニングへインスタンスの伝搬をシフトすることで,高密度マスク予測からマルチモーダルなセマンティック理解を分離し,効率的な時間的伝搬を実現する。
提案した高速ブランチは,標準のOV-VISベンチマークで競合セグメンテーション性能を維持しつつ,モバイル指向のMOBIUSモデルよりも最大14倍のレイテンシを実現する。
関連論文リスト
- VIRST: Video-Instructed Reasoning Assistant for SpatioTemporal Segmentation [6.447274127678917]
Video Video Object (RVOS) は、自然言語による記述に基づいて、対象物をビデオに分割することを目的としている。
VIRST(Video-Instructed Reasoning Assistant for Spatio-Temporal)は,グローバルなビデオ推論と画素レベルのマスク予測を単一のモデルで統合するエンドツーエンドフレームワークである。
論文 参考訳(メタデータ) (2026-03-28T00:34:15Z) - Fast SAM2 with Text-Driven Token Pruning [52.8350457627401]
Segment Anything Model 2 (SAM2) では、視覚計算モデルがプロンプト駆動のビデオオブジェクトセグメンテーションにおいて大幅に進歩している。
SAM2パイプラインは、イメージエンコーダが生成するすべての視覚トークンを、ターゲットオブジェクトとの関係にかかわらず、下流の時間的推論モジュールを通じて伝達する。
本稿では,時間的伝播に先立ってトークン密度を選択的に低減し,推論効率を向上させるためのテキスト誘導型トークンプルーニングフレームワークを提案する。
論文 参考訳(メタデータ) (2025-12-24T18:59:05Z) - ReferDINO: Referring Video Object Segmentation with Visual Grounding Foundations [33.74746234704817]
ビデオオブジェクトセグメンテーション(RVOS)は、テキスト記述に基づいて、ビデオ全体を通してターゲットオブジェクトをセグメンテーションすることを目的としている。
これは、深い視覚レベルの理解、ピクセルレベルの高密度な予測、時間的推論を含むため、難しい。
基礎的な視覚基盤モデルから領域レベルの視覚テキストアライメントを継承するbfReferDINO RVOSを提案する。
論文 参考訳(メタデータ) (2025-01-24T16:24:15Z) - Temporally Consistent Referring Video Object Segmentation with Hybrid Memory [98.80249255577304]
本稿では,参照セグメンテーションとともに時間的一貫性を明示的にモデル化する,エンドツーエンドなR-VOSパラダイムを提案する。
自動生成された高品質の参照マスクを有するフレームの特徴は、残りのフレームをセグメント化するために伝播される。
大規模な実験により,本手法は時間的整合性を著しく向上させることが示された。
論文 参考訳(メタデータ) (2024-03-28T13:32:49Z) - Betrayed by Attention: A Simple yet Effective Approach for Self-supervised Video Object Segmentation [76.68301884987348]
自己教師型ビデオオブジェクトセグメンテーション(VOS)のための簡易かつ効果的なアプローチを提案する。
我々の重要な洞察は、DINO-pretrained Transformerに存在する構造的依存関係を利用して、ビデオ内の堅牢な時間分割対応を確立することである。
提案手法は,複数の教師なしVOSベンチマークにまたがる最先端性能を実証し,複雑な実世界のマルチオブジェクトビデオセグメンテーションタスクに優れることを示す。
論文 参考訳(メタデータ) (2023-11-29T18:47:17Z) - Distortion-Aware Network Pruning and Feature Reuse for Real-time Video
Segmentation [49.17930380106643]
本稿では,リアルタイム視覚タスクのスキップ接続によるアーキテクチャの高速化を目的とした新しいフレームワークを提案する。
具体的には、各フレームの到着時に、前のフレームから特徴を変換し、特定の空間的ビンで再利用する。
次に、現在のフレームの領域におけるバックボーンネットワークの部分計算を行い、現在のフレームと前のフレームの時間差をキャプチャする。
論文 参考訳(メタデータ) (2022-06-20T07:20:02Z) - Local Memory Attention for Fast Video Semantic Segmentation [157.7618884769969]
既存の単一フレームセマンティックセグメンテーションモデルをビデオセマンティックセグメンテーションパイプラインに変換する新しいニューラルネットワークモジュールを提案する。
我々のアプローチは過去のフレームにおける意味情報の豊富な表現をメモリモジュールに集約する。
都市景観におけるセグメンテーション性能は,それぞれ1.7%,2.1%改善し,erfnetの推論時間は1.5msに抑えられた。
論文 参考訳(メタデータ) (2021-01-05T18:57:09Z) - Learning Dynamic Network Using a Reuse Gate Function in Semi-supervised
Video Object Segmentation [27.559093073097483]
セミ監視ビデオオブジェクト(Semi-VOS)の現在のアプローチは、以前のフレームから情報を伝達し、現在のフレームのセグメンテーションマスクを生成します。
時間的情報を用いて、最小限の変更で迅速にフレームを識別する。
フレーム間の変化を推定し、ネットワーク全体を計算したり、以前のフレームの機能を再利用したりするパスを決定する、新しい動的ネットワークを提案する。
論文 参考訳(メタデータ) (2020-12-21T19:40:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。