論文の概要: RAP-SAM: Towards Real-Time All-Purpose Segment Anything
- arxiv url: http://arxiv.org/abs/2401.10228v1
- Date: Thu, 18 Jan 2024 18:59:30 GMT
- ステータス: 処理完了
- システム内更新日: 2024-01-19 15:24:57.438744
- Title: RAP-SAM: Towards Real-Time All-Purpose Segment Anything
- Title(参考訳): RAP-SAM: リアルタイム全目的セグメンテーションを目指す
- Authors: Shilin Xu, Haobo Yuan, Qingyu Shi, Lu Qi, Jingbo Wang, Yibo Yang,
Yining Li, Kai Chen, Yunhai Tong, Bernard Ghanem, Xiangtai Li, Ming-Hsuan
Yang
- Abstract要約: Segment Anything Model (SAM) は、一般化されたセグメンテーションを実現するための注目すべきモデルである。
現在のリアルタイムセグメンテーションは、主に運転シーンのセグメンテーションのような1つの目的を持っている。
本研究は、リアルタイムデプロイメントにおけるVFMの転送を実現するために、リアルタイムに全目的セグメンテーションと呼ばれる新しいリアルタイムセグメンテーション設定を提案する。
- 参考スコア(独自算出の注目度): 120.17175256421622
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Advanced by transformer architecture, vision foundation models (VFMs) achieve
remarkable progress in performance and generalization ability. Segment Anything
Model (SAM) is one remarkable model that can achieve generalized segmentation.
However, most VFMs cannot run in realtime, which makes it difficult to transfer
them into several products. On the other hand, current real-time segmentation
mainly has one purpose, such as semantic segmentation on the driving scene. We
argue that diverse outputs are needed for real applications. Thus, this work
explores a new real-time segmentation setting, named all-purpose segmentation
in real-time, to transfer VFMs in real-time deployment. It contains three
different tasks, including interactive segmentation, panoptic segmentation, and
video segmentation. We aim to use one model to achieve the above tasks in
real-time. We first benchmark several strong baselines. Then, we present
Real-Time All Purpose SAM (RAP-SAM). It contains an efficient encoder and an
efficient decoupled decoder to perform prompt-driven decoding. Moreover, we
further explore different training strategies and tuning methods to boost
co-training performance further. Our code and model are available at
https://github.com/xushilin1/RAP-SAM/.
- Abstract(参考訳): トランスフォーマーアーキテクチャにより、視覚基礎モデル(VFM)は、性能と一般化能力の著しい進歩を達成する。
Segment Anything Model (SAM) は、一般化されたセグメンテーションを実現するための注目すべきモデルである。
しかしながら、ほとんどのVFMはリアルタイムで動作できないため、複数の製品に転送することは困難である。
一方、現在のリアルタイムセグメンテーションは、主に運転シーンのセグメンテーションのような1つの目的を持っている。
実際のアプリケーションには多様なアウトプットが必要です。
そこで本研究では,リアルタイムにVFMを転送する全目的セグメンテーションという,新たなリアルタイムセグメンテーション設定を提案する。
インタラクティブセグメンテーション、パン光学セグメンテーション、ビデオセグメンテーションを含む3つの異なるタスクを含む。
1つのモデルを使用して、上記のタスクをリアルタイムで達成することを目指している。
まず、いくつかの強力なベースラインをベンチマークします。
次に、実時間全目的SAM(RAP-SAM)を提案する。
効率的なエンコーダと、プロンプト駆動デコーダを実行するための効率的なデカップリングデコーダを含む。
さらに,コトレーニング性能を高めるために,異なるトレーニング戦略やチューニング手法についても検討する。
私たちのコードとモデルはhttps://github.com/xushilin1/RAP-SAM/で公開されています。
関連論文リスト
- OMG-Seg: Is One Model Good Enough For All Segmentation? [86.29839352757922]
OMG-Segは、タスク固有のクエリと出力を持つトランスフォーマーベースのエンコーダデコーダアーキテクチャである。
OMG-Segは10以上の異なるセグメンテーションタスクをサポートできるが、計算とパラメータのオーバーヘッドを大幅に削減できることを示す。
論文 参考訳(メタデータ) (2024-01-18T18:59:34Z) - TinySAM: Pushing the Envelope for Efficient Segment Anything Model [76.21007576954035]
我々は,強力なゼロショット性能を維持しつつ,小さなセグメントの任意のモデル(TinySAM)を得るためのフレームワークを提案する。
本研究は,まず,軽量学生モデルを蒸留するためのハードプロンプトサンプリングとハードマスク重み付け戦略を用いた,フルステージの知識蒸留法を提案する。
また、学習後の量子化を高速化可能なセグメンテーションタスクに適用し、計算コストをさらに削減する。
論文 参考訳(メタデータ) (2023-12-21T12:26:11Z) - You Only Look at Once for Real-time and Generic Multi-Task [23.16894254343321]
自律運転のための適応的,リアルタイム,軽量なマルチタスクモデルを提案する。
オブジェクト検出、乾燥可能なエリアセグメンテーション、レーンラインセグメンテーションタスクに対処する。
その結果、オブジェクト検出のmAP50は81.1%、乾燥可能な領域分割のmIoUは91.0%、レーン線分割のIoUは28.8%であった。
論文 参考訳(メタデータ) (2023-10-02T21:09:43Z) - RefSAM: Efficiently Adapting Segmenting Anything Model for Referring
Video Object Segmentation [16.83885487855187]
本稿では,ビデオオブジェクトのセグメンテーションを参照するためのSAMの可能性を探るRefSAMモデルを提案する。
提案手法は,Cross-RValModalを用いることで,モダリティ学習を向上させるためにオリジナルのSAMモデルに適応する。
我々は、言語と視覚の特徴を効果的に整合させ、融合させるために、パラメータ効率のチューニング戦略を用いる。
論文 参考訳(メタデータ) (2023-07-03T13:21:58Z) - Fast Segment Anything [46.130784421779865]
最近提案されたセグメンテーション・アズ・モデル(SAM)は多くのコンピュータビジョンタスクに大きな影響を与えている。
巨大な計算コストは、業界シナリオにおける幅広い応用を妨げる。
本稿では,この基本課題に対して,性能に匹敵する高速化手法を提案する。
論文 参考訳(メタデータ) (2023-06-21T10:08:29Z) - BURST: A Benchmark for Unifying Object Recognition, Segmentation and
Tracking in Video [58.71785546245467]
複数の既存のベンチマークには、ビデオ内のオブジェクトのトラッキングとセグメンテーションが含まれる。
異なるベンチマークデータセットとメトリクスを使用するため、それらの相互作用はほとんどありません。
高品質なオブジェクトマスクを備えた数千の多様なビデオを含むデータセットであるBURSTを提案する。
すべてのタスクは、同じデータと同等のメトリクスを使って評価されます。
論文 参考訳(メタデータ) (2022-09-25T01:27:35Z) - Segmenting Moving Objects via an Object-Centric Layered Representation [100.26138772664811]
深層表現を用いたオブジェクト中心セグメンテーションモデルを提案する。
複数のオブジェクトで合成トレーニングデータを生成するスケーラブルなパイプラインを導入する。
標準的なビデオセグメンテーションベンチマークでモデルを評価する。
論文 参考訳(メタデータ) (2022-07-05T17:59:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。