論文の概要: ISRS-DETR: Detection-Guided Click Propagation for Remote Sensing Interactive Segmentation
- arxiv url: http://arxiv.org/abs/2608.02468v1
- Date: Mon, 03 Aug 2026 16:37:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.709484
- Title: ISRS-DETR: Detection-Guided Click Propagation for Remote Sensing Interactive Segmentation
- Title(参考訳): ISRS-DETR:リモートセンシングインタラクティブセグメンテーションのための検出誘導クリックプロパゲーション
- Authors: Thanh Duc Pham, Anh Nguyen, Duong Duc Hieu, Minh-Tan Pham,
- Abstract要約: 検出誘導型対話型セグメンテーションフレームワークISRS-DETRを提案する。
オブジェクトレベルの証拠をトレーニングと推論の両方に注入する。
最先端の精度を実現し、画像毎の数値クリックを大幅に削減する。
- 参考スコア(独自算出の注目度): 9.07529044229261
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Interactive segmentation reduces the prohibitive cost of pixel-level annotation by allowing users to delineate objects with a few clicks. However, applying this paradigm directly to remote sensing imagery is non-trivial: ultra-high resolutions, small object sizes, and sparse spatial distributions all degrade segmentation quality. Recent work has addressed the resolution barrier and achieved competitive results in interactive segmentation for remote sensing (ISRS). However, they treat all instances of a class within an image as a single objective target. Consequently, interactions spent on one object contribute nothing to its same-class neighbours, and satisfactory masks may demand up to 40 clicks per image, hindering the practicality of these frameworks. We observe that remote sensing scenes exhibit markedly strong inter-object correlation, meaning a single clicked object is highly informative about the rest of its category. Building on this, we propose ISRS-DETR, a detection-guided interactive segmentation framework that injects object-level evidence into both training and inference. Our ISRS-DETR employs an RF-DETR decoder with the interactive segmentation backbone to localise co-occurring same-class objects, and introduces a Dynamic Top-K Click Selection strategy that retains only reliable proposals and converts each into a simulated click, so one user interaction propagates across an entire class. Experiments on three standard remote sensing benchmarks show that ISRS-DETR achieves state-of-the-art accuracy while substantially reducing Number of Clicks per Image (NoC-I). All codes and data splits will be released for reproducibility upon acceptance.
- Abstract(参考訳): インタラクティブセグメンテーションは、数クリックでオブジェクトをデライン化することで、ピクセルレベルのアノテーションの禁止コストを削減する。
しかし、このパラダイムを直接リモートセンシング画像に適用するのは簡単ではない。
最近の研究は解決障壁に対処し、遠隔センシングのためのインタラクティブセグメンテーション(ISRS)の競争結果を得た。
しかし、イメージ内のクラスのすべてのインスタンスを単一のターゲットとして扱う。
その結果、1つのオブジェクトに費やされたインタラクションは、同じクラスの隣人には何も寄与せず、満足のいくマスクは、1イメージあたり最大40クリックを要求する可能性があるため、これらのフレームワークの実用性が妨げられる。
リモートセンシングシーンでは物体間相関が著しく強いことが観察された。
そこで我々は,ISRS-DETRを提案する。ISRS-DETRは,オブジェクトレベルのエビデンスをトレーニングと推論の両方に注入する,検出誘導型対話型セグメンテーションフレームワークである。
我々のISRS-DETRは、同一クラスのオブジェクトをローカライズするために、対話型セグメンテーションバックボーンを備えたRF-DETRデコーダを使用し、信頼性の高い提案のみを保持し、それらをシミュレートされたクリックに変換するダイナミックトップ-Kクリック選択戦略を導入し、クラス全体にわたって1つのユーザーインタラクションが伝播する。
3つの標準リモートセンシングベンチマークの実験により、ISRS-DETRは最先端の精度を実現し、画像あたりのクリック数を大幅に削減した(NoC-I)。
すべてのコードとデータ分割は、受け入れ時に再現性のためにリリースされます。
関連論文リスト
- ClickSeg3D: Few-Click Interactive Segmentation via Semantic Embeddings [9.399068602086821]
そこで本研究では,スパースでランダムにダウンサンプリングされた3D点を直接操作する対話型セグメンテーションフレームワークを提案する。
我々のフレームワークは、トランスフォーマーベースのエンコーダと階層型マスクデコーダで構成されており、マルチレベルなクロップ・アンド・マージ操作を統合している。
我々のモデルは、強いベースラインと比較してmIoUメトリックを20%以上改善します。
論文 参考訳(メタデータ) (2026-05-09T12:51:25Z) - Exploring Efficient Open-Vocabulary Segmentation in the Remote Sensing [55.291219073365546]
Open-Vocabulary Remote Sensing Image (OVRSIS)は、OVS(Open-Vocabulary)をリモートセンシング(RS)ドメインに適応させる新しいタスクである。
textbfRSKT-Segは、リモートセンシングに適した新しいオープン語彙セグメンテーションフレームワークである。
RSKT-Segは高いOVSベースラインを+3.8 mIoUと+5.9 mACCで上回り、効率的なアグリゲーションによって2倍高速な推論を実現している。
論文 参考訳(メタデータ) (2025-09-15T15:24:49Z) - Rotated Multi-Scale Interaction Network for Referring Remote Sensing Image Segmentation [63.15257949821558]
Referring Remote Sensing Image (RRSIS)は、コンピュータビジョンと自然言語処理を組み合わせた新しい課題である。
従来の参照画像(RIS)アプローチは、空中画像に見られる複雑な空間スケールと向きによって妨げられている。
本稿ではRMSIN(Rotated Multi-Scale Interaction Network)を紹介する。
論文 参考訳(メタデータ) (2023-12-19T08:14:14Z) - Deep learning-based interactive segmentation in remote sensing [2.328864986845849]
本研究の目的は,クリックベースインタラクティブセグメンテーションとリモートセンシング画像解析のギャップを埋めることである。
我々は,2つの高解像度空中画像データセットに対して,最先端の対話的セグメンテーション手法の5つの性能評価を行った。
これらの知見に基づいて、リモートセンシングデータの対話的セグメンテーションのためのSegMapという専用オンラインツールを開発した。
論文 参考訳(メタデータ) (2023-08-25T04:49:49Z) - Masked Transformer for Neighhourhood-aware Click-Through Rate Prediction [74.52904110197004]
本稿では,近隣相互作用に基づくCTR予測を提案し,そのタスクを異種情報ネットワーク(HIN)設定に組み込む。
周辺地域の表現を高めるために,ノード間のトポロジカルな相互作用を4種類検討する。
本研究では,2つの実世界のデータセットに関する総合的な実験を行い,提案手法が最先端のCTRモデルを大幅に上回ることを示す。
論文 参考訳(メタデータ) (2022-01-25T12:44:23Z) - Interactive Object Segmentation with Dynamic Click Transform [27.709779682559883]
本研究では,ユーザインタラクションをよりよく表現するために,空間的DCTと特徴的DCTで構成される動的クリック変換ネットワーク(DCT-Net)を提案する。
提案手法の有効性を実証し、3つの標準ベンチマークデータセットの最先端技術と比較して良好な性能を示す。
論文 参考訳(メタデータ) (2021-06-19T10:13:37Z) - FAIRS -- Soft Focus Generator and Attention for Robust Object
Segmentation from Extreme Points [70.65563691392987]
本稿では,ユーザ入力からオブジェクトのセグメンテーションを極端点と補正クリックの形で生成する手法を提案する。
提案手法は,エクストリームポイント,クリック誘導,修正クリックを原則として組み込んだ,高品質なトレーニングデータを生成する能力とスケーラビリティを実証する。
論文 参考訳(メタデータ) (2020-04-04T22:25:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。