論文の概要: FoRIS: Progressive Foreground Refinement for Training-Free In-Context Segmentation
- arxiv url: http://arxiv.org/abs/2609.03384v1
- Date: Thu, 03 Sep 2026 05:38:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 18:28:38.933393
- Title: FoRIS: Progressive Foreground Refinement for Training-Free In-Context Segmentation
- Title(参考訳): FoRIS: トレーニング不要なインコンテキストセグメンテーションのためのプログレッシブフォアグラウンドリファインメント
- Authors: Ming Hu, Jianfu Yin, Mingyu Dou, Miaomiao Zhang, Yao Wang, Cong Hu, Bingliang Hu, Quan Wang,
- Abstract要約: In-Context (ICS) は、オブジェクトや部品などの任意の意味概念を正確に分類することを目的としている。
我々はICSを、より古典的なセグメンテーションの観点から再考し、粗大から細かなプログレッシブ・リファインメント・プロセスと見なしている。
本稿では、FoRISと呼ばれるトレーニング不要なインコンテキストセグメンテーションフレームワークを提案する。
- 参考スコア(独自算出の注目度): 16.75842822088073
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: In-Context Segmentation (ICS) aims to precisely segment arbitrary semantic concepts, such as objects or parts, given one or a few annotated visual exemplars. In this paper, we revisit ICS from a more classical segmentation perspective, viewing it as a coarse-to-fine progressive refinement process. Rather than directly predicting the final mask through reference-query matching, we progressively refine the segmentation from coarse and ambiguous foreground responses to precise and complete foreground structures. Building upon this perspective, we propose a training-free in-context segmentation framework, termed FoRIS. Specifically, FoRIS consists of three key stages: Foreground Purification, Foreground Localization, and Foreground Consolidation, which progressively suppress background distractions, localize discriminative target regions, and recover complete foreground structures through semantic aggregation. Experimental results demonstrate that FoRIS achieves SOTA performance across semantic and part segmentation tasks, with average improvements of 4.5 and 4.8 mIoU points over existing approaches in the 1-shot and 5-shot settings, respectively. Code: https://github.com/Xi-Mu-Yu/FoRIS.
- Abstract(参考訳): In-Context Segmentation (ICS) は、オブジェクトや部品などの任意の意味概念を正確に分類することを目的としている。
本稿では,より古典的なセグメンテーションの観点からICSを再考する。
参照クエリマッチングによって最終マスクを直接予測するのではなく, 粗い, 曖昧なフォアグラウンド応答から, 正確な, 完全なフォアグラウンド構造へと, セグメンテーションを段階的に洗練する。
この観点から、FoRISと呼ばれるトレーニング不要なインコンテキストセグメンテーションフレームワークを提案する。
特に、フォリスは、前景の浄化、前景の局所化、前景の強化という3つの重要な段階から構成されており、背景の乱れを徐々に抑制し、差別的対象領域を局所化し、意味的なアグリゲーションを通じて完全な前景の構造を復元する。
実験の結果、FoRISはセグメンテーションタスクと部分セグメンテーションタスクでSOTA性能を達成し、1ショット設定と5ショット設定で既存のアプローチよりも4.5mIoUポイントと4.8mIoUポイントを平均的に改善した。
コード:https://github.com/Xi-Mu-Yu/FoRIS
関連論文リスト
- TraceCLIP: Recovering Local Semantics from Patch-to-CLS Contributions [20.430455131220544]
我々は、潜伏パッチレベルのセマンティックエビデンスを回復するトレーニング不要のフレームワークであるTraceCLIPを紹介する。
また,TraceCLIPは,最強のトレーニングフリー手法よりも平均mIoUで1.3~4.5ポイント向上することを示した。
論文 参考訳(メタデータ) (2026-07-28T11:25:27Z) - DiSa: Saliency-Aware Foreground-Background Disentangled Framework for Open-Vocabulary Semantic Segmentation [16.57245702815661]
Open-vocabulary semantic segmentationは、テキストラベルに基づいた画像内の各ピクセルにラベルを割り当てることを目的としている。
既存のアプローチでは、CLIPのような視覚言語モデル(VLM)を高密度な予測に利用するのが一般的である。
本稿では,新しいサリエンシを意識したフォアグラウンド・バックアングル型フレームワークであるDiSaを紹介する。
論文 参考訳(メタデータ) (2026-01-27T21:15:10Z) - One-shot In-context Part Segmentation [97.77292483684877]
パートセグメンテーションの課題に取り組むために,One-shot In-context Part (OIParts) フレームワークを提案する。
私たちのフレームワークは、トレーニングのない、フレキシブルで、データ効率のよいパートセグメンテーションに対して、新しいアプローチを提供します。
我々は多種多様な対象カテゴリで顕著なセグメンテーション性能を達成した。
論文 参考訳(メタデータ) (2025-03-03T03:50:54Z) - Harnessing Vision Foundation Models for High-Performance, Training-Free Open Vocabulary Segmentation [26.786890883280062]
本稿では,CLIP と DINO が抽出した特徴をサブイメージから切り離し,SAM のエンコーダを利用してグローバルアグリゲーションの相関行列を生成する,トレーニング不要なフレームワーク Trident を紹介する。
Tridentは、現在のSOTAと比較して8つのベンチマークでmIoUを大幅に改善し、44.4から48.6.Codeに増加した。
論文 参考訳(メタデータ) (2024-11-14T06:31:20Z) - FreeSeg: Unified, Universal and Open-Vocabulary Image Segmentation [42.89720785573885]
FreeSegはUnified、Universal、Open-Vocabulary Imageを実現するための汎用フレームワークである。
我々は,FreeSegが3つのセグメンテーションタスクの性能と一般化に新たな成果をもたらすことを示す。
論文 参考訳(メタデータ) (2023-03-30T08:42:49Z) - Fully and Weakly Supervised Referring Expression Segmentation with
End-to-End Learning [50.40482222266927]
Referring Expression(RES)は、与えられた言語表現に従ってターゲットをローカライズし、セグメンテーションすることを目的としている。
そこで我々は,カーネル分割パイプラインを並列に構築し,より分離し,局所化とセグメント化のステップと相互作用する。
我々の手法は単純だが驚くほど効果的であり、完全に教師された設定と弱い設定において、従来の最先端のRES手法よりも優れている。
論文 参考訳(メタデータ) (2022-12-17T08:29:33Z) - Self-Supervised Video Object Segmentation via Cutout Prediction and
Tagging [117.73967303377381]
本稿では, 自己教師型ビデオオブジェクト(VOS)アプローチを提案する。
本手法は,対象情報と背景情報の両方を考慮した識別学習損失の定式化に基づく。
提案手法であるCT-VOSは, DAVIS-2017 と Youtube-VOS の2つの挑戦的なベンチマークにおいて,最先端の結果を達成している。
論文 参考訳(メタデータ) (2022-04-22T17:53:27Z) - A Simple Baseline for Zero-shot Semantic Segmentation with Pre-trained
Vision-language Model [61.58071099082296]
オブジェクト検出やセマンティックセグメンテーションといった、より広範な視覚問題に対して、ゼロショット認識をどのようにうまく機能させるかは定かではない。
本稿では,既訓練の視覚言語モデルであるCLIPを用いて,ゼロショットセマンティックセマンティックセマンティックセマンティクスを構築することを目的とした。
実験結果から, この単純なフレームワークは, 従来の最先端をはるかに上回っていることが明らかとなった。
論文 参考訳(メタデータ) (2021-12-29T18:56:18Z) - SCNet: Enhancing Few-Shot Semantic Segmentation by Self-Contrastive
Background Prototypes [56.387647750094466]
Few-shot セマンティックセマンティックセマンティクスは,クエリイメージ内の新規クラスオブジェクトを,アノテーション付きの例で分割することを目的としている。
先進的なソリューションのほとんどは、各ピクセルを学習した前景のプロトタイプに合わせることでセグメンテーションを行うメトリクス学習フレームワークを利用している。
このフレームワークは、前景プロトタイプのみとのサンプルペアの不完全な構築のために偏った分類に苦しんでいます。
論文 参考訳(メタデータ) (2021-04-19T11:21:47Z) - Context-self contrastive pretraining for crop type semantic segmentation [39.81074867563505]
提案したContext-Self Contrastive Loss (CSCL)は、セマンティックバウンダリをポップアップさせる埋め込み空間を学習する。
衛星画像時系列(SITS)からの作物型セマンティックセマンティックセグメンテーションでは,サテライト境界における性能が重要なボトルネックとなる。
より粒度の高い作物のクラスを得るための超解像における意味的セグメンテーションのプロセスを提案する。
論文 参考訳(メタデータ) (2021-04-09T11:29:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。