論文の概要: Toward Robust In-Context Segmentation via Concept Guidance
- arxiv url: http://arxiv.org/abs/2606.28149v1
- Date: Fri, 26 Jun 2026 14:46:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-29 18:24:25.524496
- Title: Toward Robust In-Context Segmentation via Concept Guidance
- Title(参考訳): 概念誘導によるロバストなインコンテキストセグメンテーションに向けて
- Authors: Zhigang Chen, Xiawu Zheng, Rongrong Ji,
- Abstract要約: インコンテキストセグメンテーション(ICS)では、パラメータを更新することなく、少数の参照画像とその対応するマスクを使用してクエリイメージ内のターゲット領域をセグメントするモデルが必要である。
本稿では,参照から高レベルなセマンティック概念を抽出してセグメンテーションを行う概念ガイド付きインコンテキスト(CG-ICS)を提案する。
標準ICSベンチマークの実験により、CG-ICSは最先端の精度を達成し、ロバスト性を大幅に向上し、多様な参照選択のばらつきを著しく低減した信頼性の高いICSシステムが得られることが示された。
- 参考スコア(独自算出の注目度): 72.30282710763969
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: In-context segmentation (ICS) requires a model to segment target regions in a query image using only a few reference images and their corresponding masks, without updating any parameters. Despite recent progress, prior ICS studies have largely overlooked a critical aspect: system robustness, ie, whether the model can produce stable segmentation results for the same query under different references. In this work, we revisit ICS from the robustness perspective and introduce a novel paradigm, Concept-Guided In-Context Segmentation (CG-ICS), which performs segmentation by extracting high-level semantic concepts from references rather than relying solely on low-level visual matching. Specifically, CG-ICS introduces a concept reasoning module that uses an MLLM to propose candidates and a SAM3-driven scoring function with tree-search refinement to select reliable textual concepts, together with a parallel visual exemplar route that provides query-side spatial grounding via a simple context construction. Both the textual concept and the visual exemplar are then used to activate the segmentation capability of a frozen SAM3 backbone. Extensive experiments on standard ICS benchmarks demonstrate that CG-ICS not only achieves state-of-the-art accuracy but also substantially improves robustness, yielding a more reliable ICS system with significantly reduced variance across diverse reference choices.
- Abstract(参考訳): インコンテキストセグメンテーション(ICS)では、パラメータを更新することなく、少数の参照画像とその対応するマスクを使用してクエリイメージ内のターゲット領域をセグメントするモデルが必要である。
最近の進歩にもかかわらず、以前のICS研究では、システムロバスト性、すなわち、モデルが異なる参照の下で同じクエリに対して安定したセグメンテーション結果が得られるかどうかという、重要な側面がほとんど見過ごされている。
本研究では、ロバストネスの観点からICSを再考し、低レベルな視覚的マッチングのみに頼るのではなく、参照から高レベルなセマンティック概念を抽出してセグメンテーションを行う新しいパラダイム、コンセプトガイド付きインコンテキストセグメンテーション(CG-ICS)を導入する。
特に、CG-ICSでは、MLLMを用いて候補とSAM3を駆動するスコアリング関数を提案して、信頼性の高いテキスト概念を選定するコンセプト推論モジュールと、単純なコンテキスト構成によるクエリ側空間グラウンドニングを提供する並列視覚的例示経路を導入している。
テキストの概念と視覚的例の両方が、凍ったSAM3バックボーンのセグメンテーション機能を活性化するために使用される。
標準ICSベンチマークの大規模な実験により、CG-ICSは最先端の精度を達成するだけでなく、ロバスト性も大幅に向上し、多様な参照選択のばらつきを著しく低減した信頼性の高いICSシステムが得られることが示された。
関連論文リスト
- Don't Guess, Just Ask: Resolving Ambiguity in Referring Segmentation via Multi-turn Clarification [21.7465671470498]
セグメンテーションの参照は、対象のオブジェクトをテキストクエリに基づいて画像やビデオに分割することを目的としている。
マルチターン会話を通じてユーザの意図を積極的に解明する新しいエージェントフレームワークであるIC-Segを提案する。
また、階層的な新しい最適化戦略であるHi-GRPOを導入し、軌道、旋回、ステップレベルにおいて、密集した情報的な監視信号を注入する。
論文 参考訳(メタデータ) (2026-05-17T16:30:44Z) - RCoT-Seg: Reinforced Chain-of-Thought for Video Reasoning and Segmentation [48.30592530624143]
Video Reasoningは、人間の意図と時間的ロジックを伝える暗黙の指示に基づいて、対象のオブジェクトをビデオに分割することを目的としている。
既存のMLLMベースの手法では,単純なサンプリングや補助MLLMを用いてフレームを選択した後,[SEG]トークンでマスクを予測する。
RCoT-SegはVRSを時間的ビデオ(TVR)と目標知覚(KTP)に分解するビデオ・オブ・思想のフレームワークである。
論文 参考訳(メタデータ) (2026-05-08T06:39:53Z) - INSID3: Training-Free In-Context Segmentation with DINOv3 [63.961377087673476]
INSID3は、凍結したDINOv3機能のみから、さまざまな粒度で概念を分割する、トレーニング不要のアプローチである。
1ショットのセマンティクス、部分、パーソナライズされたセグメンテーションで最先端の結果を達成し、以前の処理を +7.5 % mIoU で上回る。
論文 参考訳(メタデータ) (2026-03-30T14:16:37Z) - CSMCIR: CoT-Enhanced Symmetric Alignment with Memory Bank for Composed Image Retrieval [54.15776146365823]
Composed Image Retrieval (CIR)では、ユーザーは参照画像と操作テキストの両方を使用してターゲットイメージを検索できる。
CSMCIRは3つの相乗的コンポーネントを通して効率的なクエリターゲットアライメントを実現する統一表現フレームワークである。
論文 参考訳(メタデータ) (2026-01-07T09:21:38Z) - SeC: Advancing Complex Video Object Segmentation via Progressive Concept Construction [65.15449703659772]
ビデオオブジェクト(VOS)はコンピュータビジョンにおける中核的なタスクであり、ターゲットオブジェクトの追跡とセグメント化をモデルに要求する。
本稿では,従来の特徴マッチングから,高レベルなオブジェクト中心表現のプログレッシブな構築と利用へ移行する概念駆動セグメンテーションフレームワークであるセグメンテーション概念(SeC)を提案する。
SeCはSAM SeCVOSよりも11.8ポイント改善され、最先端のコンセプトを意識したビデオオブジェクトセグメンテーションが新たに確立された。
論文 参考訳(メタデータ) (2025-07-21T17:59:02Z) - SEGIC: Unleashing the Emergent Correspondence for In-Context Segmentation [87.18373801829314]
In-context segmentationは、"in-context example"と呼ばれるいくつかのラベル付きサンプルイメージを使用して、新しいイメージをセグメント化することを目的としている。
単一ビジョン基盤モデル(VFM)に基づくエンドツーエンドのセグメンテーション・イン・コンテクストフレームワークSEGICを提案する。
SEGICは、ワンショットセグメンテーションベンチマークで最先端のパフォーマンスをもたらす、単純だが効果的なアプローチである。
論文 参考訳(メタデータ) (2023-11-24T18:59:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。