論文の概要: Cost-efficient Active Learning for Referring Image Segmentation and Grounding
- arxiv url: http://arxiv.org/abs/2608.30621v2
- Date: Tue, 01 Sep 2026 03:08:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 14:14:26.02459
- Title: Cost-efficient Active Learning for Referring Image Segmentation and Grounding
- Title(参考訳): 画像セグメンテーションとグラウンドの参照のためのコスト効率のよいアクティブラーニング
- Authors: Junbeom Hong, Seonghoon Yu, Hyung Rok Jung, Sundong Kim, Jeany Son,
- Abstract要約: 地域アノテーションとともに自然言語参照表現を収集する問題に対処する。
本稿では,モデルの信頼性が単一領域に崩壊するか,複数の候補に分散するかを計測する新たな獲得機能であるReferred Region Ambiguityを紹介する。
私たちのフレームワークは、いくつかのALベースラインを一貫して上回り、ユーザスタディでは、最大1.6倍の高速な記述ラベリングを実現しています。
- 参考スコア(独自算出の注目度): 11.362010954029417
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Collecting natural-language referring expressions along with region annotations, such as masks or boxes, is a major bottleneck in visual grounding (VG), as annotators must write descriptions that distinguish target regions from visually similar ones. We tackle this by formulating active learning (AL) for VG under the realistic setting where only raw images are available without accompanying text. Since ground-truth text is unavailable, sample selection must estimate which images contain ambiguous regions that would require discriminative referring expressions. To address this, we generate auxiliary region-text pairs using foundation models, and introduce Referred Region Ambiguity, a new acquisition function that measures whether the model's confidence collapses onto a single region or disperses across multiple candidates. It allows our method to prioritize images with strong cross-region competition, which are more informative due to their visual ambiguity. We also design a referring-expression annotation interface that helps annotators quickly focus on writing discriminative language with a few clicks. Experiments on RIS and REC benchmarks show that our AL framework consistently outperforms several AL baselines, while a user study shows up to 1.6X faster description labeling of ours.
- Abstract(参考訳): マスクやボックスなどの領域アノテーションとともに自然言語を参照表現を収集することは、視覚的接地(VG)において大きなボトルネックとなる。
我々は、テキストを伴わずに生画像のみを利用できる現実的な環境下で、VGのためのアクティブラーニング(AL)を定式化する。
接地真実テキストは利用できないため、サンプル選択では、識別的参照表現を必要とする曖昧な領域を含む画像を推定する必要がある。
そこで我々は,基礎モデルを用いて補助的な領域文ペアを生成し,モデルの信頼性が単一領域に崩壊するか,複数の候補に分散するかを計測する新たな獲得関数であるReferred Region Ambiguityを導入する。
これにより,画像の視覚的曖昧さから,強い領域間競争による画像の優先順位付けが可能となる。
また、アノテータが数クリックで識別言語を書くことに集中できるように、参照式アノテーションインターフェースを設計する。
RISとRECベンチマークの実験では、ALフレームワークがいくつかのALベースラインを一貫して上回り、ユーザによる調査では、最大1.6倍の高速な記述ラベリングを実現しています。
関連論文リスト
- Question-Answer Cross Language Image Matching for Weakly Supervised
Semantic Segmentation [37.15828464616587]
クラスアクティベーションマップ(CAM)は、弱教師付きセマンティックセグメンテーションの一般的なツールとして登場した。
我々はWSSS(QA-CLIMS)のための質問応答クロスランゲージ画像マッチングフレームワークを提案する。
論文 参考訳(メタデータ) (2024-01-18T10:55:13Z) - CLIM: Contrastive Language-Image Mosaic for Region Representation [58.05870131126816]
Contrastive Language-Image Mosaic (CLIM) は、領域とテキストの表現を整合させる新しいアプローチである。
CLIMは、異なるオープン語彙オブジェクト検出方法を一貫して改善する。
視覚言語モデルの領域表現を効果的に強化することができる。
論文 参考訳(メタデータ) (2023-12-18T17:39:47Z) - Text Augmented Spatial-aware Zero-shot Referring Image Segmentation [60.84423786769453]
テキスト拡張空間認識(TAS)ゼロショット参照画像セグメンテーションフレームワークを提案する。
TASには、例レベルのマスク抽出のためのマスク提案ネットワーク、画像テキスト相関をマイニングするためのテキスト拡張ビジュアルテキストマッチングスコア、マスク後処理のための空間が含まれている。
提案手法は,最先端のゼロショット参照画像セグメンテーション法より明らかに優れている。
論文 参考訳(メタデータ) (2023-10-27T10:52:50Z) - Referring Image Segmentation Using Text Supervision [44.27304699305985]
既存の参照画像(RIS)メソッドは、監視のために高価なピクセルレベルまたはボックスレベルのアノテーションを必要とするのが一般的である。
本稿では,対象の局所化問題を分類プロセスとして定式化するための,弱教師付きRISフレームワークを提案する。
我々のフレームワークは、既存の完全教師付きRISメソッドに対して有望な性能を達成しつつ、関連する領域から適応した最先端の弱教師付き手法より優れた性能を実現している。
論文 参考訳(メタデータ) (2023-08-28T13:40:47Z) - Diffusion Models for Open-Vocabulary Segmentation [79.02153797465324]
OVDiffは、教師なしオープン語彙セグメンテーションに生成テキストから画像への拡散モデルを利用する新しい手法である。
トレーニング済みのコンポーネントのみに依存し、トレーニングなしで合成セグメンタを直接出力する。
論文 参考訳(メタデータ) (2023-06-15T17:51:28Z) - SpaText: Spatio-Textual Representation for Controllable Image Generation [61.89548017729586]
SpaTextはオープン語彙シーン制御を用いたテキスト・ツー・イメージ生成の新しい手法である。
シーン全体を記述したグローバルテキストプロンプトに加えて、ユーザはセグメンテーションマップを提供する。
現状拡散モデルである画素ベースと潜在条件ベースでの有効性を示す。
論文 参考訳(メタデータ) (2022-11-25T18:59:10Z) - RegionCLIP: Region-based Language-Image Pretraining [94.29924084715316]
画像テキストペアを用いたコントラスト言語画像事前学習(CLIP)は,画像分類において顕著な結果を得た。
そこで我々は,CLIPを拡張して領域レベルの視覚表現を学習するRegionalCLIPという手法を提案する。
提案手法は,COCOデータセットとLVISデータセットの新たなカテゴリに対して,3.8 AP50と2.2 APの精度を著しく向上させる。
論文 参考訳(メタデータ) (2021-12-16T18:39:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。