論文の概要: FOCUS: Forcing In-Context Object Localization through Visual Support Constraints and Policy Optimization
- arxiv url: http://arxiv.org/abs/2605.31145v1
- Date: Fri, 29 May 2026 10:53:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-01 20:56:50.554569
- Title: FOCUS: Forcing In-Context Object Localization through Visual Support Constraints and Policy Optimization
- Title(参考訳): FOCUS:ビジュアルサポート制約とポリシー最適化によるコンテキスト内オブジェクトローカライゼーションの強制
- Abstract要約: In-context Localization (ICL)は、クエリイメージ内の少数のサポート例によって指定されたターゲットオブジェクトをローカライズする。
既存の手法は脆弱であり、明確なカテゴリー管理に依存している。
サポートバウンディングボックスとクエリイメージ間のコンテキスト内注意を明示的に最適化する2段階のトレーニングフレームワークを導入する。
- 参考スコア(独自算出の注目度): 9.2112812802555
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: In-context localization (ICL) seeks to localize a target object specified by a small set of support examples in a query image, operating on the fly without training or parameter updates. Despite rapid advances in vision-language models (VLMs), achieving category-agnostic and visually grounded ICL remains an open problem, even though it is essential for applications such as image editing, personalized visual search, and retrieval. Existing methods are fragile and rely on explicit category supervision, which not only limits applicability in realistic settings with unnamed or instance-specific objects but also introduces category bias that steers predictions toward semantic priors rather than visual evidence. We introduce a two-stage training framework that explicitly optimizes in-context attention between support bounding boxes and query images without category supervision. We further refine localization via reinforcement learning using Group Relative Policy Optimization (GRPO) to directly minimize localization error. This formulation enforces visual correspondence over semantic priors, yielding robust instance-level localization. Empirically, a 7B-parameter model trained with our objectives outperforms models up to 72B parameters, demonstrating that context-aware localization objectives can surpass scaling alone. Comprehensive ablations validate the contribution of each component.
- Abstract(参考訳): インコンテキストローカライゼーション(ICL)は、クエリイメージ内の少数のサポート例によって指定されたターゲットオブジェクトをローカライズし、トレーニングやパラメータ更新なしでオンザフライで運用する。
視覚言語モデル(VLM)の急速な進歩にもかかわらず、画像編集、パーソナライズドビジュアルサーチ、検索などのアプリケーションに欠かせないものの、カテゴリーに依存しない視覚的基盤を持つICLは未解決の問題である。
既存の手法は脆弱であり、明示的なカテゴリー監督に依存しており、名前のないオブジェクトやインスタンス固有のオブジェクトの現実的な設定における適用性を制限しているだけでなく、視覚的証拠ではなくセマンティック優先に対する予測を判断するカテゴリバイアスも導入している。
本稿では,カテゴリの監督なしに,サポート境界ボックスとクエリイメージ間のコンテキスト内注意を明示的に最適化する2段階のトレーニングフレームワークを提案する。
我々はさらに,グループ相対政策最適化(GRPO)を用いた強化学習によるローカライゼーションを改良し,ローカライゼーションエラーを直接最小化する。
この定式化はセマンティック先行よりも視覚的対応を強制し、堅牢なインスタンスレベルのローカライゼーションをもたらす。
経験的に、我々の目的で訓練された7Bパラメータモデルは、72Bパラメータのモデルよりも優れており、コンテキスト対応のローカライゼーション目的がスケーリングのみを超越できることを実証している。
包括的な説明は、各コンポーネントの貢献を検証する。
関連論文リスト
- Primitive-Driven Compositional Forensic Visual Prompting for Open-World Face Anti-Spoofing [59.765442274924595]
視覚的特徴空間で完全に機能する合成視覚的プロンプト学習フレームワークを提案する。
このフレームワークは、学習可能なマイクロ法医学的プリミティブの共有セットを局所的な法医学的エビデンスユニットに洗練するためにパッチ対応の注意を払っている。
9つのオープンワールドプロトコルの実験は、最先端のパフォーマンス、強力なクロスドメインの一般化、そして目に見えない攻撃への堅牢な適応を示す。
論文 参考訳(メタデータ) (2026-08-18T04:18:08Z) - Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking [61.91472604294714]
トラッキング主成分を抽出する新しい言語依存解析機構を提案する。
我々は、事前学習された視覚言語モデルQwen-VLの強力なクロスモーダル理解能力を利用する。
本手法は,複数の大規模視覚言語追跡ベンチマークにおいて,一貫した,より優れたトラッキング性能を実現する。
論文 参考訳(メタデータ) (2026-06-28T12:12:18Z) - ExACT: Exemplar-Driven Calibrated Refinement for Training-Free Visual Grounding in Remote Sensing Images [51.53960096934913]
リモートセンシングビジュアルグラウンドティング(RSVG)は、自由形式の自然言語記述を用いて、高解像度のRS画像中の特定の物体を特定することを目的としている。
マルチモーダル大言語モデル(MLLM)の最近の進歩は、そのようなオープン語彙RSVGに大きな可能性を示している。
Inemplar-driven Calibrated Refinement (ExACT)を提案する。
論文 参考訳(メタデータ) (2026-06-27T13:50:39Z) - LAGO: Language-Guided Adaptive Object-Region Focus for Zero-Shot Visual-Text Alignment [11.785675631199455]
細かい設定では、関連するエビデンスはしばしば、完全なイメージではなく、局所化された部分、属性、テクスチャに置かれる。
最近の局所的な視覚テキストアライメント手法は、クラス記述と複数の画像領域を比較してこの問題に対処している。
LAGOは、効率的なゼロショットローカライズされた視覚テキストアライメントのためのフレームワークである。
論文 参考訳(メタデータ) (2026-05-04T09:07:00Z) - LoGoSeg: Integrating Local and Global Features for Open-Vocabulary Semantic Segmentation [12.192429756057132]
Open-vocabulary semantic segmentation (OVSS)は、従来のクローズドセットセマンティックセマンティックセマンティクスを拡張する。
ロゴセグは、(i)グローバルな画像とテキストの類似性を通じて関連カテゴリを動的に重み付けし、幻覚を効果的に低減するオブジェクトの存在、(ii)正確な地域レベルの視覚的テキスト対応を確立する地域対応アライメントモジュール、(iii)ローカルな構造情報とグローバルな意味コンテキストを最適に結合するデュアルストリーム融合機構の3つの重要なイノベーションを統合する。
論文 参考訳(メタデータ) (2026-02-05T12:03:11Z) - Constrained Prompt Enhancement for Improving Zero-Shot Generalization of Vision-Language Models [57.357091028792325]
ウェブスケールのデータに基づいて事前訓練された視覚言語モデル(VLM)は、ゼロショットの一般化を約束するが、しばしば意味的ミスアライメントに悩まされる。
視覚・テクストアライメントを改善するために,制約付きプロンプトエンハンスメント(CPE)法を提案する。
提案手法はTGSSG(Topology-Guided Synonymous Semantic Generation)とCADRS(Calegory-Agnostic Discriminative Region Selection)の2つの重要なコンポーネントから構成される。
論文 参考訳(メタデータ) (2025-08-24T15:45:22Z) - Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception [71.26728044621458]
DeCLIPは、CLIPを強化する新しいフレームワークで、自己認識モジュールを分離して、それぞれコンテンツ’と“コンテキスト’の機能を取得する。
2D検出とセグメンテーション、3Dインスタンスのセグメンテーション、ビデオインスタンスのセグメンテーション、6Dオブジェクトのポーズ推定など、幅広いタスクにわたる最先端のパフォーマンスを一貫して達成する。
論文 参考訳(メタデータ) (2025-08-15T06:43:51Z) - Helping CLIP See Both the Forest and the Trees: A Decomposition and Description Approach [43.419607730361996]
CLIPのようなビジョンランゲージモデル(VLM)は、対照的な学習を通じて、横断的なアライメントを実現する。
伝統的なプロンプトエンジニアリングは、きめ細かいカテゴリラベルに依存しており、きめ細かい局所的意味論を無視している。
そこで我々は,CLIPが局所化された視覚ディスクリプタを処理できるプラグイン・アンド・プレイソリューションを提案する。
論文 参考訳(メタデータ) (2025-07-04T10:24:26Z) - Teaching VLMs to Localize Specific Objects from In-context Examples [56.797110842152]
現在、視覚言語モデル(VLM)には、状況を考慮した特定の物体をシーン内でローカライズする学習という、基本的な認知能力がないことが分かっています。
この研究は、VLMのパーソナライズされた数ショットのローカライゼーションを探索し、ベンチマークした初めてのものである。
論文 参考訳(メタデータ) (2024-11-20T13:34:22Z) - Domain Adaptation with a Single Vision-Language Embedding [45.93202559299953]
本稿では,完全なターゲットデータではなく,単一のVision-Language (VL)遅延埋め込みに依存する,ドメイン適応のための新しいフレームワークを提案する。
これらのマイニングスタイルは、ゼロショット(ターゲットフリー)とワンショットアン教師なしドメイン適応に使用できることを示す。
論文 参考訳(メタデータ) (2024-10-28T17:59:53Z) - Grounding Everything: Emerging Localization Properties in
Vision-Language Transformers [51.260510447308306]
事前学習された視覚言語(VL)モデルでは、微調整なしでゼロショットのオープン語彙オブジェクトローカライゼーションが可能であることを示す。
本稿では,CLIPSurgeryが自己注意経路に導入した価値価値注意の考え方を一般化するグラウンドング・エコノミクス・モジュール(GEM)を提案する。
セマンティックセグメンテーションのための様々なベンチマークタスクとデータセットに基づいて提案したGEMフレームワークを評価する。
論文 参考訳(メタデータ) (2023-12-01T19:06:12Z) - Bootstrap Fine-Grained Vision-Language Alignment for Unified Zero-Shot
Anomaly Localization [63.61093388441298]
対照的な言語-画像事前学習モデルは、ゼロショット視覚認識タスクで有望なパフォーマンスを示した。
本研究では,ゼロショット異常局所化のためのAnoCLIPを提案する。
論文 参考訳(メタデータ) (2023-08-30T10:35:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。