論文の概要: ViCo-SAM3: Vision-Conditioned Alignment for Open-Vocabulary Camouflaged Object Segmentation
- arxiv url: http://arxiv.org/abs/2609.15418v1
- Date: Mon, 14 Sep 2026 11:44:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 07:15:06.301639
- Title: ViCo-SAM3: Vision-Conditioned Alignment for Open-Vocabulary Camouflaged Object Segmentation
- Title(参考訳): ViCo-SAM3:Open-Vocabulary Camouflaged Object Segmentationのためのビジョンコンディションアライメント
- Abstract要約: Open-vocabulary camouflaged object segmentation (OVCOS)は、未確認のcamouflaged objectをテキストガイダンスでセグメントすることを目的としている。
SAM3は,大域的なテキスト意味論とOVCOSの微細なピクセルレベルの視覚的手がかりとの明確なセマンティックなギャップに依然として悩まされている。
我々は,OVCOS用に設計されたビジョンコンディションアライメントフレームワークであるViCo-SAM3を提案する。
- 参考スコア(独自算出の注目度): 8.589736300334389
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Open-vocabulary camouflaged object segmentation (OVCOS) aims to segment unseen camouflaged objects under text guidance. We observe that SAM3 still suffers from a pronounced semantic gap between global textual semantics and fine-grained pixel-level visual cues in OVCOS. Meanwhile, fully fine-tuning the text encoder introduces heavy parameter overhead and risks overfitting to training categories, which compromises open-vocabulary representation flexibility. To address these issues, we propose ViCo-SAM3, a Vision-Conditioned alignment framework designed for OVCOS. Specifically, we introduce vision-conditioned (ViCo) module, which dynamically modulates text embeddings with global visual context, enabling textual representations to adapt to the current image content and thereby effectively bridging the semantic gap between vision and text. Building on this, we further design a vision-conditioned cross-modal binding (ViCoBind) module to enhance cross-modal interaction and semantic alignment between visual and textual representations. Without bells and whistles, ViCo-SAM3 achieves state-of-the-art performance on the OVCamo benchmark and demonstrates strong generalization.
- Abstract(参考訳): Open-vocabulary camouflaged object segmentation (OVCOS)は、未確認のcamouflaged objectをテキストガイダンスでセグメントすることを目的としている。
SAM3は,大域的なテキスト意味論とOVCOSの微細なピクセルレベルの視覚的手がかりとの明確なセマンティックなギャップに依然として悩まされている。
一方、テキストエンコーダを完全に微調整することで、トレーニングカテゴリに過度に適合する重いパラメータのオーバーヘッドとリスクが導入され、オープン語彙表現の柔軟性が損なわれる。
これらの問題を解決するために,OVCOS用に設計されたビジョンコンディションアライメントフレームワークであるViCo-SAM3を提案する。
具体的には、視覚条件付き(ViCo)モジュールを導入し、グローバルな視覚的コンテキストでテキスト埋め込みを動的に調整し、テキスト表現が現在の画像コンテンツに適応できるようにし、視覚とテキスト間の意味的ギャップを効果的に埋める。
これに基づいて視覚条件付きクロスモーダルバインディング(ViCoBind)モジュールを設計し、視覚的およびテキスト的表現間の相互モーダル相互作用とセマンティックアライメントを強化する。
ベルとホイッスルがなければ、ViCo-SAM3はOVCamoベンチマークで最先端のパフォーマンスを達成し、強力な一般化を示す。
関連論文リスト
- DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation [53.011370226020695]
DINOdeは、CLIPテキストの埋め込みをDINO視覚多様体と整合させるODEベースのフレームワークである。
提案手法では, (i) Semantic Text Flow (STF) と (ii) Global Context Flow (GCF) の2つの相補的要素を用いて, DINO の CLS トークンが持つ全体像表現を洗練する。
連続軌道としてアライメントをモデル化することにより、ディノドは離散射影に固有の絡み合いを回避し、より堅牢なクロスモーダルアライメントをもたらす。
論文 参考訳(メタデータ) (2026-07-23T14:37:27Z) - VIPA: Visual Informative Part Attention for Referring Image Segmentation [21.08745617831414]
Referring Image (RIS) は、自然言語で記述された対象オブジェクトをセグメント化することを目的としている。
画像セグメンテーションを参照するための新しいビジュアルインフォーマティブ・パート・アテンション(VIPA)フレームワークを提案する。
我々のフレームワークは、ネットワークの注意を、きめ細かな関心領域としっかりと一致させることができる。
論文 参考訳(メタデータ) (2026-02-16T14:36:50Z) - Constrained Prompt Enhancement for Improving Zero-Shot Generalization of Vision-Language Models [57.357091028792325]
ウェブスケールのデータに基づいて事前訓練された視覚言語モデル(VLM)は、ゼロショットの一般化を約束するが、しばしば意味的ミスアライメントに悩まされる。
視覚・テクストアライメントを改善するために,制約付きプロンプトエンハンスメント(CPE)法を提案する。
提案手法はTGSSG(Topology-Guided Synonymous Semantic Generation)とCADRS(Calegory-Agnostic Discriminative Region Selection)の2つの重要なコンポーネントから構成される。
論文 参考訳(メタデータ) (2025-08-24T15:45:22Z) - FOCUS: Unified Vision-Language Modeling for Interactive Editing Driven by Referential Segmentation [55.01077993490845]
最近のLVLM(Large Vision Language Models)は、視覚的理解と生成的モデリングを統一する有望な能力を示している。
本稿では,分割認識と制御可能なオブジェクト中心生成をエンドツーエンドフレームワークに統合した統合LVLMであるFOCUSを紹介する。
論文 参考訳(メタデータ) (2025-06-20T07:46:40Z) - Context-Aware Semantic Segmentation: Enhancing Pixel-Level Understanding with Large Language Models for Advanced Vision Applications [0.0]
本稿では,Large Language Models (LLM) と最先端のビジョンバックボーンを統合する新しいコンテキスト認識セマンティックフレームワークを提案する。
視覚と言語の特徴を整合させるクロスアテンションメカニズムを導入し、モデルがコンテキストをより効果的に推論できるようにする。
この研究は視覚と言語の間のギャップを埋め、自律運転、医療画像、ロボット工学などの応用における、よりインテリジェントでコンテキスト対応の視覚システムへの道を開く。
論文 参考訳(メタデータ) (2025-03-25T02:12:35Z) - Exploring Interactive Semantic Alignment for Efficient HOI Detection with Vision-language Model [3.3772986620114387]
ISA-HOIはCLIPからの知識を広範囲に活用し,視覚的特徴とテキスト的特徴の対話的意味論を整合させる。
本手法は, HICO-DETとV-COCOのベンチマークにおいて, トレーニングエポックがはるかに少なく, ゼロショット環境下での最先端性能を向上する。
論文 参考訳(メタデータ) (2024-04-19T07:24:32Z) - Language-Driven Visual Consensus for Zero-Shot Semantic Segmentation [114.72734384299476]
本稿では,言語駆動型ビジュアルコンセンサス(LDVC)アプローチを提案する。
クラス埋め込みを、その離散的で抽象的な性質からアンカーとして活用し、クラス埋め込みに向けて視覚的特徴を操る。
我々の手法は、目に見えないクラスに対するセグメンテーションモデルの能力を大幅に向上させる。
論文 参考訳(メタデータ) (2024-03-13T11:23:55Z) - VGSG: Vision-Guided Semantic-Group Network for Text-based Person Search [51.9899504535878]
テキストに基づく人物検索のための視覚誘導セマンティック・グループ・ネットワーク(VGSG)を提案する。
VGSGでは、視覚関連テキストの特徴を抽出するために視覚誘導の注意が用いられる。
関係知識伝達の助けを借りて、VGKTは意味群テキスト特徴と対応する視覚特徴とを整合させることができる。
論文 参考訳(メタデータ) (2023-11-13T17:56:54Z) - Linguistic Query-Guided Mask Generation for Referring Image Segmentation [10.130530501400079]
画像セグメンテーションの参照は、与えられた言語表現に従って、興味のある画像領域をセグメンテーションすることを目的としている。
本稿では,言語クエリ誘導マスク生成を行うために,トランスフォーマー上に構築されたエンドツーエンドフレームワークを提案する。
論文 参考訳(メタデータ) (2023-01-16T13:38:22Z) - Fine-Grained Semantically Aligned Vision-Language Pre-Training [151.7372197904064]
大規模な視覚言語による事前学習は、幅広い下流タスクにおいて顕著な進歩を見せている。
既存の手法は主に、画像とテキストのグローバルな表現の類似性によって、モーダル間のアライメントをモデル化する。
ゲーム理論的相互作用の新たな視点から, 微粒なセマンティックアライメントを学習する, 微粒なセマンティックなvisiOn-langUage PrEトレーニングフレームワークであるLOを導入する。
論文 参考訳(メタデータ) (2022-08-04T07:51:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。