論文の概要: CROSS: Cascaded Distillation and Dual-Constraint Grounding for Remote Sensing Referring Segmentation
- arxiv url: http://arxiv.org/abs/2608.03147v2
- Date: Wed, 05 Aug 2026 06:08:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.241112
- Title: CROSS: Cascaded Distillation and Dual-Constraint Grounding for Remote Sensing Referring Segmentation
- Title(参考訳): CROSS:リモートセンシング参照セグメンテーションのためのカスケード蒸留と二重拘束接地
- Authors: Tingzhang Luo, Ruizhong Liu, Yichao Liu, Cheng Fan, Yu Liu, Jianyuan Guo,
- Abstract要約: Crossはリモートセンシングイメージを参照するための密に統合されたパラダイムである。
まず,Linguistic-Guided Cascaded Distillation (LGCD)を導入し,建築的ギャップを埋める。
第二に、PSCL(spective-Spatial Contrastive Learning)は、横断的制約を課している。
- 参考スコア(独自算出の注目度): 15.230353995992246
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Referring Remote Sensing Image Segmentation (RRSIS) has achieved significant progress through the integration of VLMs and the Segment Anything Model (SAM). However, this progress largely relies on strong pre-trained capabilities, while leaving two fundamental limitations insufficiently addressed: (1) Architectural Weak-Coupling, where the unidirectional flow forces reliance on coarse VLM prompts and wastes SAM's pixel-level structural guidance, causing localization drift; and (2) Object-Centric Semantic Bias, where models overemphasize dominant object semantics while remaining insensitive to spatial reasoning crucial for RRSIS. Motivated by these observations, we propose CROSS, a tightly integrated paradigm for RRSIS. First, we introduce Linguistic-Guided Cascaded Distillation (LGCD) to bridge the architectural gap, which distills SAM's geometric affinities as soft regularizers into VLM intermediate layers, injecting dense structural priors to refine localization. Second, Perspective-Spatial Contrastive Learning (PSCL) imposes cross-anchored constraints by mining mask-filtered deceptive distractors and spatial-linguistic counterfactuals as hard negatives, explicitly shattering semantic shortcuts to enforce genuine logical consistency. Extensive experiments on RRSIS benchmarks demonstrate that CROSS achieves state-of-the-art performance and maintains precise localization even under severe spatial description perturbations, standing as a robust new paradigm for RRSIS.
- Abstract(参考訳): Referring Remote Sensing Image Segmentation (RRSIS) は VLM と Segment Anything Model (SAM) を統合することで大きな進歩を遂げた。
しかし、この進歩は、強い事前訓練能力に大きく依存する一方で、(1) 粗いVLMのプロンプトとムダに依存する一方向流力であるアーキテクチャ弱結合、SAMのピクセルレベルの構造的ガイダンスによる局所化のドリフト、(2) モデルがRRSISにとって重要な空間的推論に敏感なまま、支配的な対象の意味を過度に強調するオブジェクト指向セマンティックバイアス、の2つの基本的な制限を残している。
これらの観測により、RRSISの密に統合されたパラダイムであるCROSSを提案する。
まず,Linguistic-Guided Cascaded Distillation (LGCD)を導入して,SAMの幾何学的親和性を軟正則化剤として蒸留し,VLM中間層に注入し,局所化を洗練させる。
第二に、パースペクティブ・スポーダル・コントラシティブ・ラーニング(PSCL)は、マスクフィルタリングされた欺取障害や空間言語的反事実をハード・ネガティブとして、真正の論理的一貫性を強制するために意味的ショートカットを明示的に破壊することによって、横断的制約を課している。
RRSISベンチマークの大規模な実験は、CROSSが最先端のパフォーマンスを達成し、深刻な空間的記述摂動の下でも正確な局所化を維持し、RRSISの堅牢な新しいパラダイムとして立っていることを示している。
関連論文リスト
- SARATR-X-v2: Scale-Aware Structural Pre-Training for SAR Foundation Models [43.156720517756405]
SAR事前訓練対象は、転送可能な表現を生成するための2つの条件を満たすべきである。
物理基底安定性は固定演算子を好むが、セマンティックスケールの互換性はデータ駆動合成を好む。
SARATR-X-v2はどちらも単一の設計で和解する。
論文 参考訳(メタデータ) (2026-07-25T14:51:05Z) - LARAD: Layout-Aware Road Anomaly Detection via Spatial-Logic Reasoning [16.92190487823839]
本稿では,外見整合から空間論理的推論へパラダイムをシフトさせるレイアウトアウェア道路異常検出(LARAD)を提案する。
まず、テクスチャに一貫性があるが空間的に無効なトレーニングサンプルを生成するSpatial-Logic Violation Synthesis Pipelineを紹介する。
第二に、OoD誘導の軽量なアテンションブランチにより、標準的なクローズドセットセグメンテーションネットワークを増強する。
論文 参考訳(メタデータ) (2026-07-14T15:09:00Z) - SWARD: Stochastic Window-Attention-Based Relational Distillation for Cross-Architectural Semantic Segmentation [1.1617094867403568]
大規模視覚基盤モデルは、セマンティックセグメンテーションのような密集した予測タスクに大きな利益をもたらした。
現代の基礎教師は、主にグローバルコンテキストを符号化するトランスフォーマーベースであるのに対し、効率的な学生は、通常、局所的に偏った受容場を持つ畳み込みネットワークである。
既存の蒸留法は主に構造的均質性を前提としており、直接的特徴模倣に依存しており、この表現的ギャップを埋めることができない。
本稿では,このギャップを2つの相補的なメカニズムで解決する知識蒸留フレームワークSWARDを提案する。
論文 参考訳(メタデータ) (2026-05-31T04:29:31Z) - Hierarchical Consistency Learning for Test-time Adaptation in Camouflage Perception [50.278200968044665]
カモフラージュされた物体検出(COD)は、物理的属性を通して背景から最小限の知覚差を示すターゲットをローカライズすることを目的としている。
既存のメソッドは、静的なTrain-then-freezeパラダイムによって制約されており、ドメインの剛性と依存性のアノテーションに悩まされている。
動的表現再構成のためのテスト時間適応を統合した階層的一貫性学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-25T09:57:46Z) - Beyond Point-Wise Matching: Structural Representation Alignment for Accelerating Diffusion Transformers [93.3976834364707]
本稿では,特徴写像のリレーショナル幾何における整合性を実現する構造的RePresentation AlignmentフレームワークであるsREPAを提案する。
モデルが事前訓練された特徴から全体的空間配置と構造的相関を内包するように促すことにより、sREPAはより高速でより安定した収束を達成する。
論文 参考訳(メタデータ) (2026-05-16T12:01:04Z) - Hyperbolic Enhanced Representation Learning for Incomplete Multi-view Clustering [57.38215918201251]
本稿では,不完全なマルチビュークラスタリングのためのハイパーボリック拡張表現学習フレームワークであるHERLを提案する。
ポアンカレボール内で操作すると、HERLは表現学習を強化するために構造を意識した潜在空間を構築する。
HERLは最先端のアプローチよりも一貫して優れていることを示す。
論文 参考訳(メタデータ) (2026-04-18T10:50:46Z) - Better with Less: Tackling Heterogeneous Multi-Modal Image Joint Pretraining via Conditioned and Degraded Masked Autoencoder [34.73963627819185]
高分解能光合成開口レーダ(SAR)プレトレーニングは、単一ソース表現を相互に強化するために、モダリティの相乗効果を求める。
我々は、アライメントの少ないテキスト・ベッター・シナジーの先駆者であるCoDe-MAEを提案する。
CoDe-MAEは、表現の劣化を防ぎ、多様な単一および双方向の下流タスクにまたがる新しい最先端のパフォーマンスを確立する。
論文 参考訳(メタデータ) (2026-04-18T10:23:00Z) - Learning to Synergize Semantic and Geometric Priors for Limited-Data Wheat Disease Segmentation [51.06355116973389]
本研究では,小麦病のセグメンテーションを病種特異的な意味認識と疾患境界の局所化の複合的課題として扱う枠組みを提案する。
我々の中核的な洞察は、事前訓練されたDINOv2は、出現シフトを処理するために、堅牢なカテゴリ認識セマンティックスを提供します。
SGPer は,コムギ病と臓器分画のベンチマークにおいて,常に最先端のパフォーマンスを達成している。
論文 参考訳(メタデータ) (2026-04-07T04:19:39Z) - CrystaL: Spontaneous Emergence of Visual Latents in MLLMs [55.34169914483764]
CrystaL(Crystallized Latent Reasoning)は,静止画像と劣化画像を処理するための2つの経路を持つ単一ステージフレームワークである。
CrystaLは2つの経路にまたがる注意パターンと予測分布を明確に調整することで、潜在表現をタスク関連視覚意味論に結晶化する。
知覚集約ベンチマークの実験では、CrystaLは最先端のベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2026-02-24T15:01:30Z) - RSGround-R1: Rethinking Remote Sensing Visual Grounding through Spatial Reasoning [61.84363374647606]
リモートセンシングビジュアルグラウンドディング(RSVG)は、自然言語記述に基づく大規模空中画像における対象物体のローカライズを目的としている。
これらの記述はしばしば位置的手がかりに大きく依存しており、空間的推論においてMLLM(Multimodal Large Language Models)に固有の課題を提起している。
空間理解の高度化を図るために,textbfRSGround-R1 と呼ばれる推論誘導型位置認識後学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-01-29T12:35:57Z) - Bridging Semantics and Geometry: A Decoupled LVLM-SAM Framework for Reasoning Segmentation in Remote Sensing [8.731693840957716]
Think2Seg-RSはLVLMプロンプトをトレーニングし、構造化された幾何学的プロンプトを介して凍ったセグメンション・アプライシング・モデル(SAM)を制御するフレームワークである。
このフレームワークは、EarthReasonデータセット上で最先端のパフォーマンスを達成する。
コンパクトセグメンタは、意味レベルの監督の下でより大きなセグメンタより優れており、異種空中背景において負のプロンプトは効果がない。
論文 参考訳(メタデータ) (2025-12-22T11:46:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。