論文の概要: Standalone DINOv3 for Training-Free Open-Vocabulary Semantic Segmentation in Remote Sensing
- arxiv url: http://arxiv.org/abs/2608.03023v1
- Date: Tue, 04 Aug 2026 02:12:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:22.995165
- Title: Standalone DINOv3 for Training-Free Open-Vocabulary Semantic Segmentation in Remote Sensing
- Title(参考訳): 遠隔センシングにおける自由開語彙セマンティックセマンティックセグメンテーションのためのスタンドアローンDINOv3
- Authors: Changhao Zhao, Haoxiang Li, Yuke Li, Hai Liu, LingLin Zeng,
- Abstract要約: DinoSplat-OVは、DINOv3を微調整や追加の事前トレーニングなしでリモートセンシングに適応する、トレーニング不要のフレームワークである。
本フレームワークは,テキストのセマンティック親和性と局所的な視覚的類似性を組み合わせることで,パッチレベルの予測をノイズ化する。
UDD5、DOTA、LoveDAの実験では、既存のトレーニングフリーメソッドよりも、競争力や優れたパフォーマンスを示している。
- 参考スコア(独自算出の注目度): 18.075787817513554
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Remote sensing semantic segmentation is hindered by costly pixel-level annotations, motivating training-free open-vocabulary methods. Recently, the recent release of DINOv3 brings DINO.txt, which equips the standalone DINO backbone with image-text contrastive learning and thus opens up the possibility of open-vocabulary segmentation. We propose DinoSplat-OV, a training-free framework that adapts DINOv3 to remote sensing without fine-tuning or additional pretraining. Targeting the dense distribution, multi-scale nature, and large size of remote sensing imagery, we design two core modules. Its Text-aware Laplacian Propagation module de-noises patch-level predictions by combining textual semantic affinities with local visual similarity, improving regional consistency while preserving boundaries. Its Gaussian Splatting Upsampling module reconstructs pixel-level features through RGB-guided anisotropic aggregation and test-time optimization. A global-anchor sliding-window strategy further supports large-scale imagery. Experiments on UDD5, DOTA, and LoveDA demonstrate competitive or superior performance over existing training-free methods, effectively filling the gap of DINO-series models in training-free open-vocabulary segmentation and providing a viable new path for further advances in this direction.
- Abstract(参考訳): リモートセンシングセマンティックセグメンテーションは、高価なピクセルレベルのアノテーションによって妨げられる。
最近、DINOv3のリリースにより、DINO.txtは、DINOのバックボーンに画像テキストのコントラスト学習を装備し、オープン語彙セグメンテーションの可能性を開放する。
我々はDinoSplat-OVを提案する。これはDINOv3を微調整や追加の事前訓練なしにリモートセンシングに適応する訓練不要のフレームワークである。
2つのコアモジュールを設計し,高密度分布,マルチスケール特性,リモートセンシング画像の大規模化を目標とした。
テキスト対応のラプラシアン・プロパゲーションモジュールは、テキスト意味親和性と局所的な視覚的類似性を組み合わせて、境界を保ちながら局所的な一貫性を向上させることにより、パッチレベルの予測をノイズ化する。
Gaussian Splatting Upsamplingモジュールは、RGB誘導異方性アグリゲーションとテスト時間最適化によってピクセルレベルの特徴を再構築する。
グローバルアンカースライディングウインドウ戦略は、大規模画像をさらにサポートする。
UDD5、DOTA、LoveDAの実験は、既存のトレーニングフリー手法よりも競争力または優れた性能を示し、トレーニングフリーなオープン語彙セグメンテーションにおけるDINOシリーズモデルのギャップを効果的に埋め、この方向へのさらなる進歩のための実行可能な新しいパスを提供する。
関連論文リスト
- DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation [53.011370226020695]
DINOdeは、CLIPテキストの埋め込みをDINO視覚多様体と整合させるODEベースのフレームワークである。
提案手法では, (i) Semantic Text Flow (STF) と (ii) Global Context Flow (GCF) の2つの相補的要素を用いて, DINO の CLS トークンが持つ全体像表現を洗練する。
連続軌道としてアライメントをモデル化することにより、ディノドは離散射影に固有の絡み合いを回避し、より堅牢なクロスモーダルアライメントをもたらす。
論文 参考訳(メタデータ) (2026-07-23T14:37:27Z) - ExACT: Exemplar-Driven Calibrated Refinement for Training-Free Visual Grounding in Remote Sensing Images [51.53960096934913]
リモートセンシングビジュアルグラウンドティング(RSVG)は、自由形式の自然言語記述を用いて、高解像度のRS画像中の特定の物体を特定することを目的としている。
マルチモーダル大言語モデル(MLLM)の最近の進歩は、そのようなオープン語彙RSVGに大きな可能性を示している。
Inemplar-driven Calibrated Refinement (ExACT)を提案する。
論文 参考訳(メタデータ) (2026-06-27T13:50:39Z) - DiSa: Saliency-Aware Foreground-Background Disentangled Framework for Open-Vocabulary Semantic Segmentation [16.57245702815661]
Open-vocabulary semantic segmentationは、テキストラベルに基づいた画像内の各ピクセルにラベルを割り当てることを目的としている。
既存のアプローチでは、CLIPのような視覚言語モデル(VLM)を高密度な予測に利用するのが一般的である。
本稿では,新しいサリエンシを意識したフォアグラウンド・バックアングル型フレームワークであるDiSaを紹介する。
論文 参考訳(メタデータ) (2026-01-27T21:15:10Z) - Improving Multimodal Distillation for 3D Semantic Segmentation under Domain Shift [62.50795372173394]
我々は,ライダーポイント雲のセマンティックセグメンテーションのための教師なし領域適応において,視覚基盤モデル(VFM)を利用したレシピの同定を行う。
その結果、パイプラインは4つの広く認識され、困難な設定で、最先端の結果を達成する。
論文 参考訳(メタデータ) (2025-11-21T17:57:43Z) - PGOV3D: Open-Vocabulary 3D Semantic Segmentation with Partial-to-Global Curriculum [20.206273757144547]
PGOV3Dはオープンな3Dセマンティックセマンティックセグメンテーションを改善するための部分言語カリキュラムを導入した新しいフレームワークである。
我々は、密接な意味情報を提供する部分的なシーンでモデルを事前訓練するが、比較的単純な幾何学である。
第2段階では、よりスペーサーで構造的に複雑である、完全なシーンレベルの点雲上でモデルを微調整する。
論文 参考訳(メタデータ) (2025-06-30T08:13:07Z) - Talking to DINO: Bridging Self-Supervised Vision Backbones with Language for Open-Vocabulary Segmentation [56.001484215308075]
本稿では,DINOv2の空間的精度とCLIPの言語理解を組み合わせた,新しいハイブリッドアプローチであるTalk2DINOを提案する。
本研究では,Talk2DINOの強力なセマンティック・ローカライゼーション能力によってセグメンテーションのプロセスが強化されることを示す。
実験の結果、Talk2DINOは教師なしのOVSベンチマークで最先端のパフォーマンスを達成した。
論文 参考訳(メタデータ) (2024-11-28T19:00:03Z) - LiOn-XA: Unsupervised Domain Adaptation via LiDAR-Only Cross-Modal Adversarial Training [61.26381389532653]
LiOn-XAは、LiDAR-Only Cross-Modal (X)学習と3D LiDARポイントクラウドセマンティックセマンティックセグメンテーションのためのAdversarial Trainingを組み合わせた、教師なしドメイン適応(UDA)アプローチである。
3つの現実的適応シナリオに関する実験は、我々のアプローチの有効性を実証している。
論文 参考訳(メタデータ) (2024-10-21T09:50:17Z) - Unleashing Network Potentials for Semantic Scene Completion [50.95486458217653]
本稿では,新しいSSCフレームワーク - Adrial Modality Modulation Network (AMMNet)を提案する。
AMMNetは、モダリティ間の勾配流の相互依存性を可能にするクロスモーダル変調と、動的勾配競争を利用するカスタマイズされた逆トレーニングスキームの2つのコアモジュールを導入している。
AMMNetは最先端のSSC法よりも大きなマージンで優れていた。
論文 参考訳(メタデータ) (2024-03-12T11:48:49Z) - Emergent Open-Vocabulary Semantic Segmentation from Off-the-shelf Vision-Language Models [44.146292819267956]
大規模視覚言語モデル(VLM)は、画像領域と単語を暗黙的に関連付けることを学び、視覚的問題のようなタスクに有効である。
本稿では,OVSS(Plug-and-Play-Vocabulary Semantic)を提案する。
論文 参考訳(メタデータ) (2023-11-28T06:42:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。