論文の概要: Restrict, Don't Retrain: Inference-Time VLM Guidance for Zero-Shot Aerial Segmentation
- arxiv url: http://arxiv.org/abs/2609.00628v1
- Date: Tue, 01 Sep 2026 03:07:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.262953
- Title: Restrict, Don't Retrain: Inference-Time VLM Guidance for Zero-Shot Aerial Segmentation
- Title(参考訳): Restrict, Don't Retrain: Inference-Time VLM Guidance for Zero-Shot Aerial Segmentation
- Authors: Teresa DiMeola, Charles Walter, Hong Xiao,
- Abstract要約: 視覚言語モデル(VLM)を実行する1つのコンシューマグレードのGPUを使用して、不足するガイダンスを提供する。
本研究は,4つの航空データセットを対象とし,基本モデルが有能な各段階において一貫した利得を示す。
- 参考スコア(独自算出の注目度): 0.8921166277011344
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Global welfare often depends on the correct interpretation of aerial and satellite imagery. Acting on such imagery (mapping flooded ground, crop extent, or damaged infrastructure) demands pixel-level segmentation to ensure perfect class localization. Pretrained general foundation models, when applied directly, often miss important features and cannot always find all the classes belonging to a given scene, overlooking smaller objects that matter most. We use a single consumer-grade GPU running a vision-language model (VLM) to supply this missing guidance, improving segmentation while producing structured, auditable evidence that drives the result and can be inspected on its own. We fuse three approaches: the frozen foundation model that labels every pixel, and two queries to a VLM, one to choose the classes that matter, and one to locate the small objects the base model misses. Evaluating across four aerial datasets, we see consistent gains at each stage where the base model is competent.
- Abstract(参考訳): 地球の福祉は、しばしば航空画像と衛星画像の正確な解釈に依存する。
このような画像(浸水した地面、作物の広さ、または損傷したインフラ)に作用すると、完全なクラスローカライゼーションを確保するためにピクセルレベルのセグメンテーションが要求される。
事前訓練された基礎モデルは、直接適用された場合、しばしば重要な特徴を見逃し、最も重要な小さなオブジェクトを見渡して、あるシーンに属するすべてのクラスを見つけることができない。
我々は、視覚言語モデル(VLM)を実行している1つのコンシューマグレードのGPUを使用して、この不足したガイダンスを提供し、結果を駆動し、独自に検査できる構造化された監査可能なエビデンスを生成しながら、セグメンテーションを改善します。
すべてのピクセルにラベルを付ける冷凍ファンデーションモデルと、VLMへの2つのクエリ、重要なクラスを選択するためのもの、ベースモデルが見逃す小さなオブジェクトを見つけるためのもの、の3つのアプローチを融合します。
4つの航空データセットで評価すると、ベースモデルが有能な各段階で一貫した利得が得られます。
関連論文リスト
- Prompting Diffusion Models for Zero-Shot Instance Segmentation [74.37083707535778]
本稿では拡散型セグメンテーションのための空間条件付きフレームワークPrompt2Segを提案する。
提案手法は2次元ガウスあるいは信頼マップとして表現された空間的プロンプトを明示的な入力信号として用い,ユーザ意図に直接応答するようにモデルを訓練する。
我々は,標準的なベンチマークから,絵画,エゴ中心ビュー,X線データなど,より困難な領域まで,7つのデータセットを評価した。
論文 参考訳(メタデータ) (2026-06-21T20:30:41Z) - Dual-Foundation Models for Unsupervised Domain Adaptation [2.279449016085348]
セグメンテーションモデルのトレーニングには、現実世界のデータセットにコストがかかる、労働集約的なアノテーションが必要です。
Unsupervised Domain Adaptation (UDA)は、ラベル付き合成データ上でモデルをトレーニングし、ラベルなしの実画像に適用することによって、この問題に対処する。
本稿では,2つの相補的基礎モデルを利用する二重境界 UDA フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-05T04:52:08Z) - Reasoning-Guided Grounding: Elevating Video Anomaly Detection through Multimodal Large Language Models [2.8529525624646492]
ビデオ異常検出(VAD)は、伝統的にバイナリ分類または外れ値検出としてフレーム化されてきた。
本稿では,異常分類,空間的接地,思考の連鎖的推論を統一するフレームワークであるVANGUARDを提案する。
UCF-Crimeでは、VANGUARDは94%のROC-AUCを84%のF1で達成し、同時に解釈可能な連鎖説明と異常物体の空間的接地を生成する。
論文 参考訳(メタデータ) (2026-04-07T20:15:15Z) - SubspaceAD: Training-Free Few-Shot Anomaly Detection via Subspace Modeling [6.476948781728136]
SubspaceADは、産業画像の視覚異常を検出するトレーニング不要の方法である。
トレーニング、即時チューニング、メモリバンクなしでワンショット、数ショットの設定で動作します。
MVTec-ADデータセットで98.0%、97.6%、VisAデータセットで93.3%、98.3%の画像レベルとピクセルレベルのAUROCを実現している。
論文 参考訳(メタデータ) (2026-02-26T13:52:57Z) - Tuning Vision Foundation Model via Test-Time Prompt-Guided Training for VFSS Segmentations [1.8142185304787555]
本稿では,全アノテーションを必要とせず,下流データセット上での基礎モデルの性能を向上させる新しいテストタイムトレーニングパラダイムを提案する。
具体的には、テスト時間半自己指導型トレーニングタスクを誘導するために、簡単なポイントプロンプトを用いる。
このアプローチは、アノテーションの取得が時間集約的かつ高価である医療画像分野の課題に、直接取り組む。
論文 参考訳(メタデータ) (2025-01-30T16:48:02Z) - Better Call SAL: Towards Learning to Segment Anything in Lidar [63.9984147657437]
本稿では,Lidar内の任意のオブジェクトをセグメント化,分類するためのテキストプロンプト可能なゼロショットモデルを提案する。
擬似ラベルを用いて2次元視覚基盤モデルを用いて3次元の3次元監督を無償で生成する。
我々のモデルは、クラスに依存しない点では91%、ゼロショットのLidar Panopticonでは54%である。
論文 参考訳(メタデータ) (2024-03-19T19:58:54Z) - Rethinking Range View Representation for LiDAR Segmentation [66.73116059734788]
「多対一」マッピング、意味的不整合、形状変形は、射程射影からの効果的な学習に対する障害となる可能性がある。
RangeFormerは、ネットワークアーキテクチャ、データ拡張、後処理を含む新しい設計を含む、フルサイクルのフレームワークである。
比較対象のLiDARセマンティックスとパノプティックスセグメンテーションのベンチマークにおいて,初めてレンジビュー法が点,ボクセル,マルチビューフュージョンを越えられることを示す。
論文 参考訳(メタデータ) (2023-03-09T16:13:27Z) - Contrastive Neighborhood Alignment [81.65103777329874]
本稿では,学習特徴のトポロジを維持するための多様体学習手法であるContrastive Neighborhood Alignment(CNA)を提案する。
対象モデルは、対照的な損失を用いて、ソース表現空間の局所構造を模倣することを目的としている。
CNAは3つのシナリオで説明される: 多様体学習、モデルが元のデータの局所的なトポロジーを次元還元された空間で維持する、モデル蒸留、小さな学生モデルがより大きな教師を模倣するために訓練される、レガシーモデル更新、より強力なモデルに置き換えられる、という3つのシナリオである。
論文 参考訳(メタデータ) (2022-01-06T04:58:31Z) - Unsupervised Part Discovery from Contrastive Reconstruction [90.88501867321573]
自己監督型視覚表現学習の目標は、強く伝達可能な画像表現を学習することである。
対象部分の発見とセグメンテーションに対する教師なしアプローチを提案する。
本手法は, 細粒度, 視覚的に異なるカテゴリ間でセマンティックな部分を生成する。
論文 参考訳(メタデータ) (2021-11-11T17:59:42Z) - Global-Local Bidirectional Reasoning for Unsupervised Representation
Learning of 3D Point Clouds [109.0016923028653]
局所構造とグローバル形状の双方向推論による点雲表現を人間の監督なしに学習する。
本研究では, 実世界の3次元オブジェクト分類データセットにおいて, 教師なしモデルが最先端の教師付き手法を超越していることを示す。
論文 参考訳(メタデータ) (2020-03-29T08:26:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。