論文の概要: Locally Consistent Transductive Information Maximization for Few-Shot Remote Sensing Scene Classification
- arxiv url: http://arxiv.org/abs/2607.29192v1
- Date: Fri, 31 Jul 2026 09:13:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 14:29:40.672163
- Title: Locally Consistent Transductive Information Maximization for Few-Shot Remote Sensing Scene Classification
- Title(参考訳): Few-Shotリモートセンシングシーン分類のための局所一貫性のあるトランスダクティブ情報最大化
- Abstract要約: LC-TIM (Locally Consistent Transductive Information Maximization) を導入し、Few-Shot CLIP (TIM++) の目的に対して最先端のTransductive Information Maximization を拡張する。
10種類のデータセットでLP++, TransCLIP, TIM++, LC-TIMを評価し, トランスダクティブなRSシーン分類のための,初の包括的オープンソースベンチマークを構築した。
- 参考スコア(独自算出の注目度): 16.6874114675683
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Remote sensing scene classification is increasingly relying on foundation models pre-trained on large-scale Earth-observation data. Moreover, transductive inference, which exploits the collective statistical structure of the entire unlabeled query set, appears to naturally match remote sensing pipelines where large images are routinely split into patches and inferred as a batch. In this work, we introduce LC-TIM (Locally Consistent Transductive Information Maximization), which extends the state-of-the-art Transductive Information Maximization for Few-Shot CLIP (TIM++) objective with a local consistency regularizer that enforces prediction agreement between each query sample and its $κ$ nearest feature-space neighbors. The regularizer enters as a single multiplicative factor in the closed-form $q$-update, adding negligible computational overhead. We further propose a multi-source extension that fuses the affinity graph from multiple remote sensing foundation model, further boosting classification accuracy. To assess these methods, we establish the first comprehensive, open-source benchmark for transductive few-shot RS scene classification, evaluating LP++, TransCLIP, TIM++, and LC-TIM across ten diverse datasets, two remote sensing vision-language models, and across various few-shot settings. Our experiments show that transductive methods consistently outperform zero-shot baselines, and that LC-TIM achieves state-of-the-art accuracy, with the largest gains in the low-shot regime where neighborhood cues are most informative. Code is publicly available at: https://github.com/elkhouryk/LC-TIM
- Abstract(参考訳): リモートセンシングシーンの分類は、大規模な地球観測データに基づいて事前訓練された基礎モデルに依存している。
さらに、ラベルのないクエリセット全体の集合統計構造を利用するトランスダクティブ推論は、大きなイメージが定期的にパッチに分割され、バッチとして推測されるリモートセンシングパイプラインと自然に一致しているように見える。
本稿では,Few-Shot CLIP (TIM++) の目的に対して,各クエリサンプルとその近距離特徴空間間の予測合意を強制する局所整合正則化を用いて,最先端のトランスダクティブ情報最大化を拡張したLC-TIM(Locally Consistent Transductive Information Maximization)を導入する。
正規化器は閉形式$q$-updateの1つの乗法因子として入力され、無視可能な計算オーバーヘッドを追加する。
さらに、複数のリモートセンシング基盤モデルから親和性グラフを融合させ、さらに分類精度を高めるマルチソース拡張を提案する。
これらの手法を評価するため、我々は、LP++、TransCLIP、TIM++、LC-TIMを10の多様なデータセット、リモートセンシングビジョン言語モデル、2つのリモートセンシングモデル、および様々な複数ショット設定で評価し、トランスダクティブな数ショットシーン分類のための最初の包括的なオープンソースベンチマークを構築した。
実験の結果, トランスダクティブ法はゼロショットベースラインを常に上回り, LC-TIMは最先端の精度を達成し, 近隣の手がかりが最も有益である低ショット政権において最大の利益をもたらすことがわかった。
コードは、https://github.com/elkhouryk/LC-TIMで公開されている。
関連論文リスト
- FUSED: Forensic-Semantic Mixture-of-Experts for AI Inpainting Detection and Localization [14.056602265859645]
拡散ベースの塗装モデルは、画像の局所的な部分だけを変更する。
多くのAIイメージ検出器は、グローバルアーティファクトに依存し、ローカライズしない。
FUSEDは,AIによるインペイントの同時検出と局所化のための統合フレームワークである。
論文 参考訳(メタデータ) (2026-08-28T13:05:43Z) - NARRAS: Edge-Triggered Distributed Inference for CSI-Based Localization in Vehicular IoT Networks [52.237935683898144]
車両用IoTネットワークにおけるCSIベースのローカライゼーションのためのETDIをインスタンス化する。
NARRASは、各RAAが最新の観測結果の要約と送信した最後の潜伏状態の記憶を結合した分散レポートポリシーである。
論文 参考訳(メタデータ) (2026-06-10T10:47:44Z) - RACANet: Reliability-Aware Crowd Anchor Network for RGB-T Crowd Counting [15.536708520170095]
RGB-Thermal (T) の群集カウントは、複雑な場面における群集密度推定の堅牢性を改善するために可視スペクトルと熱赤外情報を統合することを目的としている。
本稿では,RGB-Tクラウドカウントのための2段階融合フレームワークRACANetを提案する。
広く使用されている2つのベンチマークデータセット、RGBT-CCとDrone-RGBTで実施された実験は、RACANetが既存の手法より優れていることを示した。
論文 参考訳(メタデータ) (2026-04-27T14:38:49Z) - VFM-Loc: Zero-Shot Cross-View Geo-Localization via Aligning Discriminative Visual Hierarchies [5.868908918033978]
リモートセンシングにおけるCross-View Geo-Localization (CVGL) は、ジオタグ付き衛星画像とマッチングすることで、ドローンビュークエリを見つけることを目的としている。
視覚基礎モデル(VFM)から一般化可能な視覚表現を利用するゼロショットCVGLのためのトレーニングフリーフレームワークであるVFM-Locを提案する。
実験により、VFM-Locは標準ベンチマークで強いゼロショット精度を示し、大きな斜角角を持つ挑戦的なLO-UCVデータセット上で、Recall@1で教師付きメソッドを20%以上超えることが示されている。
論文 参考訳(メタデータ) (2026-03-14T09:23:59Z) - Toward Stable Semi-Supervised Remote Sensing Segmentation via Co-Guidance and Co-Fusion [31.189038928192648]
Co2Sは半教師付きRSセグメンテーションフレームワークで、ビジョン言語モデルと自己教師型モデルとを融合する。
テキスト埋め込みと学習可能なクエリを利用した,明示的でシンプルなセマンティックコガイダンス機構が導入された。
6つの一般的なデータセットに対する実験は,提案手法の優位性を実証している。
論文 参考訳(メタデータ) (2025-12-28T18:24:19Z) - Exploring Efficient Open-Vocabulary Segmentation in the Remote Sensing [55.291219073365546]
Open-Vocabulary Remote Sensing Image (OVRSIS)は、OVS(Open-Vocabulary)をリモートセンシング(RS)ドメインに適応させる新しいタスクである。
textbfRSKT-Segは、リモートセンシングに適した新しいオープン語彙セグメンテーションフレームワークである。
RSKT-Segは高いOVSベースラインを+3.8 mIoUと+5.9 mACCで上回り、効率的なアグリゲーションによって2倍高速な推論を実現している。
論文 参考訳(メタデータ) (2025-09-15T15:24:49Z) - PeFAD: A Parameter-Efficient Federated Framework for Time Series Anomaly Detection [51.20479454379662]
私たちはaを提案します。
フェデレートされた異常検出フレームワークであるPeFADは、プライバシーの懸念が高まっている。
我々は、4つの実際のデータセットに対して広範な評価を行い、PeFADは既存の最先端ベースラインを最大28.74%上回っている。
論文 参考訳(メタデータ) (2024-06-04T13:51:08Z) - Divide and Contrast: Source-free Domain Adaptation via Adaptive
Contrastive Learning [122.62311703151215]
Divide and Contrast (DaC) は、それぞれの制限を回避しつつ、両方の世界の善良な端を接続することを目的としている。
DaCは、ターゲットデータをソースライクなサンプルとターゲット固有なサンプルに分割する。
さらに、ソースライクなドメインと、メモリバンクベースの最大平均離散性(MMD)損失を用いて、ターゲット固有のサンプルとを整合させて、分散ミスマッチを低減する。
論文 参考訳(メタデータ) (2022-11-12T09:21:49Z) - MD-CSDNetwork: Multi-Domain Cross Stitched Network for Deepfake
Detection [80.83725644958633]
現在のディープフェイク生成法では、偽画像やビデオの周波数スペクトルに識別的アーティファクトが残されている。
MD-CSDNetwork(MD-CSDNetwork)と呼ばれる新しい手法を提案する。
論文 参考訳(メタデータ) (2021-09-15T14:11:53Z) - Mutual-Information Based Few-Shot Classification [34.95314059362982]
数ショット学習のためのTIM(Transductive Infomation Maximization)を提案する。
提案手法は,与えられた数発のタスクに対して,クエリ特徴とラベル予測との相互情報を最大化する。
そこで我々は,勾配に基づく最適化よりもトランスダクティブ推論を高速化する交代方向解法を提案する。
論文 参考訳(メタデータ) (2021-06-23T09:17:23Z) - Transductive Information Maximization For Few-Shot Learning [41.461586994394565]
数ショット学習のためのTIM(Transductive Infomation Maximization)を提案する。
提案手法は,与えられた数発のタスクに対して,クエリ特徴とラベル予測との相互情報を最大化する。
相互情報損失に対する新たな交互方向解法を提案する。
論文 参考訳(メタデータ) (2020-08-25T22:38:41Z) - Improving Generative Adversarial Networks with Local Coordinate Coding [150.24880482480455]
GAN(Generative Adversarial Network)は、事前定義された事前分布から現実的なデータを生成することに成功している。
実際には、意味情報はデータから学んだ潜在的な分布によって表現される。
ローカル座標符号化(LCC)を用いたLCCGANモデルを提案する。
論文 参考訳(メタデータ) (2020-07-28T09:17:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。