論文の概要: Uncertainty-Aware Cross-Modal Remote Sensing Image-Text Retrieval via Evidential Learning
- arxiv url: http://arxiv.org/abs/2607.06032v1
- Date: Tue, 07 Jul 2026 09:10:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.463909
- Title: Uncertainty-Aware Cross-Modal Remote Sensing Image-Text Retrieval via Evidential Learning
- Title(参考訳): 証拠学習による不確実性を考慮した相互モードリモートセンシング画像検索
- Abstract要約: 本研究では,不確実性認識検索のための明らかな学習ベースCMRSITR (ELC) 手法を提案する。
ELCは最先端のCMRSITR法と比較して競争力のある検索性能を実現する。
- 参考スコア(独自算出の注目度): 12.567282411103257
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: In cross-modal remote sensing image-text retrieval (CMRSITR), test-time remote sensing (RS) images and textual descriptions may deviate from well-curated benchmark conditions due to sensor- and atmosphere-related image degradations and text-side RS-vocabulary heterogeneity. Under such non-ideal conditions, existing CMRSITR methods may produce unreliable retrieval results because they perform retrieval with full certainty for each query and do not distinguish the varying uncertainty across queries. To address this issue, we propose an evidential learning-based CMRSITR (ELC) method for uncertainty-aware retrieval. During the training phase of ELC, evidential learning (EDL) is employed to model the inter-modal correspondences between RS images and textual descriptions as Dirichlet distributions, from which the uncertainty of each query can be obtained. Based on the EDL outputs, uncertainty-correctness alignment learning (UCL) is introduced to align the estimated uncertainty with retrieval correctness, encouraging high uncertainty for incorrect retrieval and low uncertainty for correct retrieval. Furthermore, intra-modal relationship learning (RL) distills the intra-modal similarity structure from pretrained mentor encoders for the trainable encoders, thereby making the Dirichlet distributions modeled by EDL more discriminative. In the test phase of ELC, the estimated uncertainty is compared with a threshold determined by a fixed deferral ratio, where low-uncertainty queries are directly returned and high-uncertainty queries are refined by RS-aware test-time augmentation (RS-TTA). Experimental results demonstrate that ELC achieves competitive retrieval performance compared with state-of-the-art CMRSITR methods and provides stronger robustness under the evaluated RS-specific degradations, including sensor- and atmosphere-related image perturbations and RS-vocabulary heterogeneity.
- Abstract(参考訳): クロスモーダルリモートセンシング画像検索(CMRSITR)において、テスト時リモートセンシング(RS)画像とテキスト記述は、センサや大気に関連する画像の劣化やテキスト側のRS語彙の不均一性によって、よく計算されたベンチマーク条件から逸脱する可能性がある。
このような非理想的条件下では、既存のCMRSITR法はクエリ毎に完全確実性のある検索を行い、クエリ間の不確実性を区別しないため、信頼性の低い検索結果を生成することができる。
この問題に対処するために,不確実性認識検索のための明らかな学習ベースCMRSITR (ELC) 手法を提案する。
ELCのトレーニング段階では、明細学習(EDL)を用いて、RS画像とテキスト記述間のモーダル対応をディリクレ分布としてモデル化し、各クエリの不確実性を得ることができる。
EDL出力に基づいて,不確実性アライメント学習(UCL)を導入し,推定不確かさを検索精度と整合させ,不正検索に対する不確実性を高め,正しい検索に対する不確実性を低減する。
さらに、モーダル内関係学習(RL)は、トレーニング可能なエンコーダのための事前訓練されたメンターエンコーダからモーダル内類似構造を蒸留し、EDLによりモデル化されたディリクレ分布をより識別的にする。
ELCの試験段階において、推定不確実性は、不確実性クエリを直接返却し、高不確実性クエリをRS-aware test-time augmentation (RS-TTA)により洗練する固定deferral ratioによって決定されるしきい値と比較される。
実験の結果,ECCは最先端のCMRSITR法と比較して競争力のある検索性能を実現し,センサや大気関連画像の摂動やRS語彙の不均一性など,RS固有の劣化に対して強い強靭性を提供することがわかった。
関連論文リスト
- Decoding Error-Related Potentials under Multisensory Feedback with Varying Congruency [49.89366594261373]
現実的な設定では、不均一な多感覚フィードバックの下でエラー知覚がしばしば発生する。
特に、矛盾したフィードバックは、復号化の難しさと分類性能の低下に関連している。
我々は多分岐EEGNetベースのアーキテクチャを採用し、異種条件間の堅牢性を改善するために補助的な監視を行う。
論文 参考訳(メタデータ) (2026-07-08T09:13:14Z) - Cross-Resolution Semantic Transfer for Robust Text-to-Image Retrieval in Low-Resolution Surveillance [62.560024755525546]
Cross-Resolution Semantic Transfer (CRST)はCLIPスタイルの3つのモジュールを持つフレームワークである。
実験により、CRSTは高解像度の精度を犠牲にすることなく混合分解能検索を安定化させながら、平均5.7%と5.3%で超低解像度のランク1とmAPを改善することが示された。
論文 参考訳(メタデータ) (2026-06-29T15:24:03Z) - Robust Uncertainty Estimation under Distribution Shift via Difference Reconstruction [2.920726125254978]
深層学習モデルの不確実性を推定することは、医用画像などの高精細な応用において、信頼性の高い意思決定に不可欠である。
以前の研究では、入力サンプルと再構成されたバージョンの違いが不確実性の指標となることが確認されている。
本研究では、2つの中間層からの入力を再構成し、その出力間の差を不確かさスコアとして測定することにより、この制限を緩和する差分再構成不確実性推定法(DRUE)を提案する。
論文 参考訳(メタデータ) (2026-01-27T08:23:00Z) - Heterogeneous Uncertainty-Guided Composed Image Retrieval with Fine-Grained Probabilistic Learning [49.28548464288051]
Composed Image Retrieval (CIR)は、参照画像と修正テキストを組み合わせることで、画像検索を可能にする。
CIR三重項の内在ノイズは内在的不確実性を引き起こし、モデルの堅牢性を脅かす。
本稿では,これらの制約を克服するための不確実性誘導(HUG)パラダイムを提案する。
論文 参考訳(メタデータ) (2026-01-16T16:05:49Z) - Similarity-Distance-Magnitude Universal Verification [0.0]
本研究では,不確実性を考慮した検証と解釈可能性を考慮したSDMネットワークを本質的特性として構築する。
これらの結果を実装したオープンソースソフトウェアを提供する。
論文 参考訳(メタデータ) (2025-02-27T15:05:00Z) - ICF-SRSR: Invertible scale-Conditional Function for Self-Supervised
Real-world Single Image Super-Resolution [60.90817228730133]
単一画像超解像(SISR)は、与えられた低解像度(LR)画像を高解像度(HR)にアップサンプリングすることを目的とした課題である。
近年のアプローチは、単純化されたダウンサンプリング演算子によって劣化したシミュレーションLR画像に基づいて訓練されている。
Invertible Scale-Conditional Function (ICF) を提案する。これは入力画像をスケールし、異なるスケール条件で元の入力を復元する。
論文 参考訳(メタデータ) (2023-07-24T12:42:45Z) - Uncertainty-Aware Source-Free Adaptive Image Super-Resolution with Wavelet Augmentation Transformer [60.31021888394358]
Unsupervised Domain Adaptation (UDA)は、現実世界の超解像(SR)における領域ギャップ問題に効果的に対処できる
本稿では,画像SR(SODA-SR)のためのSOurce-free Domain Adaptationフレームワークを提案する。
論文 参考訳(メタデータ) (2023-03-31T03:14:44Z) - Blind Super-Resolution for Remote Sensing Images via Conditional
Stochastic Normalizing Flows [14.882417028542855]
本稿では、上記の問題に対処するために、正規化フロー(BlindSRSNF)に基づく新しいブラインドSRフレームワークを提案する。
BlindSRSNFは、低解像度(LR)画像が与えられた高解像度画像空間上の条件確率分布を、確率の変動境界を明示的に最適化することによって学習する。
提案アルゴリズムは,シミュレーションLRと実世界RSIの両方において,視覚的品質の優れたSR結果が得られることを示す。
論文 参考訳(メタデータ) (2022-10-14T12:37:32Z) - Model-based Deep Learning Receiver Design for Rate-Splitting Multiple
Access [65.21117658030235]
本研究では,モデルベース深層学習(MBDL)に基づく実用的なRSMA受信機の設計を提案する。
MBDL受信機は、符号なしシンボル誤り率(SER)、リンクレベルシミュレーション(LLS)によるスループット性能、平均トレーニングオーバーヘッドの観点から評価される。
その結果,MBDLはCSIRが不完全なSIC受信機よりも優れていた。
論文 参考訳(メタデータ) (2022-05-02T12:23:55Z) - Robustness via Uncertainty-aware Cycle Consistency [44.34422859532988]
非ペア画像-画像間の変換とは、対応する画像対を使わずに画像間マッピングを学習することを指す。
既存の手法は、外乱や予測の不確実性にロバスト性を明示的にモデル化することなく決定論的マッピングを学習する。
不確実性を考慮した一般化適応サイクル一貫性(UGAC)に基づく新しい確率的手法を提案する。
論文 参考訳(メタデータ) (2021-10-24T15:33:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。