論文の概要: Finding Change in Satellite Archives from Text: How to Combine Before-and-After Images Efficiently
- arxiv url: http://arxiv.org/abs/2607.28571v1
- Date: Thu, 30 Jul 2026 17:35:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.699652
- Title: Finding Change in Satellite Archives from Text: How to Combine Before-and-After Images Efficiently
- Title(参考訳): テキストによる衛星アーカイブの変化の発見:画像の前後を効率よく組み合わせる方法
- Authors: Simon Roy, Mark Bong, Giovanni Beltrame,
- Abstract要約: オペレーションアース・オブザーバーは、新しい建物が現れたイメージペアを見つけるなどの質問に答えることをますます求めています。」
これは、前と後(両時間)の衛星画像ペアのアーカイブを検索し、それぞれのペアが変更の自然言語による記述とどのようにうまく一致しているかをランク付けすることを意味します。
このマッチを実行するコンポーネント、before'とafter'のビューを組み合わせたフュージョンモジュールは、多くの候補ペア間でクエリ時に実行されなければならない。
- 参考スコア(独自算出の注目度): 4.354803595506825
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Operational Earth observation increasingly calls for answering queries such as ``find the image pairs where a new building appeared.'' This means searching an archive of before-and-after (bi-temporal) satellite image pairs and ranking each pair by how well it matches a natural-language description of the change. The component that performs this match, the fusion module that combines the ``before'' and ``after'' views, must be run at query time across many candidate pairs, so its speed largely sets the cost of every search. We present a controlled comparison of how to build that module. Using one fixed image encoder (a frozen CLIP model) and one training recipe for all variants, we evaluate eight designs drawn from three families: attention, state-space models (Mamba), and learned compression (our Temporal Bottleneck Fusion, TBF). Each design is tested on two benchmarks (LEVIR-CC and Dubai-CC) with ten random seeds, so the reported differences are statistically grounded. We outline three findings: first, a training-free two-stage search (a cheap difference model that shortlists candidates, followed by attention fusion that re-ranks them) matches or exceeds full-fusion recall on LEVIR-CC while cutting query cost $10$-$15\times$, with comparable R@1/R@5 on Dubai-CC; second, the linear-time scan of Mamba, attractive on paper, gives no speed benefit at the patch counts typical of vision transformers ($L{=}196$): the scan is limited by memory bandwidth, whereas attention maps cleanly onto parallel hardware; and third, compressing the fused representation (TBF) reduces parameters by $2.3\times$ and latency by $1.6\times$ for a change-only BLEU-1 cost of $0.007$, although more aggressive compression quietly discards change-relevant detail that aggregate metrics fail to reveal.
- Abstract(参考訳): オペレーショナルアース(Operational Earth)の観察では,新たなビルが出現したイメージペアを '`find the image pairs' といったクエリへの応答がますます求められている。
「」とは、前・後(両時間)の衛星画像ペアのアーカイブを検索し、それぞれのペアが変化の自然言語的記述とどのようにうまく一致しているかをランク付けすることを意味する。
このマッチを実行するコンポーネントである‘before’と‘after’のビューを組み合わせたフュージョンモジュールは、多くの候補ペア間でクエリ時に実行されなければならない。
我々はそのモジュールの作り方について制御された比較を示す。
1つの固定画像エンコーダ(冷凍CLIPモデル)と1つのトレーニングレシピを用いて、注意、状態空間モデル(Mamba)、圧縮学習(Temporal Bottleneck Fusion, TBF)の3つのファミリーから抽出された8つのデザインを評価した。
それぞれの設計は、10個のランダムシードを持つ2つのベンチマーク(LEVIR-CCとDubai-CC)でテストされる。
トレーニングなしの2段階検索(候補をショートリスト化する安価な差分モデル、再ランクするアテンションフュージョン) LEVIR-CCでマッチまたはフルフュージョンリコールを越え、クエリコストを10ドル-$15\times$と同等のR@1/R@5で、Dubai-CCで同等のR@1/R@5で、第2に、Dubai-CCで魅力的なMambaのリニアタイムスキャンは、ビジョントランスフォーマーで典型的なパッチカウントにおいて、速度の利点を得られない(L{=}196$):スキャンはメモリ帯域幅で制限され、注意マップは並列ハードウェア上でクリーンに表示され、第3に、融合表現(TBF)を圧縮するとパラメータが2.3倍に削減され、レイテンシが16ドルになる。
関連論文リスト
- Concurrent Image Understanding and Generation: Self-Correcting Coupled Markov Jump Processes [70.61868608402723]
我々は$textbfSelf-Correcting Coupled Markov Jump Processes (SC-CMJP)を紹介する。
SC-CMJPと組み合わせて、共同マルチモーダルジェネレーションのための新しいトレーニングフリーシングルパスサンプリングであるtextttCO_texttt2textttJump$を紹介する。
トレーニングと評価のために,我々は3つの大規模ジョイントマルチモーダル生成コーパスを作成し,リリースする。
論文 参考訳(メタデータ) (2026-07-14T18:39:29Z) - GridProbe: Posterior-Probing for Adaptive Test-Time Compute in Long-Video VLMs [3.9266376632068485]
GridProbeは、効率的なトレーニング不要な後処理推論パラダイムである。
解答空間における証拠は、凍結したVLM自身の推論を用いて得られる。
疑似関連フレームを適応的に選択し、精度の損失が少なくて、準四分法的な注意コストをもたらす。
論文 参考訳(メタデータ) (2026-05-11T15:57:46Z) - Are Pretrained Image Matchers Good Enough for SAR-Optical Satellite Registration? [7.519268719195278]
クロスモーダル光SAR登録はリモートセンシングによる災害応答のボトルネックとなる。
現代の画像マーカは、ほとんど自然画像ドメインでベンチマークされる。
論文 参考訳(メタデータ) (2026-04-11T13:56:20Z) - TwinFormer: A Dual-Level Transformer for Long-Sequence Time-Series Forecasting [0.0]
TwinFormerは時系列予測のための階層型トランスフォーマーである。
入力を重複しない時間パッチに分割し、2段階に分けて処理する。
軽量GRUは、直接マルチ水平予測のために、グローバルにコンテキスト化されたパッチトークンを集約する。
論文 参考訳(メタデータ) (2025-12-13T11:50:18Z) - H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers [124.11648300910444]
Heerarchical Hourglass Tokenizer (H$_2$OT) と呼ばれる階層的なプラグアンドプレイプルーニング&ドル回復フレームワークを提案する。
提案手法は汎用的であり,Seq2seqおよびSeq2frameパイプラインの共通VPTモデルに容易に組み込むことができる。
論文 参考訳(メタデータ) (2025-09-08T17:59:59Z) - Test3R: Learning to Reconstruct 3D at Test Time [58.0912500917036]
Test3Rは驚くほどシンプルなテストタイム学習技術で、幾何学的精度を大幅に向上させる。
本手法は従来の3次元再構成法や多視点深度推定法よりも優れていた。
論文 参考訳(メタデータ) (2025-06-16T17:56:22Z) - $R^{2}$Former: Unified $R$etrieval and $R$eranking Transformer for Place
Recognition [92.56937383283397]
検索と再ランクの両方を扱う統合された場所認識フレームワークを提案する。
提案モジュールは特徴相関,注目値,xy座標を考慮に入れている。
R2$Formerは、主要なVPRデータセットの最先端メソッドを著しく上回る。
論文 参考訳(メタデータ) (2023-04-06T23:19:32Z) - Learning Tracking Representations via Dual-Branch Fully Transformer
Networks [82.21771581817937]
追従のためのトランスフォーマーのみをベースとした,シームズ型デュアルブランチネットワークを提案する。
注目ウィンドウ内の他のパッチとのマッチング結果に基づいて,各パッチの特徴ベクトルを抽出する。
この手法は、最高の性能の方法として、より良い結果または同等の結果を得る。
論文 参考訳(メタデータ) (2021-12-05T13:44:33Z) - Rethinking Dilated Convolution for Real-time Semantic Segmentation [0.0]
背骨全体に大きな拡張率を持つ拡張畳み込みを用いて異なるアプローチをとる。
我々のモデルであるRegSegは、リアルタイムのCityscapesとCamVidデータセットの競合的な結果を達成する。
論文 参考訳(メタデータ) (2021-11-18T22:08:21Z) - Thinking Fast and Slow: Efficient Text-to-Visual Retrieval with
Transformers [115.90778814368703]
目的は,大規模画像とビデオデータセットの言語検索である。
このタスクでは、独立してテキストとビジョンを共同埋め込み空間 a.k.a にマッピングする。
デュアルエンコーダは 検索スケールとして魅力的です
視覚テキスト変換器をクロスアテンションで使用する別のアプローチは、関節埋め込みよりも精度が大幅に向上する。
論文 参考訳(メタデータ) (2021-03-30T17:57:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。