論文の概要: Do Satellites See Commuters? A Critical Benchmark of Vision Foundation Models
- arxiv url: http://arxiv.org/abs/2609.00661v1
- Date: Tue, 01 Sep 2026 03:39:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.27212
- Title: Do Satellites See Commuters? A Critical Benchmark of Vision Foundation Models
- Title(参考訳): 衛星は通勤者を見るか? ビジョン基礎モデルの重要なベンチマーク
- Authors: Ashiq Shukoor Iqbal, Wilson Wongso, Flora D. Salim,
- Abstract要約: SatCLIP, AlphaEarthの4つの衛星ビジョンエンコーダについて検討し, 言語教師(RemoteCLIP), 自己教師(DINOv3), 地理的接地(SatCLIP, AlphaEarth)について検討した。
SatCLIP, AlphaEarthの4つの衛星ビジョンエンコーダ(RemoteCLIP)、自己教師(DINOv3)、地理的接地(SatCLIP, AlphaEarth)をアブレーションする。
- 参考スコア(独自算出の注目度): 11.142354615369271
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Satellite foundation models offer a globally available alternative to census data for commuting origin-destination (OD) generation, yet no study has systematically compared encoder paradigms within a single downstream pipeline. We ablate four satellite vision encoders: language-supervised (RemoteCLIP), self-supervised (DINOv3), and geographically grounded (SatCLIP, AlphaEarth) within an identical WeDAN graph diffusion framework across 1,925 US counties, 325 UK districts, and 14 global cities under five random seeds. Three main findings emerge. First, language-supervised features achieve the strongest in-distribution performance (RemoteCLIP CPC 0.602), while geographically grounded encoders transfer more reliably zero-shot: AlphaEarth improves CPC by 33% over RemoteCLIP on UK districts. Second, pretraining corpus scale alone is insufficient: DINOv3, trained on a substantially larger satellite corpus, underperforms RemoteCLIP by 0.091 CPC in-distribution and collapses to CPC 0.022 globally. Third, no encoder transfers usefully to global cities (best CPC 0.122 for RemoteCLIP, 0.022 for DINOv3), confirming cross-continental OD generation remains an open problem. We additionally clarify the semantics of the census noise parameter $η$, whose ordering reverses under cross-continental evaluation, a distinction critical to correctly interpreting prior results. Training scripts and evaluation logs will be released.
- Abstract(参考訳): 衛星基盤モデルでは,送信元決定(OD)生成のための国勢調査データに代わるグローバルな代替手段を提供するが,単一の下流パイプライン内のエンコーダパラダイムを体系的に比較する研究は行われていない。
我々は,1,925の郡,325の英国地区,14のグローバル都市にまたがる同一のWeDANグラフ拡散フレームワーク内に,言語監督(RemoteCLIP),自己監督(DINOv3),地理的接地(SatCLIP,AlphaEarth)の4つの衛星ビジョンエンコーダを5つのランダムシードで比較した。
主な発見は3つある。
第一に、言語を教師する機能は、最強の分散性能(RemoteCLIP CPC 0.602)を達成する一方、地理的に接地されたエンコーダは、より確実にゼロショットを転送する: AlphaEarthは、イギリス地区のRemoteCLIPよりも33%改善する。
DINOv3は、かなり大きな衛星コーパスで訓練され、RemoteCLIPを0.091 CPCで分散させ、世界中のCPC 0.022に崩壊させる。
第3に、グローバルな都市(RemoteCLIPはCPC0.122、DINOv3は0.022)へのエンコーダの転送は役に立たない。
また, 先行結果の正しい解釈に欠かせない, 大陸横断評価の下で順序が逆転するセンサスノイズパラメータ$η$のセマンティクスも明らかにした。
トレーニングスクリプトと評価ログがリリースされる。
関連論文リスト
- Architecture-Dependent Causal Transfer of Activation States Across Large Language Models [51.56484100374058]
内部言語アクティベーション状態は、異なる大きな言語モデル間で因果的に転送することができる。
生成中に投影された活性化をターゲットモデルに注入すると、統計的に有意で事前登録された因果効果が生じる。
現在実装されているLCM間のエンド・ツー・エンドのアクティベーション・ステート・トランスファーは、ユニバーサルではなくアーキテクチャに依存していると結論付けている。
論文 参考訳(メタデータ) (2026-08-17T09:53:27Z) - Air Quality Downscaling with Station-Guided Pseudo-Supervision [60.31045749983062]
局所PM$_2.5$変動に対する高分解性粗大大気場は空間的支持のミスマッチによって一意に挑戦される。
ヨーロッパにおける高分解能PM$_2.5$ダウンスケールのためのステーション誘導フレームワークを提案する。
論文 参考訳(メタデータ) (2026-07-06T16:32:25Z) - Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders [123.58723804218151]
ビジョンファウンデーションモデルは、自己注意の二次的なコストによってボトルネックとなる。
2次元空間伝搬伝搬に基づくC-GSPNを提案する。
論文 参考訳(メタデータ) (2026-05-30T14:29:43Z) - A Modelling and Evaluation Framework for EuroCrops-Driven Sentinel-2 Crop Segmentation [78.66324246922831]
本研究では,Sentinel-2イメージとEuroCropsパーセルレベルのアノテーションからセマンティックセグメンテーション対応農業データセットを生成するパイプラインを提案する。
このデータセットには、ヨーロッパ5カ国から67,337のパッチが含まれており、10種類の作物と背景の分類を減らしている。
The four-level U-Net with Group Normalization were training using 10 Sentinel-2 spectrum bands and a Composite loss with class-weighted cross-entropy and Dice loss。
論文 参考訳(メタデータ) (2026-05-30T11:20:29Z) - Zero-Shot Satellite Image Retrieval through Joint Embeddings: Application to Crisis Response [0.6614755043607777]
GeoQueryはゼロショット検索システムで、2段階のセマンティック検索とビジュアル検索によってデータと制約をサイドステップで計算する。
イギリスの洪水、アメリカの山火事、米国の干ばつを含む76の災害対応クエリに対して、GeoQueryは50,km以内で31.6%の精度を達成した。
論文 参考訳(メタデータ) (2026-05-06T19:43:44Z) - SCC-Loc: A Unified Semantic Cascade Consensus Framework for UAV Thermal Geo-Localization [6.618475712125794]
クロスモーダル・サーマルジオローカライゼーション (TG) は、グローバルナビゲーション衛星システム (GNSS) による無人航空機 (UAV) の堅牢で全天候のソリューションを提供する。
このボトルネックを解消するために,セマンティック・カスケード・コンセンサス・ローカライゼーション・フレームワークであるSCC-Locを提案する。
実験により、SCC-Locは新しい最先端技術を確立し、平均局所化誤差を9.37mに抑え、精度を7.6倍に改善した。
論文 参考訳(メタデータ) (2026-04-03T15:44:47Z) - Landsat30-AU: A Vision-Language Dataset for Australian Landsat Imagery [16.921090589233064]
Landsat30-AU(ランドサット30-AU)は、オーストラリア上空の4つのランドサット衛星によって収集された30メートルの解像度画像から構築された視覚言語データセットである。
データセットには2つのコンポーネントが含まれている: Landsat30-AU-Cap、イメージキャプチャペア196,262ドル、Landsat30-AU-VQA。
論文 参考訳(メタデータ) (2025-08-05T06:16:46Z) - Multi-Base Station Cooperative Sensing with AI-Aided Tracking [10.400855135405251]
核融合センター(FC)を介して協調する複数の基地局(BS)からなる共同センシング・通信ネットワークについて検討する。
筆者らのフレームワークは,60cm未満の最適サブパターン割り当て(OSPA)を実現することで,優れたセンシング性能を提供できることを示す。
論文 参考訳(メタデータ) (2023-10-31T12:27:48Z) - Learning Emergent Random Access Protocol for LEO Satellite Networks [51.575090080749554]
創発的ランダムアクセスチャネルプロトコル(eRACH)と呼ばれるLEO SATネットワークのための新しい許可なしランダムアクセスソリューションを提案する。
eRACHは、非定常ネットワーク環境との相互作用によって生じるモデルフリーなアプローチである。
RACHと比較して,提案するeRACHは平均ネットワークスループットが54.6%向上することを示す。
論文 参考訳(メタデータ) (2021-12-03T07:44:45Z) - Generalized Focal Loss: Learning Qualified and Distributed Bounding
Boxes for Dense Object Detection [85.53263670166304]
一段検出器は基本的に、物体検出を密度の高い分類と位置化として定式化する。
1段検出器の最近の傾向は、局所化の質を推定するために個別の予測分岐を導入することである。
本稿では, 上記の3つの基本要素, 品質推定, 分類, ローカライゼーションについて述べる。
論文 参考訳(メタデータ) (2020-06-08T07:24:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。