論文の概要: GeoCore-9B: Towards Geo-Aware Generative Foundation Models in Earth Observation
- arxiv url: http://arxiv.org/abs/2608.01896v1
- Date: Mon, 03 Aug 2026 08:35:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.410815
- Title: GeoCore-9B: Towards Geo-Aware Generative Foundation Models in Earth Observation
- Title(参考訳): GeoCore-9B:地球観測におけるジオ・アウェア・ジェネレーティブ・ファンデーションモデルを目指して
- Authors: Jeonghyeok Do, Munchurl Kim,
- Abstract要約: 既存の地球観測のための生成モデルは、主に微調整された自然画像に頼っている。
GeoCore-9Bは、EOデータのみに基づいてスクラッチからトレーニングされた最初のスケールである。
視覚的忠実度と地理的構造的精度の両方において、新しい最先端性能を確立する。
- 参考スコア(独自算出の注目度): 31.388846490896924
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Existing generative models for earth observation (EO) predominantly rely on fine-tuning natural image priors, which limits their scalability and introduces perspective biases that conflict with geospatial constraints. To address this, we introduce GeoCore-9B, a 9-billion-parameter generative foundation model, which is the first of its scale to be trained from scratch exclusively on EO data. Unlike previous EO foundation models, GeoCore-9B is built upon a Flow Matching-based Diffusion Transformer (DiT) and natively conditions generation on text descriptions and continuous geospatial metadata, including ground sample distances, latitudes, and longitudes. To overcome the convergence and spatial disorientation challenges of training at this scale, we propose a Geospatial Semantic Alignment loss. This objective distills structural Earth surface priors (e.g., terrain and urban areas) from a frozen specialist teacher network, constraining the diffusion latent trajectory during training without adding inference overhead. Pre-trained on the global-scale Git-10M dataset, GeoCore-9B demonstrates strong downstream versatility. Beyond standard proxy generative tasks, we show that GeoCore-9B can be effectively adapted for practical EO applications, including highly challenging tasks such as cloud removal and SAR-to-optical cross-modal translation. Extensive evaluations confirm that GeoCore-9B establishes new state-of-the-art performance in both visual fidelity and geographic structural accuracy.
- Abstract(参考訳): 既存の地球観測のための生成モデル(EO)は、そのスケーラビリティを制限し、地理空間的制約と矛盾する視点バイアスを導入する、微調整された自然画像の先行に大きく依存している。
この問題を解決するために,9ビリオンパラメータ生成基盤モデルであるGeoCore-9Bを紹介した。
従来のEOファンデーションモデルとは異なり、GeoCore-9BはFlow MatchingベースのDiffusion Transformer (DiT)上に構築されており、テキスト記述と地上サンプル距離、緯度、経度などの連続的な地理空間メタデータに基づいてネイティブな条件を生成する。
このスケールでのトレーニングの収束と空間的不整合を克服するために,地理空間的意味的アライメント損失を提案する。
この目的は、凍結した専門教師ネットワークから構造的地球表面の先行(例えば、地形や都市部)を抽出し、推論オーバーヘッドを加えることなく、トレーニング中に拡散遅延軌道を制約する。
グローバルスケールのGit-10Mデータセットで事前トレーニングされたGeoCore-9Bは、強力なダウンストリームの汎用性を示している。
標準的なプロキシ生成タスク以外にも,クラウド除去やSAR-to-光相互変換といった極めて困難なタスクを含む,実用的なEOアプリケーションにもGeoCore-9Bが効果的に適用可能であることを示す。
大規模な評価により、GeoCore-9Bは、視覚的忠実度と地理的構造的精度の両方において、新しい最先端性能を確立することが確認された。
関連論文リスト
- TerraDiT-$Ω$: Unified Spatial Control for Satellite Image Synthesis with Any Geospatial Primitive [19.699267665705715]
TerraDiT-$は、任意のネイティブプリミティブから直接衛星画像を生成する統合空間制御フレームワークである。
生成モデルは驚くべき進歩を遂げているが、衛星画像に適用することは依然として困難である。
論文 参考訳(メタデータ) (2026-06-30T01:56:41Z) - Learning to Wander: Improving the Global Image Geolocation Ability of LMMs via Actionable Reasoning [72.13218601075958]
textbfWanderBenchは,具体的シナリオにおける行動可能な位置情報推論のための,最初のオープンアクセスグローバルジオロケーションベンチマークである。
我々は,下線Action of UnderlineThoughを用いた下線Geolocationフレームワークである textbfGeoAoT (Action of Thought) を提案する。
19個の大規模マルチモーダルモデルによる実験により、GeoAoTは動的環境におけるより優れた微細な局所化とより強力な一般化を実現することが示された。
論文 参考訳(メタデータ) (2026-03-11T06:24:10Z) - GeoAgent: Learning to Geolocate Everywhere with Reinforced Geographic Characteristics [91.17301794848025]
本稿では,人間と密に推論し,詳細なアドレス結論を導出できるGeoAgentについて述べる。
従来のRLベースの手法は、パフォーマンスと解釈可能性においてブレークスルーを達成したが、AI生成のチェーン・オブ・プリート(CoT)データとトレーニング戦略に依存しているため、依然として懸念が残っている。
論文 参考訳(メタデータ) (2026-02-13T04:48:05Z) - GeoZero: Incentivizing Reasoning from Scratch on Geospatial Scenes [84.52881742231152]
マルチモーダル大規模言語モデル (MLLM) は地理空間的シーン理解の進展において急速な発展を遂げている。
近年、リモートセンシングMLLMの推論能力の向上が試みられ、典型的には、精巧にキュレートされたチェーン・オブ・シント(CoT)データによるコールドスタートトレーニングによって実現されている。
MLLMが事前に定義されたCoTの監督なしに地理空間推論を行うことを可能にするフレームワークであるGeoZeroを提案する。
論文 参考訳(メタデータ) (2025-11-27T17:28:09Z) - Geo-R1: Unlocking VLM Geospatial Reasoning with Cross-View Reinforcement Learning [26.869573782008217]
視覚言語モデルにおける地理空間的推論を解き放つ推論中心のポストトレーニングフレームワークであるGeo-R1を紹介する。
足場形成の段階では、Geo-R1は、シンセサイザーチェーン・オブ・シンセサイザー(synthetic chain-of-thinkt exemplars)の教師付き微調整を通じて、地理空間的思考パラダイムを注入する。
昇降段階では、弱い教師付きクロスビューペアリングプロキシ上でGRPOベースの強化学習を使用する。
論文 参考訳(メタデータ) (2025-09-29T21:34:55Z) - Scalable Geospatial Data Generation Using AlphaEarth Foundations Model [0.1775251182905249]
我々は,Google DeepMindのAlphaEarth Foundations(AEF)を活用して地理空間ラベル付きデータセットを初期地域を超えて拡張する手法を提案し,評価する。
ランダム・フォレストやロジスティック・レグレッションのような基本的なモデルでも、このタスクを達成できることが示されています。
本研究では,LANDFIRE の既存植生型 (EVT) データセットを米国からカナダへ2段階の粒度で拡張する事例について検討する。
論文 参考訳(メタデータ) (2025-08-15T17:09:48Z) - Geolocation with Real Human Gameplay Data: A Large-Scale Dataset and Human-Like Reasoning Framework [59.42946541163632]
3つの重要なコンポーネントを持つ包括的位置決めフレームワークを導入する。
大規模データセットGeoComp、新しい推論手法GeoCoT、評価指標GeoEval。
また,GeoCoTは解釈可能性を高めつつ,位置情報の精度を最大25%向上させることを示した。
論文 参考訳(メタデータ) (2025-02-19T14:21:25Z) - GeoNet: Benchmarking Unsupervised Adaptation across Geographies [71.23141626803287]
地理的ロバスト性の問題について検討し、3つの主要な貢献を行う。
まず,地理的適応のための大規模データセットGeoNetを紹介する。
第2に、シーンコンテキストにおける大きな変化から、ドメインシフトの主な原因が生じるという仮説を立てる。
第3に、最先端の教師なしドメイン適応アルゴリズムとアーキテクチャを広範囲に評価する。
論文 参考訳(メタデータ) (2023-03-27T17:59:34Z) - Towards Geospatial Foundation Models via Continual Pretraining [22.825065739563296]
資源コストと炭素の影響を最小限に抑えた高効率基礎モデルを構築するための新しいパラダイムを提案する。
まず、複数のソースからコンパクトだが多様なデータセットを構築し、GeoPileと呼ぶ特徴の多様性を促進する。
次に,大規模なImageNet-22kモデルからの継続事前学習の可能性について検討し,多目的連続事前学習パラダイムを提案する。
論文 参考訳(メタデータ) (2023-02-09T07:39:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。