論文の概要: TerraDiT-$Ω$: Unified Spatial Control for Satellite Image Synthesis with Any Geospatial Primitive
- arxiv url: http://arxiv.org/abs/2606.31029v1
- Date: Tue, 30 Jun 2026 01:56:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-01 18:27:19.038891
- Title: TerraDiT-$Ω$: Unified Spatial Control for Satellite Image Synthesis with Any Geospatial Primitive
- Title(参考訳): TerraDiT-$Ω$:地球空間プリミティブを用いた衛星画像合成のための統一空間制御
- Authors: Brian Wei, Srikumar Sastry, Daniel Cher, Eric Xing, Nathan Jacobs,
- Abstract要約: TerraDiT-$は、任意のネイティブプリミティブから直接衛星画像を生成する統合空間制御フレームワークである。
生成モデルは驚くべき進歩を遂げているが、衛星画像に適用することは依然として困難である。
- 参考スコア(独自算出の注目度): 19.699267665705715
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Generative models have achieved remarkable progress, yet applying them to satellite imagery remains challenging. Unlike natural imagery, satellite scenes are structured by spatially complex and semantically distinct geometries. Prior work addresses this complexity by adapting natural image frameworks using dense rasters or sparse prompts, trading off annotation cost and fidelity while breaking compatibility with vector primitives commonly used to represent geographic information. We introduce TerraDiT-$Ω$, a unified spatial control framework that generates satellite imagery directly from any native geospatial primitive. By jointly leveraging precise annotations (polygons, polylines) and coarser ones (bounding boxes, points), the model supports controllable layouts across varying annotation budgets, broadening applicability to design tasks such as urban planning while remaining naturally compatible with end-to-end GeoAI workflows. To effectively leverage these primitives during generation, we propose Geometry-Aware Local Attention, a conditioning mechanism that injects explicit geometric cues into the attention space. Across all conditioning formats, our approach consistently outperforms both dense-control and sparse-control baselines. Furthermore, this flexibility enables controllable synthetic data augmentation using a single generative model, improving downstream performance on land-cover segmentation, object detection, road graph extraction, and scene classification. Code, data, and weights are available at https://github.com/mvrl/TerraDiT.
- Abstract(参考訳): 生成モデルは驚くべき進歩を遂げているが、衛星画像に適用することは依然として困難である。
自然画像とは異なり、衛星のシーンは空間的に複雑で意味的に異なる地形によって構成されている。
それまでの作業では、密集したラスタやスパースプロンプトを使った自然なイメージフレームワークの適用、アノテーションのコストと忠実さのトレードオフ、地理的情報を表すのによく使われるベクトルプリミティブとの互換性の破れなど、この複雑さに対処していた。
地空間プリミティブから直接衛星画像を生成する統合空間制御フレームワークTerraDiT-$Ω$を紹介する。
正確なアノテーション(ポリゴン、ポリライン)と粗いアノテーション(バウンディングボックス、ポイント)を共同で活用することにより、モデルはさまざまなアノテーション予算にわたって制御可能なレイアウトをサポートし、都市計画のようなタスクへの適用範囲を広げながら、エンドツーエンドのGeoAIワークフローと自然に互換性を保つ。
生成時にこれらのプリミティブを効果的に活用するために,注意空間に明示的な幾何学的手がかりを注入する条件付け機構であるGeometry-Aware Local Attentionを提案する。
全ての条件付け形式において、我々の手法は密度制御とスパース制御の両方のベースラインを一貫して上回っている。
さらに、この柔軟性により、単一の生成モデルを用いて制御可能な合成データ拡張が可能となり、土地被覆セグメント化、オブジェクト検出、道路グラフ抽出、シーン分類における下流性能が向上する。
コード、データ、ウェイトはhttps://github.com/mvrl/TerraDiT.comで入手できる。
関連論文リスト
- Beyond 2D Matching: A Unified Single-Stage Framework for Geometry-Aware Cross-View Object Geo-Localization [21.013795754583697]
クロスビューオブジェクトジオローカライゼーション(CVOGL)は、ジオタグ付き参照画像(衛星など)内のクエリビューからターゲットオブジェクトを見つけることを目的としている。
既存のアプローチは2次元の外観マッチングに大きく依存しており、幾何学的メタデータを欠いた限られたデータセットによって制約されている。
まず、22万以上の地上衛星とドローンと衛星のペアからなる大規模で高忠実なビルディングデータセットであるデータセットを紹介します。
変分同変量3D基礎モデル$をベースとした新しい一段階幾何対応ジオローカライゼーションフレームワーク(GAGeo)を提案する。
論文 参考訳(メタデータ) (2026-06-29T17:19:49Z) - GeoMamba: A Geometry-driven MambaVision Framework and Dataset for Fine-grained Optical-SAR Object Retrieval [54.741349848771144]
GeoMambaは光学SAR微細検索のための幾何学駆動フレームワークである。
GFIモジュールは、クロスモーダルな機能相互作用を強化し、構造的な事前を組み込む。
GeoMambaは既存の手法を上回り、全検索環境で63.3% mAPと77.0% Rank-1の精度を達成した。
論文 参考訳(メタデータ) (2026-05-19T12:08:09Z) - GeoViSTA: Geospatial Vision-Tabular Transformer for Multimodal Environment Representation [24.186635502118552]
ジオビスタ(Geospatial Vision-Tabular Transformer,Geospatial Vision-Tabular Transformer,Geospatial Vision-Tabular Transformer,Geospatial Vision-Tabular Transformer,Geospatial Vision-Tabular Transformer,Geospatial Vision-Tabular Transformer)を提案する。
我々は、GeoViSTAを自己教師付き共同マスク自動符号化目標で訓練し、欠落した画像パッチの復元を強制する。
結果は、構造化社会経済コンテキストとともに、物理的環境を共同でモデル化することで、高度に伝達可能な表現が得られることを示した。
論文 参考訳(メタデータ) (2026-05-14T05:46:07Z) - GeoDiT: Point-Conditioned Diffusion Transformer for Satellite Image Synthesis [18.765684923247857]
我々は,テキストから衛星画像生成のための拡散変換器であるGeoDiTを紹介した。
実験により,GeoDiTは最先端のリモートセンシング生成モデルを超え,優れた生成性能を発揮することが示された。
論文 参考訳(メタデータ) (2026-03-02T18:42:15Z) - 3dSAGER: Geospatial Entity Resolution over 3D Objects (Technical Report) [7.378893412842889]
3dSAGERは3Dオブジェクト上の空間的エンティティ解決のためのエンドツーエンドパイプラインである。
本稿では,マッチングペアの複雑な幾何学的特徴をキャプチャする,空間参照非依存のデファクトチュール化機構を提案する。
また、訓練されたモデルを活用して、ハイリコール候補セットを効率的に生成する、軽量で解釈可能な新しいブロッキング手法であるBKAFIを提案する。
論文 参考訳(メタデータ) (2025-11-09T09:35:45Z) - Geo2Vec: Shape- and Distance-Aware Neural Representation of Geospatial Entities [13.206124101350847]
署名された距離場(SDF)にインスパイアされた新しい手法であるGeo2Vecを導入し、元の空間で直接動作する。
SDFを近似するように訓練されたニューラルネットワークは、すべてのジオエンタリティタイプに対してコンパクトで幾何学的、統一された表現を生成する。
実験結果から,Geo2Vecは形状と位置を表す既存の手法より一貫して優れており,トポロジカルおよび距離の関係を捉え,実世界のGeoAIアプリケーションにおいて高い効率を実現していることがわかった。
論文 参考訳(メタデータ) (2025-08-26T07:12:28Z) - EarthMapper: Visual Autoregressive Models for Controllable Bidirectional Satellite-Map Translation [50.433911327489554]
制御可能な衛星マップ翻訳のための新しいフレームワークであるEarthMapperを紹介する。
また,中国38都市を対象とした302,132組の衛星マップからなる大規模データセットであるCNSatMapをコントリビュートした。
CNSatMapとNew Yorkデータセットの実験は、EarthMapperの優れたパフォーマンスを実証している。
論文 参考訳(メタデータ) (2025-04-28T02:41:12Z) - Towards Natural Language-Guided Drones: GeoText-1652 Benchmark with Spatial Relation Matching [60.645802236700035]
自然言語コマンドを通じてドローンをナビゲートすることは、アクセス可能なマルチモーダルデータセットが不足しているため、依然として難しい。
我々は新しい自然言語誘導ジオローカライゼーションベンチマークGeoText-1652を紹介する。
このデータセットは、インタラクティブなヒューマンコンピュータプロセスを通じて体系的に構築される。
論文 参考訳(メタデータ) (2023-11-21T17:52:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。