論文の概要: How To Embed Matters: Evaluation of EO Embedding Design Choices
- arxiv url: http://arxiv.org/abs/2603.10658v1
- Date: Wed, 11 Mar 2026 11:16:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-12 16:22:32.912838
- Title: How To Embed Matters: Evaluation of EO Embedding Design Choices
- Title(参考訳): 材料を埋め込む方法:デザイン選択にEOを埋め込む方法の評価
- Abstract要約: バックボーンアーキテクチャ,事前学習戦略,表現深度,空間集約,表現結合がEOタスクのパフォーマンスに与える影響を示す。
平均プーリングを備えたトランスフォーマーバックボーンは、強力なデフォルトの埋め込みを提供し、中間ResNet層は最終層を上回り、自己組織化された目的はタスク固有の強みを示し、異なる目的からの埋め込みは、しばしば改善される。
- 参考スコア(独自算出の注目度): 3.21036640989662
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Earth observation (EO) missions produce petabytes of multispectral imagery, increasingly analyzed using large Geospatial Foundation Models (GeoFMs). Alongside end-to-end adaptation, workflows make growing use of intermediate representations as task-agnostic embeddings, enabling models to compute representations once and reuse them across downstream tasks. Consequently, when GeoFMs act as feature extractors, decisions about how representations are obtained, aggregated, and combined affect downstream performance and pipeline scalability. Understanding these trade-offs is essential for scalable embedding-based EO workflows, where compact embeddings can replace raw data while remaining broadly useful. We present a systematic analysis of embedding design in GeoFM-based EO workflows. Leveraging NeuCo-Bench, we study how backbone architecture, pretraining strategy, representation depth, spatial aggregation, and representation combination influence EO task performance. We demonstrate the usability of GeoFM embeddings by aggregating them into fixed-size representations more than 500x smaller than the raw input data. Across models, we find consistent trends: transformer backbones with mean pooling provide strong default embeddings, intermediate ResNet layers can outperform final layers, self-supervised objectives exhibit task-specific strengths, and combining embeddings from different objectives often improves robustness.
- Abstract(参考訳): 地球観測(EO)ミッションは、大規模な地球空間基盤モデル(GeoFMs)を用いて、ペタバイト単位のマルチスペクトル画像を生成する。
エンドツーエンドの適応に加えて、ワークフローは中間表現をタスクに依存しない埋め込みとして利用し、モデルが一度だけ表現を計算し、下流タスク間で再利用できるようにする。
その結果、GeoFMが機能抽出器として機能すると、どのように表現が得られ、集約され、組み合わせられるかという決定は、下流のパフォーマンスとパイプラインのスケーラビリティに影響します。
これらのトレードオフを理解することは、スケーラブルな埋め込みベースのEOワークフローにとって不可欠である。
我々はGeoFMベースのEOワークフローに埋め込み設計の体系的解析を行う。
NeuCo-Benchを活用することで、バックボーンアーキテクチャ、事前学習戦略、表現深さ、空間集約、表現結合がEOタスクのパフォーマンスにどのように影響するかを検討する。
我々は、GeoFM埋め込みのユーザビリティを、生の入力データよりも500倍以上小さい固定サイズ表現に集約することで示す。
平均プーリングを備えたトランスフォーマーバックボーンは、強力なデフォルトの埋め込みを提供し、中間ResNet層は最終層を上回り、自己監督対象はタスク固有の強みを示し、異なる目的からの埋め込みを組み合わせることで、ロバスト性は向上する。
関連論文リスト
- Hybrid Workflow Composition for Extreme-Scale Data Processing: A Case Study on the HL-LHC (Extended Version) [0.5156484100374059]
本稿では,タスクセットの粒度とシステムレベルの制約の相互作用を特徴付けるための新しいシミュレーションフレームワークを提案する。
その結果、ハイブリッド合成戦略はスループットを最大3.8倍に向上し、ネットワークオーバーヘッドを14.9倍削減できることがわかった。
論文 参考訳(メタデータ) (2026-07-29T13:07:31Z) - GeoAgentBench: A Dynamic Execution Benchmark for Tool-Augmented Agents in Spatial Analysis [16.604040127938955]
ツール拡張GISエージェントに適した動的かつインタラクティブな評価ベンチマークであるGeoAgentBench(GABench)を紹介する。
GABenchは117の原子GISツールを統合し、53の典型的な空間分析タスクを含む現実的なサンドボックスを提供する。
我々は,グローバルオーケストレーションをステップワイドなリアクティブ実行から切り離して,専門家の認知異常を模倣する新しいエージェントアーキテクチャであるPlan-and-Reactを開発した。
論文 参考訳(メタデータ) (2026-04-15T13:55:34Z) - TopoCurate:Modeling Interaction Topology for Tool-Use Agent Training [53.93696896939915]
訓練用ツール使用エージェントは一般的に、パスレート選択されたタスクに対して、軌道変更の成功と強化学習(RL)に依存している。
TopoCurateは,同一タスクから多段階的なロールアウトを統一的な意味的商トポロジに投影する対話型フレームワークである。
TopoCurateは最先端のベースラインに対して4.2%(SFT)と6.9%(RL)という一貫したゲインを達成している。
論文 参考訳(メタデータ) (2026-03-02T10:38:54Z) - A Hierarchical Multi-Agent System for Autonomous Discovery in Geoscientific Data Archives [0.0]
PANGAEA-GPTは、自律的なデータ発見と分析のために設計された階層型マルチエージェントフレームワークである。
標準のLarge Language Model (LLM)ラッパーとは異なり、我々のアーキテクチャは集中型スーパーバイザ-ワーバートポロジを実装している。
人間の介入を最小限に抑えながら、複雑な多段階決定論的ランタイムを実行するシステムの能力を実証する。
論文 参考訳(メタデータ) (2026-02-24T20:37:38Z) - OFA-MAS: One-for-All Multi-Agent System Topology Design based on Mixture-of-Experts Graph Generative Models [57.94189874119267]
マルチエージェントシステム(MAS)は複雑な問題を解決するための強力なパラダイムを提供する。
現在のグラフ学習に基づく設計手法は、しばしば「1対1」のパラダイムに準拠している。
自然言語で記述されたタスクに対して適応的な協調グラフを生成する一対一のフレームワークOFA-TADを提案する。
論文 参考訳(メタデータ) (2026-01-19T12:23:44Z) - Beyond Weight Adaptation: Feature-Space Domain Injection for Cross-Modal Ship Re-Identification [3.6907522136316975]
CMS Re-ID(Cross-Modality Ship Re-Identification)は、全天候の海上目標追跡を実現するために重要である。
モダリティギャップのブリッジ化におけるビジョン・ファンデーション・モデル(VFM)の可能性を探る。
ドメイン表現注入(Domain Representation Injection, DRI)と呼ばれる新しいPEFT戦略を提案する。
論文 参考訳(メタデータ) (2025-12-24T02:30:23Z) - GEO-Bench-2: From Performance to Capability, Rethinking Evaluation in Geospatial AI [52.13138825802668]
GeoFMは地球観測を変革しているが、評価には標準化されたプロトコルが欠けている。
GEO-Bench-2は、分類、セグメンテーション、回帰、オブジェクト検出、インスタンスセグメンテーションにまたがる包括的なフレームワークでこの問題に対処する。
GEO-Bench-2のコード、データ、およびリーダーボードは、パーミッシブライセンスの下で公開されている。
論文 参考訳(メタデータ) (2025-11-19T17:45:02Z) - RECALL: REpresentation-aligned Catastrophic-forgetting ALLeviation via Hierarchical Model Merging [33.22889542330089]
大規模言語モデル(LLM)の内部表現は、学習知識の信頼できるプロキシとして機能する。
本稿では,過去データにアクセスせずに連続的な学習を行うための表現認識モデル統合フレームワークRECALLを提案する。
論文 参考訳(メタデータ) (2025-10-23T12:17:37Z) - VRS-UIE: Value-Driven Reordering Scanning for Underwater Image Enhancement [104.78586859995333]
状態空間モデル(SSM)は、線形複雑性と大域的受容場のために、視覚タスクの有望なバックボーンとして登場した。
大型で均質だが無意味な海洋背景の優位性は、希少で価値ある標的の特徴表現応答を希薄にすることができる。
水中画像強調(UIE)のための新しい値駆動リダクションスキャンフレームワークを提案する。
本フレームワークは, 水バイアスを効果的に抑制し, 構造や色彩の忠実さを保ち, 優れた向上性能(WMambaを平均0.89dB超える)を実現する。
論文 参考訳(メタデータ) (2025-05-02T12:21:44Z) - Efficient High-Resolution Visual Representation Learning with State Space Model for Human Pose Estimation [60.80423207808076]
高解像度の視覚表現を維持しながら長距離依存関係をキャプチャすることは、人間のポーズ推定のような密集した予測タスクに不可欠である。
マルチスケールの畳み込み操作で視覚状態空間モデルを拡張する動的ビジュアル状態空間(DVSS)ブロックを提案する。
HRVMambaは効率的な高分解能表現学習のための新しいモデルである。
論文 参考訳(メタデータ) (2024-10-04T06:19:29Z) - Rotated Multi-Scale Interaction Network for Referring Remote Sensing Image Segmentation [63.15257949821558]
Referring Remote Sensing Image (RRSIS)は、コンピュータビジョンと自然言語処理を組み合わせた新しい課題である。
従来の参照画像(RIS)アプローチは、空中画像に見られる複雑な空間スケールと向きによって妨げられている。
本稿ではRMSIN(Rotated Multi-Scale Interaction Network)を紹介する。
論文 参考訳(メタデータ) (2023-12-19T08:14:14Z) - Entity-Graph Enhanced Cross-Modal Pretraining for Instance-level Product
Retrieval [152.3504607706575]
本研究の目的は, 細粒度製品カテゴリを対象とした, 弱制御型マルチモーダル・インスタンスレベルの製品検索である。
まず、Product1Mデータセットをコントリビュートし、2つの実際のインスタンスレベルの検索タスクを定義します。
我々は、マルチモーダルデータから重要な概念情報を組み込むことができるより効果的なクロスモーダルモデルを訓練するために活用する。
論文 参考訳(メタデータ) (2022-06-17T15:40:45Z) - Learning to Aggregate Multi-Scale Context for Instance Segmentation in
Remote Sensing Images [28.560068780733342]
特徴抽出のプロセスを改善するために,新しいコンテキスト集約ネットワーク(CATNet)を提案する。
提案モデルは,高密度特徴ピラミッドネットワーク(DenseFPN),空間コンテキストピラミッド(SCP),階層的関心抽出器(HRoIE)の3つの軽量プラグアンドプレイモジュールを利用する。
論文 参考訳(メタデータ) (2021-11-22T08:55:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。