論文の概要: SARATR-X-v2: Scale-Aware Structural Pre-Training for SAR Foundation Models
- arxiv url: http://arxiv.org/abs/2607.23238v1
- Date: Sat, 25 Jul 2026 14:51:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.03643
- Title: SARATR-X-v2: Scale-Aware Structural Pre-Training for SAR Foundation Models
- Title(参考訳): SARATR-X-v2:SARファンデーションモデルのためのスケールアウェア構造事前評価
- Authors: Weijie Li, Yafei Song, Yongxiang Liu, Bowen Peng, Jie Zhou, Jingyuan Xia, Wei Yang, Tianpeng Liu, Zhen Liu, Li Liu,
- Abstract要約: SAR事前訓練対象は、転送可能な表現を生成するための2つの条件を満たすべきである。
物理基底安定性は固定演算子を好むが、セマンティックスケールの互換性はデータ駆動合成を好む。
SARATR-X-v2はどちらも単一の設計で和解する。
- 参考スコア(独自算出の注目度): 43.156720517756405
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Masked image modeling has become a dominant paradigm for SAR pre-training, yet the design of the reconstruction target remains fundamentally unsettled. This article argues that a SAR pre-training target should satisfy two conditions to produce transferable representations: (i) physics-grounded stability, i.e., approximate invariance of the target operator to multiplicative speckle inherent in coherent imaging; and (ii) semantic scale compatibility, i.e., coverage of the heterogeneous spatial scales that downstream tasks demand. These two conditions are individually achievable but jointly difficult: physics-grounded stability favors fixed operators, while semantic scale compatibility favors data-driven composition. To this end, SARATR-X-v2 reconciles both within a single design. The target is constructed through fixed structural extractors spanning six receptive fields, from blind-spot local aggregation to directional log-ratio region contrast, and fused via learnable weights into one unified supervision signal for masked reconstruction. On twelve SAR benchmarks across classification, detection, and segmentation, SARATR-X-v2 achieves state-of-the-art transfer performance. Under synthetic speckle variation, the proposed target reduces perturbation drift in the learned representation by nearly two orders of magnitude relative to pixel-space supervision. Taken together, these results establish physics-grounded stability and semantic scale compatibility as a principled framework for pre-training target design under coherent imaging, and suggest that effective SAR pre-training is not about reconstructing more signal, but about reconstructing the right structural target.
- Abstract(参考訳): マスク付き画像モデリングは、SAR事前訓練において主要なパラダイムとなっているが、再建ターゲットの設計は基本的に未解決のままである。
本稿では,SAR事前学習対象が伝達可能な表現を生成するための2つの条件を満たすべきであることを主張する。
一 物理基底安定性、すなわち、コヒーレントイメージングに固有の乗法スペックルに対する対象作用素の近似的不変性
(II)下流タスクが要求する不均一な空間スケールを網羅する意味的スケール互換性。
これらの2つの条件は個別に達成できるが、共同で難しい: 物理基底安定性は固定演算子を好むが、セマンティックスケールの互換性はデータ駆動合成を好む。
この目的のために、SARATR-X-v2はどちらも単一の設計で和解する。
ターゲットは、盲点局所集合から方向対数比領域のコントラストまで、6つの受容領域にまたがる固定された構造的抽出器によって構築され、学習可能な重みを通してマスク付き再構成のための1つの統一的な監視信号に融合する。
分類、検出、セグメンテーションの12のSARベンチマークでは、SARATR-X-v2は最先端の転送性能を達成する。
合成スペックル変動下では, 提案したターゲットは, 学習表現における摂動ドリフトを, 画素空間の監督に対してほぼ2桁程度低減する。
これらの結果は,コヒーレントイメージング下での目標設計を事前学習するための原則的枠組みとして,物理基底安定性とセマンティックスケールの整合性を確立し,SAR事前学習の有効性は,より多くの信号の再構成ではなく,適切な構造的目標を再構築することにあることを示唆している。
関連論文リスト
- Improving Visual Representation Alignment Generation with GRPO [51.071351994330605]
拡散変換器は強い画像合成能力を示したが、弱いアライメントのため、列車には非効率である。
本稿では,REPAの静的アライメント損失を生成的表現ポリシー最適化の目的に置き換える,強化に基づく最適化戦略であるVRPOを提案する。
当社のVRPO駆動トレーニングは拡散トランスフォーマーにシームレスに統合され、無視可能なコストを導入し、SiTとDiTアーキテクチャとの完全な互換性を維持します。
論文 参考訳(メタデータ) (2026-05-30T07:21:40Z) - Hierarchical Consistency Learning for Test-time Adaptation in Camouflage Perception [50.278200968044665]
カモフラージュされた物体検出(COD)は、物理的属性を通して背景から最小限の知覚差を示すターゲットをローカライズすることを目的としている。
既存のメソッドは、静的なTrain-then-freezeパラダイムによって制約されており、ドメインの剛性と依存性のアノテーションに悩まされている。
動的表現再構成のためのテスト時間適応を統合した階層的一貫性学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-25T09:57:46Z) - Beyond Point-Wise Matching: Structural Representation Alignment for Accelerating Diffusion Transformers [93.3976834364707]
本稿では,特徴写像のリレーショナル幾何における整合性を実現する構造的RePresentation AlignmentフレームワークであるsREPAを提案する。
モデルが事前訓練された特徴から全体的空間配置と構造的相関を内包するように促すことにより、sREPAはより高速でより安定した収束を達成する。
論文 参考訳(メタデータ) (2026-05-16T12:01:04Z) - Enhancing Cross-View UAV Geolocalization via LVLM-Driven Relational Modeling [31.36539752384395]
クロスビューUAVジオローカライゼーションは、ドローンが捉えた画像の正確な空間座標を、地理的に参照された広範囲な衛星データベースと整列させることを目的としている。
改良されたUAV-Satellite画像マッチングのための共同関係モデリングを明示的に行うために設計された,新しいプラグアンドプレイランキングアーキテクチャを提案する。
論文 参考訳(メタデータ) (2026-03-09T07:57:29Z) - TopoCurate:Modeling Interaction Topology for Tool-Use Agent Training [53.93696896939915]
訓練用ツール使用エージェントは一般的に、パスレート選択されたタスクに対して、軌道変更の成功と強化学習(RL)に依存している。
TopoCurateは,同一タスクから多段階的なロールアウトを統一的な意味的商トポロジに投影する対話型フレームワークである。
TopoCurateは最先端のベースラインに対して4.2%(SFT)と6.9%(RL)という一貫したゲインを達成している。
論文 参考訳(メタデータ) (2026-03-02T10:38:54Z) - Bridging Symmetry and Robustness: On the Role of Equivariance in Enhancing Adversarial Robustness [9.013874391203453]
敵対的な例では、知覚不能な入力摂動に対する感度を利用して、ディープニューラルネットワークの重大な脆弱性を明らかにしている。
本研究では,群-同変畳み込みを組込み,対向ロバスト性に対するアーキテクチャ的アプローチについて検討する。
これらの層は、モデル行動と入力空間の構造化変換を整合させる対称性の先行を符号化し、よりスムーズな決定境界を促進する。
論文 参考訳(メタデータ) (2025-10-17T19:26:58Z) - HSVA: Hierarchical Semantic-Visual Adaptation for Zero-Shot Learning [74.76431541169342]
ゼロショット学習(ZSL)は、目に見えないクラス認識の問題に取り組み、目に見えないクラスから目に見えないクラスに意味的な知識を移す。
本稿では,意味領域と視覚領域を協調させる新しい階層型意味視覚適応(HSVA)フレームワークを提案する。
4つのベンチマークデータセットの実験では、HSVAは従来のZSLと一般的なZSLの両方で優れた性能を示す。
論文 参考訳(メタデータ) (2021-09-30T14:27:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。