論文の概要: STRADAViT: Towards a Foundational Model for Radio Astronomy through Self-Supervised Transfer
- arxiv url: http://arxiv.org/abs/2603.29660v3
- Date: Wed, 08 Apr 2026 09:44:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-09 14:06:04.895727
- Title: STRADAViT: Towards a Foundational Model for Radio Astronomy through Self-Supervised Transfer
- Title(参考訳): STRADAViT:自己監督移動による電波天文学の基礎モデルを目指して
- Abstract要約: STRADAViTは、無線天文学の画像から転送可能なエンコーダを学習するための、自己監督型ビジョントランスフォーマーの継続的な事前訓練フレームワークである。
復元のみ、コントラストのみ、および2段階のブランチをサポートする。
線形探索と微調整により,2次および複数クラス設定にまたがる3つの形態素ベンチマークの転送を評価する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Next-generation radio astronomy surveys are delivering millions of resolved sources, but robust and scalable morphology analysis remains difficult across heterogeneous telescopes and imaging pipelines. We present STRADAViT, a self-supervised Vision Transformer continued-pretraining framework for learning transferable encoders from radio astronomy imagery. The framework combines mixed-survey data curation, radio astronomy-aware training-view generation, and a ViT-MAE-initialized encoder family with optional register tokens. It supports reconstruction-only, contrastive-only, and two-stage branches. Our pretraining dataset comprises radio astronomy cutouts drawn from four complementary sources. We evaluate transfer with linear probing and fine-tuning on three morphology benchmarks spanning binary and multi-class settings. Relative to the ViT-MAE initialization used for continued pretraining, the best two-stage models improve Macro-F1 in all reported linear-probe settings and in two of three fine-tuning settings, with the largest gain on RGZ DR1. Relative to DINOv2, gains are selective rather than universal: the best two-stage models achieve higher mean Macro-F1 than the strongest DINOv2 baseline on LoTSS DR2 and RGZ DR1 under linear probing, and on MiraBest and RGZ DR1 under fine-tuning. A targeted DINOv2 initialization ablation further indicates that the adaptation recipe is not specific to the ViT-MAE starting point and that, under the same recipe. The ViT-MAE-based STRADAViT checkpoint is retained as the released checkpoint because it combines competitive transfer with substantially lower token count and downstream cost than the DINOv2-based alternative. These results indicate that radio astronomy-aware view generation and staged continued pretraining can provide a stronger domain-adapted starting point than off-the-shelf ViT checkpoints for radio astronomy transfer.
- Abstract(参考訳): 次世代の電波天文学調査は、何百万もの解決された情報源を提供しているが、頑丈でスケーラブルな形態解析は、異種望遠鏡や撮像パイプラインで難しいままである。
本稿では、無線天文学画像から転送可能なエンコーダを学習するための自己教師型ビジョントランスフォーマーであるSTRADAViTについて述べる。
このフレームワークは、混合サーベイデータキュレーション、無線天文学対応のトレーニングビュー生成、ViT-MAE初期化エンコーダファミリーとオプションレジスタトークンを組み合わせる。
復元のみ、コントラストのみ、および2段階のブランチをサポートする。
予備訓練データセットは4つの補完源から抽出された電波天文学のカットアウトからなる。
線形探索と微調整により,2次および複数クラス設定にまたがる3つの形態素ベンチマークの転送を評価する。
ViT-MAEの初期化と異なり、最も優れた2段階のモデルでは、すべての報告されたリニアプローブ設定と3つの微調整設定でマクロF1が改善され、RGZ DR1で最大の利益を得た。
DINOv2とは対照的に、ゲインは普遍性よりも選択的であり、最高の2段階モデルでは、リニアプローブ下でのLOTSS DR2とRGZ DR1、微調整時にMiraBestとRGZ DR1において最強のDINOv2ベースラインよりも高い平均のマクロ-F1を達成する。
標的とするDINOv2初期化アブレーションは、適応レシピがViT-MAE開始点に特異的でないことを示し、同じレシピの下ではそれを示す。
ViT-MAEベースのSTRADAViTチェックポイントは、競合転送と、DINOv2ベースの代替機よりもかなり低いトークン数とダウンストリームコストを組み合わせているため、リリースされたチェックポイントとして保持されている。
これらの結果から, 電波天文学を意識した視線生成と連続事前訓練により, 既設のVTチェックポイントよりも強い領域適応開始点が得られることが示唆された。
関連論文リスト
- FLORO: A Multimodal Geospatial Foundation Model for Ecological Remote Sensing Across Sensors and Scales [65.4821703903285]
FLOROは、小さなが高度に多様なリモートセンシングコーパスから転送可能な表現を学習するために設計されたマルチモーダル基礎モデルである。
FLOROは、Sentinel-1、Sentinel-2、SkySAT画像、標高、UAV由来のデータとの不均一な組み合わせによるマスク付きオートエンコーディングを用いて事前訓練される。
我々は、シーン分類、セグメンテーション、回帰タスクにまたがる凍結エンコーダプロトコルを用いて、PANGAEAベンチマーク上でFLOROを評価した。
論文 参考訳(メタデータ) (2026-05-27T08:55:54Z) - VFM-Recon: Unlocking Cross-Domain Scene-Level Neural Reconstruction with Scale-Aligned Foundation Priors [49.39553550491549]
VFMReconは, シーンレベルの神経再構成において, スケール一貫性の要求を満たすトランスファー可能なVFMプリエントをブリッジする最初の試みである。
具体的には、まず、マルチビュースケールコヒーレンスを復元する軽量なスケールアライメントステージを導入する。
次に、トレーニング済みのVFM機能を、軽量なタスク固有アダプタを介して、ニューラルボリューム再構築パイプラインに統合する。
論文 参考訳(メタデータ) (2026-03-13T05:00:44Z) - Prediction of Major Solar Flares Using Interpretable Class-dependent Reward Framework with Active Region Magnetograms and Domain Knowledge [4.3863289127101455]
クラス依存報酬(CDR)を用いた教師付き分類フレームワークを初めて開発し,24時間以内に$geq$MMのフレアを予測する。
我々は3つのディープラーニングモデル(CNN、CNN-BiLSTM、Transformer)と3つのCDRモデル(CDR-CNN、CDR-CNN-BiLSTM、CDR-Transformer)を適用する。
我々は、LOS磁場パラメータとTransformerの重要性を分析し、その性能をLOSのみ、ベクトルのみ、および複合磁界パラメータを用いて比較する。
論文 参考訳(メタデータ) (2026-02-18T08:30:02Z) - A Tri-Modal Dataset and a Baseline System for Tracking Unmanned Aerial Vehicles [74.8162337823142]
MM-UAVはMulti-Modal UAV Trackingの最初の大規模ベンチマークである。
データセットは30以上の挑戦的なシナリオにまたがっており、1,321の同期マルチモーダルシーケンスと280万以上の注釈付きフレームがある。
データセットを伴って、我々は新しいマルチモーダルマルチUAV追跡フレームワークを提供する。
論文 参考訳(メタデータ) (2025-11-23T08:42:17Z) - Learning Visually Interpretable Oscillator Networks for Soft Continuum Robots from Video [4.857795247230421]
本稿では,自動エンコーダに基づく潜在動的学習のためのプラグイン・アンド・プレイモジュールであるAttention Broadcast Decoder (ABCD)を紹介する。
ABCDは静的背景をフィルタリングしながら、各潜伏次元の寄与をローカライズした画素精度の注意マップを生成する。
ABCDに基づくモデルにより,複数ステップの予測精度が大幅に向上することが実証された。
論文 参考訳(メタデータ) (2025-11-23T07:27:39Z) - The Path Not Taken: RLVR Provably Learns Off the Principals [85.41043469428365]
スパーシティはモデル条件の最適化バイアスの表面積であることを示す。
我々はこれらの力学を三ゲージ理論で機械的に説明する。
本稿では,RLVRの学習力学のパラメータレベルの特徴付けを行う。
論文 参考訳(メタデータ) (2025-11-11T18:49:45Z) - Detect Anything via Next Point Prediction [51.55967987350882]
Rex-Omniは最先端の物体認識性能を実現する3BスケールのMLLMである。
COCOやLVISのようなベンチマークでは、Rex-Omniは回帰ベースのモデルに匹敵するパフォーマンスを得る。
論文 参考訳(メタデータ) (2025-10-14T17:59:54Z) - STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs [49.41782982417187]
MLLM(Multimodal Large Language Models)は、様々なタスクにまたがる顕著な能力を示すが、空間的推論において人間よりもはるかに遅れている。
このギャップを変換駆動型視覚推論(TVR)を用いて検討する。
本稿では,STAR-R1を提案する。STAR-R1は単一ステージのRLパラダイムとTVRに適した微細な報酬機構を統合した新しいフレームワークである。
論文 参考訳(メタデータ) (2025-05-21T17:57:38Z) - Self-supervised learning for radio-astronomy source classification: a benchmark [7.242380808853482]
近日発売のスクエア・キロメーター・アレイ(SKA)望遠鏡は、電波天文学において重要な一歩を踏み出した。
光写真画像に事前訓練された従来の視覚モデルは、電波干渉画像では最適に動作しない可能性がある。
本研究では,ラジオ天文学へのセルフ・スーパーバイザード・ラーニングの適用について検討する。
論文 参考訳(メタデータ) (2024-11-21T12:43:19Z) - ExPLoRA: Parameter-Efficient Extended Pre-Training to Adapt Vision Transformers under Domain Shifts [52.1635661239108]
本稿では,事前学習された視覚変換器(ViT)のドメインシフト下での伝達学習を改善するために,ExPLoRAを提案する。
我々の実験は、衛星画像の最先端の成果を実証し、完全な事前学習や微調整のViTよりも優れています。
論文 参考訳(メタデータ) (2024-06-16T15:14:56Z) - An Effective Motion-Centric Paradigm for 3D Single Object Tracking in
Point Clouds [50.19288542498838]
LiDARポイントクラウド(LiDAR SOT)における3Dシングルオブジェクトトラッキングは、自動運転において重要な役割を果たす。
現在のアプローチはすべて、外観マッチングに基づくシームズパラダイムに従っている。
我々は新たな視点からLiDAR SOTを扱うための動き中心のパラダイムを導入する。
論文 参考訳(メタデータ) (2023-03-21T17:28:44Z) - Joint Spatial-Temporal and Appearance Modeling with Transformer for
Multiple Object Tracking [59.79252390626194]
本稿ではTransSTAMという新しい手法を提案する。Transformerを利用して各オブジェクトの外観特徴とオブジェクト間の空間的時間的関係の両方をモデル化する。
提案手法はMOT16, MOT17, MOT20を含む複数の公開ベンチマークで評価され, IDF1とHOTAの両方で明確な性能向上を実現している。
論文 参考訳(メタデータ) (2022-05-31T01:19:18Z) - AFDetV2: Rethinking the Necessity of the Second Stage for Object
Detection from Point Clouds [15.72821609622122]
我々は点雲からの3次元検出のための1段アンカーフリーネットワークを開発した。
我々は、バックボーンの自己校正畳み込みブロック、キーポイント補助監視、マルチタスクヘッドのIoU予測分岐を使用する。
私たちは2021年のリアルタイム3Dチャレンジで1位を獲得しました。
論文 参考訳(メタデータ) (2021-12-16T21:22:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。