論文の概要: Structure-Guided Masked Autoencoders for Ultra-High Resolution Scientific Image Understanding
- arxiv url: http://arxiv.org/abs/2609.30682v1
- Date: Fri, 25 Sep 2026 01:39:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 18:27:51.18301
- Title: Structure-Guided Masked Autoencoders for Ultra-High Resolution Scientific Image Understanding
- Title(参考訳): 超高分解能科学画像理解のための構造ガイド型マスク付きオートエンコーダ
- Abstract要約: Masked Autoencoders (MAE)を含むビジョントランスフォーマーを用いた自己教師付き事前トレーニングは、ギガピクセルの科学画像に適用することは困難である。
超高解像度科学画像のための構造誘導マスク自動符号化フレームワークであるSGMAを提案する。
- 参考スコア(独自算出の注目度): 14.872004663031559
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Self-supervised pre-training with Vision Transformers, including Masked Autoencoders (MAE), is difficult to apply to gigapixel scientific images. Random masking is poorly matched to the structured, multi-scale morphology of scientific data, while uniform tokenization produces prohibitively long sequences that make $O(N^2)$ attention impractical. We propose SGMA, a structure-guided masked autoencoding framework for ultra-high-resolution scientific images. SGMA couples two components: a content-adaptive quadtree tokenizer that compresses gigapixel images into a fixed-length sequence, and a structure-conditioned masking process that biases reconstruction toward spatially informative regions. To stabilize this process across scales, we introduce Damped Accumulation (DA), which aggregates signal-dependent responses across the tree into a structure canvas used to guide masking. The resulting pre-training task preserves fine microstructure while remaining compatible with standard ViT encoders and MAE-style reconstruction. Across electron microscopy, whole-slide optical microscopy, and X-ray CT datasets, SGMA consistently outperforms MAE baselines. It achieves 95.68% Dice on the 8K x 8K x 28K SpringXCT dataset, improving over the same-architecture MAE baseline by +13.00 points, and 83.21% Dice on the 32K^2 WSI PAIP dataset, improving by +16.84 points, while providing up to a 24.8x inference speedup.
- Abstract(参考訳): Masked Autoencoders (MAE)を含むビジョントランスフォーマーを用いた自己教師付き事前トレーニングは、ギガピクセルの科学画像に適用することは困難である。
ランダムマスキングは、構造化された多スケールの科学データの形態とよく一致しないが、均一なトークン化は、$O(N^2)$アテンションを非現実的にする非常に長いシーケンスを生成する。
超高解像度科学画像のための構造誘導マスク自動符号化フレームワークであるSGMAを提案する。
SGMAは、ギガピクセル画像を一定の長さのシーケンスに圧縮するコンテント適応クアッドツリートークンライザと、空間的に情報のある領域への再構成をバイアスする構造条件マスキングプロセスの2つのコンポーネントを結合する。
この過程を大規模に安定化するために,木全体にわたる信号依存応答をマスキングを誘導する構造キャンバスに集約するDamped Accumulation (DA)を導入する。
その結果、トレーニング前のタスクは、標準のViTエンコーダやMAEスタイルの再構築と互換性を維持しながら、微細な構造を保っている。
電子顕微鏡、全スライディング光学顕微鏡、X線CTデータセットを通して、SGMAは一貫してMAEベースラインを上回っている。
8K x 8K x 28K SpringXCTデータセットで95.68%のDiceを達成し、同じアーキテクチャのMAEベースラインを+13.00ポイント改善し、32K^2 WSI PAIPデータセットで83.21%のDiceを+16.84ポイント改善し、24.8倍の推論スピードアップを提供する。
関連論文リスト
- GAP-SAM: A Global Artifact Prior for Generalizable AI-Generated Image Manipulation Localization [15.115841637929895]
ソースイメージのCannyエッジと深度マップを用いてCOCO-ControlNetを構築し、セマンティクスと幾何学を整合させ、複数のローカライザ間でのOOD性能を向上させる。
また、細調整されたセグメンテーションモデルでは、真の操作境界ではなく、意味オブジェクトの輪郭に予測をスナップする。
GAP-SAMは画像とその凍結されたVAE再構成をグローバルアーティファクトトークンにエンコードし、ピクセル復号の前にゼロゲートFiLMを介してSAM3の特徴ピラミッドに注入する。
論文 参考訳(メタデータ) (2026-08-21T09:49:58Z) - Masked Autoencoder Pretraining on Strong-Lensing Images for Joint Dark-Matter Model Classification and Super-Resolution [0.0]
DeepLense ML4SCIベンチマークによる高輝度画像のMasked Autoencoder(MAE)事前学習戦略
我々は、マスク画像モデリングの目的を用いてビジョントランスフォーマーエンコーダを事前訓練し、各タスクごとに個別に微調整する。
超高解像度(16x16から64x64)では、PSNR 33 dBとSSIM 0.961で画像を再構成し、スクラッチトレーニングよりもわずかに改善した。
論文 参考訳(メタデータ) (2025-12-07T03:25:19Z) - Latents of latents to delineate pixels: hybrid Matryoshka autoencoder-to-U-Net pairing for segmenting large medical images in GPU-poor and low-data regimes [0.0]
画素レベルのタスクに十分なピクセル幾何を維持しながら重要な情報を保持する低ランクなマトリリシカプロジェクションとハイブリッドセグメンテーションアーキテクチャを提案する。
我々は,Matryoshka Autoencoderの階層的符号化とU-Netデコーダの空間再構成機能を組み合わせたMatryoshka Autoencoder(MatAE-U-Net)を設計する。
MatAE-UNet モデルは平均 IoU 77.68%、平均 Pixel 97.46%、Dice Coefficient 86.91% を達成し、ベースライン U- を上回っている。
論文 参考訳(メタデータ) (2025-02-13T05:51:41Z) - Self Pre-training with Adaptive Mask Autoencoders for Variable-Contrast 3D Medical Imaging [9.006543373916314]
Masked Autoencoder (MAE) は、視覚変換器 (ViT) が自然画像の解析に有効であることを最近証明した。
本稿では,3次元入力コントラストの可変数に対応可能な3次元適応マスク付きオートエンコーダ(AMAE)アーキテクチャを提案する。
この性能は、この適応マスク付きオートエンコーダの自己事前トレーニングにより、ViTベースのセグメンテーションモデルにおいて、梗塞セグメンテーション性能を2.8%-3.7%向上させることができることを示している。
論文 参考訳(メタデータ) (2025-01-15T19:29:31Z) - GlobalMamba: Global Image Serialization for Vision Mamba [73.50475621164037]
視覚マンバは、視覚トークンの数に対して線形複雑度で強い性能を示した。
既存のほとんどの方法はパッチベースの画像トークン化を採用し、因果処理のためにそれらを1Dシーケンスにフラット化する。
本稿では,グローバルな画像シリアライズ手法を提案し,その画像を因果トークンのシーケンスに変換する。
論文 参考訳(メタデータ) (2024-10-14T09:19:05Z) - SdAE: Self-distillated Masked Autoencoder [95.3684955370897]
本稿では,自己蒸留マスク付きオートエンコーダネットワークSdAEを提案する。
300エポックの事前トレーニングで、バニラViT-BaseモデルはImageNet-1k分類において84.1%の微調整精度を達成する。
論文 参考訳(メタデータ) (2022-07-31T15:07:25Z) - Global Context Vision Transformers [78.5346173956383]
我々は,コンピュータビジョンのパラメータと計算利用を向上する新しいアーキテクチャであるGC ViT(Global context vision transformer)を提案する。
本稿では,ViTにおける帰納バイアスの欠如に対処し,アーキテクチャにおける可溶性逆残差ブロックを改良して活用することを提案する。
提案したGC ViTは,画像分類,オブジェクト検出,セマンティックセマンティックセグメンテーションタスクにまたがる最先端の処理結果を実現する。
論文 参考訳(メタデータ) (2022-06-20T18:42:44Z) - ConvMAE: Masked Convolution Meets Masked Autoencoders [65.15953258300958]
機能事前トレーニングとマルチスケールハイブリッド畳み込み変換アーキテクチャのためのマスク付き自動エンコーディングは、ViTの可能性をさらに解き放つことができる。
我々のConvMAEフレームワークは、マスクの自動符号化方式により、マルチスケールのハイブリッド畳み込み変換器がより識別的な表現を学習できることを実証している。
事前訓練したConvMAEモデルに基づいて、ConvMAE-Baseは画像Net-1Kの微調整精度をMAE-Baseと比較して1.4%改善する。
論文 参考訳(メタデータ) (2022-05-08T15:12:19Z) - Stage-Aware Feature Alignment Network for Real-Time Semantic
Segmentation of Street Scenes [59.81228011432776]
街路シーンのリアルタイムなセマンティックセグメンテーションのためのSFANet(Stage-Aware Feature Alignment Network)を提案する。
デコーダにおける各ステージのユニークな役割を考慮に入れ、新しいステージ認識機能拡張ブロック(FEB)は、エンコーダからの特徴マップの空間的詳細と文脈的情報を強化するように設計されている。
実験の結果,提案したSFANetは,ストリートシーンのリアルタイムセマンティックセグメンテーションにおける精度と速度のバランスが良好であることがわかった。
論文 参考訳(メタデータ) (2022-03-08T11:46:41Z) - Automatic size and pose homogenization with spatial transformer network
to improve and accelerate pediatric segmentation [51.916106055115755]
空間変換器ネットワーク(STN)を利用することにより、ポーズとスケール不変の新たなCNNアーキテクチャを提案する。
私たちのアーキテクチャは、トレーニング中に一緒に見積もられる3つのシーケンシャルモジュールで構成されています。
腹部CTスキャナーを用いた腎および腎腫瘍の分節法について検討した。
論文 参考訳(メタデータ) (2021-07-06T14:50:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。