論文の概要: Beyond Accuracy: Assessing Calibration of Geospatial Foundation Models and Their Sensitivity to Distribution Shifts
- arxiv url: http://arxiv.org/abs/2608.16614v1
- Date: Mon, 17 Aug 2026 14:16:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.740129
- Title: Beyond Accuracy: Assessing Calibration of Geospatial Foundation Models and Their Sensitivity to Distribution Shifts
- Title(参考訳): 地理的基盤モデルの校正評価と分布変化に対する感度
- Abstract要約: 重要なEOタスクへの約束された展開には、さらなる分析のアングルが必要であることを示す。
EOに制限されたエンコーダは、同様にタスク情報を失うことなく、汚職を免れる。
信頼に基づく棄権は、確実な誤った予測を先延ばしできない。
- 参考スコア(独自算出の注目度): 15.070040506693738
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Geospatial Foundation Models (GeoFMs) are most commonly ranked and selected by accuracy on standard benchmark conditions via averaged ranks. We show that this protocol is too narrow: the promised deployment in critical EO tasks requires further angles of analysis, mainly calibration, the agreement between a model's confidence and its correctness. Across 16 frozen encoders, four classification and five segmentation datasets, and two orthogonal stress axes, every encoder degrades as corruption intensifies, and the ranking changes as well. Across the four classification benchmarks, EO-pretrained and ImageNet-pretrained encoders are indistinguishable on clean accuracy and clean calibration, and EO pretraining provides no more stability under shift than ImageNet pretraining. Under shift the GeoFMs drift further into overconfidence than the ImageNet-pretrained encoders, at every grade and in every corruption family. A centered kernel alignment (CKA) analysis ties this to representational rigidity: EO-pretrained embeddings move less under corruption while losing just as much task information and remaining overconfident. We apply three commonly explored uncertainty quantification methods and find that temperature scaling and deep ensembles cannot counteract the degradation, while a Gaussian-process probe roughly halves ECE under severe cloud only by tripling it on clean data. In selective prediction experiments, we find that confidence-based abstention cannot defer around confidently wrong predictions, and advocate that benchmark rankings and evaluations should therefore operate across a multitude of conditions and metrics to more holistically evaluate model development progress and close the gap to real world deployment scenarios.
- Abstract(参考訳): Geospatial Foundation Models (GeoFMs) が最も一般的にランク付けされ、平均ランクによる標準ベンチマーク条件の精度によって選択される。
重要なEOタスクへの約束されたデプロイには、キャリブレーション(主にキャリブレーション)、モデルの信頼性と正確性の間の合意といった、さらなる分析のアングルが必要です。
16個の冷凍エンコーダ、4つの分類、5つのセグメンテーションデータセット、2つの直交応力軸、全てのエンコーダは腐敗が増すにつれて劣化し、ランキングも変化する。
4つの分類ベンチマークの中で、EO-pretrained と ImageNet-pretrained のエンコーダは、クリーンな精度とクリーンなキャリブレーションでは区別できない。
シフト中のGeoFMは、ImageNetで事前訓練されたエンコーダよりも、すべてのグレードとすべての汚職家族において、さらに自信に満ちている。
中心的なカーネルアライメント(CKA)分析は、これを表現的剛性に結び付けている。
本研究では,3つの不確実性定量法を適用し,温度スケーリングと深層アンサンブルが劣化を防止できないこと,一方,ガウス過程プローブは,クリーンなデータに三重化させることで,ECEを強大な雲の下におおよそ半分にすることを示した。
選択的な予測実験では、信頼に基づく棄却は確実な誤った予測を抑えられないことが分かり、その結果、ベンチマークのランキングと評価は、モデル開発の進捗をより全体的に評価し、現実の展開シナリオとのギャップを埋めるために、様々な条件や指標にわたって行われるべきであると提唱する。
関連論文リスト
- A Fuzzy Rule-based Neuro-Symbolic Approach for Pipe Severity Prediction in Sewer Networks [0.0]
本研究では、このギャップを象徴的推論から神経知覚を分離することで橋渡しするモジュラーでファジィな規則に基づくニューロシンボリック・フレームワークを導入する。
推論のために、DT、特にウェカのJ48アルゴリズムは、接地規則のCODEと重度ラベルに基づいて訓練され、その経路は19の固定IF-THENルールに変換される。
全体として、このフレームワークは、競合するクラスバランスのパフォーマンスと予測されたCODE学位からのトレース可能な推論を組み合わせることで、ルールサポートと重大さのエビデンスを実現している。
論文 参考訳(メタデータ) (2026-07-30T16:33:26Z) - Benchmarking Sensor-Fault Robustness in Forecasting [34.25988781693566]
我々は,予測アーキテクチャとロバスト性改善手法を評価するために,共有CPS地上センサフォアストレステストプロトコルであるSensorFault-Benchを紹介する。
最悪のシナリオ劣化、クリーン平均二乗誤差(MSE)、最悪のシナリオ故障時間MSEを報告し、絶対誤差から相対ロバスト性を分離する。
SensorFault-Benchは、オープンソースコード、ドキュメント化されたデータアクセス、再生および拡張ガイドを提供する。
論文 参考訳(メタデータ) (2026-05-11T16:41:14Z) - Margin and Consistency Supervision for Calibrated and Robust Vision Models [1.0152838128195467]
Margin and Consistency Supervision (MaCS)は、アーキテクチャに依存しないシンプルな正規化フレームワークである。
MACSはロジト空間分離と局所予測安定性を共同で実施する。
我々は,リプシッツ型安定性プロキシにより定式化された局所感度を低下させながら,分類マージンを増大させることにより,一般化の保証が向上することを示した。
論文 参考訳(メタデータ) (2026-03-06T01:54:28Z) - Enhance GNNs with Reliable Confidence Estimation via Adversarial Calibration Learning [30.450482094196243]
優れた予測性能にもかかわらず、GNNは信頼度が低いことがしばしばある。
この問題は、不正検出やリスクアセスメントといった高リスク領域における信頼性に関する懸念を提起する。
本稿では,異なるノード群間のキャリブレーションを適応的に強化する新しいAdvCaliフレームワークを提案する。
論文 参考訳(メタデータ) (2025-03-23T23:04:41Z) - Towards Calibrated Deep Clustering Network [60.71776081164377]
ディープクラスタリングでは、特定のクラスタに属するサンプルに対する推定信頼度はその実際の予測精度を大きく上回る。
推定された信頼度と実際の精度を効果的にキャリブレーションできる新しいデュアルヘッド(キャリブレーションヘッドとクラスタリングヘッド)深層クラスタリングモデルを提案する。
提案したキャリブレーション深層クラスタリングモデルでは, キャリブレーション誤差の予測値において, 最先端の深部クラスタリング手法を平均5倍に越えるだけでなく, クラスタリング精度も大幅に向上する。
論文 参考訳(メタデータ) (2024-03-04T11:23:40Z) - On the Calibration of Human Pose Estimation [39.15814732856338]
Calibrated ConfidenceNet (CCNet)は、市販のポーズ推定フレームワークでAPを最大1.4%改善する軽量なポストホック追加である。
メッシュリカバリの下流タスクに適用されたCCNetは、3Dキーポイントエラーを1.0mm削減する。
論文 参考訳(メタデータ) (2023-11-28T09:31:09Z) - Proximity-Informed Calibration for Deep Neural Networks [49.330703634912915]
ProCalは、近接性に基づいてサンプル信頼度を調整する理論的保証を持つプラグアンドプレイアルゴリズムである。
ProCalは、近接バイアスに対処し、バランスの取れた、長い、分布シフトの設定の校正を改善するのに有効であることを示す。
論文 参考訳(メタデータ) (2023-06-07T16:40:51Z) - Bridging Precision and Confidence: A Train-Time Loss for Calibrating
Object Detection [58.789823426981044]
本稿では,境界ボックスのクラス信頼度を予測精度に合わせることを目的とした,新たな補助損失定式化を提案する。
その結果,列車の走行時間損失はキャリブレーション基準を超過し,キャリブレーション誤差を低減させることがわかった。
論文 参考訳(メタデータ) (2023-03-25T08:56:21Z) - Sample-dependent Adaptive Temperature Scaling for Improved Calibration [95.7477042886242]
ニューラルネットワークの誤りを補うポストホックアプローチは、温度スケーリングを実行することだ。
入力毎に異なる温度値を予測し、信頼度と精度のミスマッチを調整することを提案する。
CIFAR10/100およびTiny-ImageNetデータセットを用いて,ResNet50およびWideResNet28-10アーキテクチャ上で本手法をテストする。
論文 参考訳(メタデータ) (2022-07-13T14:13:49Z) - Uncertainty-Aware Deep Calibrated Salient Object Detection [74.58153220370527]
既存のディープニューラルネットワークに基づくサルエントオブジェクト検出(SOD)手法は主に高いネットワーク精度の追求に重点を置いている。
これらの手法は、信頼不均衡問題として知られるネットワーク精度と予測信頼の間のギャップを見落としている。
我々は,不確実性を考慮した深部SODネットワークを導入し,深部SODネットワークの過信を防止するための2つの戦略を提案する。
論文 参考訳(メタデータ) (2020-12-10T23:28:36Z) - Generalized Focal Loss: Learning Qualified and Distributed Bounding
Boxes for Dense Object Detection [85.53263670166304]
一段検出器は基本的に、物体検出を密度の高い分類と位置化として定式化する。
1段検出器の最近の傾向は、局所化の質を推定するために個別の予測分岐を導入することである。
本稿では, 上記の3つの基本要素, 品質推定, 分類, ローカライゼーションについて述べる。
論文 参考訳(メタデータ) (2020-06-08T07:24:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。