論文の概要: Prior-matched evaluation of operational Earth-observation classifiers: a three-number reporting method demonstrated on Sentinel-1 internal-wave detection
- arxiv url: http://arxiv.org/abs/2607.07146v1
- Date: Wed, 08 Jul 2026 08:38:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 22:50:30.324509
- Title: Prior-matched evaluation of operational Earth-observation classifiers: a three-number reporting method demonstrated on Sentinel-1 internal-wave detection
- Title(参考訳): 操作型地球観測分類器の事前整合性評価:Sentinel-1内部波検出における3つの数値報告法
- Abstract要約: 0.794 のバランステスト精度のモデルが実動作で0.192 となる。
トレーニング装束において, ミスマッチが評価問題であることを示す。
本稿では, バランステスト, 運用優先, 実際のポストデプロイの3つの図に基づいて, 事前マッチングしたレポート手法を示す。
- 参考スコア(独自算出の注目度): 1.2599533416395765
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The Internal Waves Service screens the Sentinel-1 Wave-mode archive for internal solitary waves, routing detections to experts whose adjudication time is the resource the effort exists to conserve. Because attention is the cost of error, precision leads. Its classifier was trained and reported at a one-to-one class balance, fixed before the operational rate could be known. That rate has since emerged at roughly one scene in twenty, and a balanced-test score badly overstates the precision a validator meets. A model that scores 0.794 balanced-test precision scores 0.192 in real operation: the gap is a systematic artefact of reporting at the wrong prior, invisible to the metric most work quotes. We show the mismatch to be an evaluation problem in the costume of a training one at a fixed recall, prior correction and calibration cannot move precision, and answer it with a prior-matched reporting method based on three figures: balanced-test, operational-prior, and real post-deployment, whose contrast is the honest measure. A precision-first, leakage-controlled development cycle then improves the classifier lever by lever, each promoted only against a pre-registered margin; added capacity not clearing it, calibration inert, feature aggregation the one real lift, so the honest negatives are as much a result as the gain. Holding recall at a floor of 0.80 and certifying against a sealed, single-read lockbox, the promoted model reports 0.927 precision at the operational prior; an out-of-time check confirms discrimination transfers to unseen periods while a fixed operating point does not. Prior-matched reporting, begin balanced, then move to the prior as the stream reveals it, transfers to any operational Earth-observation service bootstrapping a rare-event detector under a prior it has yet to discover.
- Abstract(参考訳): 内部波動サービスは、内部の孤立波に対してSentinel-1 Wave-modeアーカイブをスクリーニングし、調整時間が保存するリソースである専門家にルーティングする。
注意がエラーのコストであるから、正確性が導かれる。
その分類器は訓練され、運用率を知る前に固定された1対1のクラスバランスで報告された。
その後、20分の1の場面でこのレートが出現し、バランスの取れたテストスコアは、検証者が会う精度を著しく上回っている。
0.794のバランステスト精度のモデルでは、実際の操作で0.192のスコアが与えられる。
固定リコール時のトレーニング装束におけるミスマッチは評価問題であり, 事前補正と校正は精度を低下させることができず, バランステスト, 運用優先, 実際のポストデプロイの3つの図式に基づく事前整合報告手法で回答し, コントラストが正直な尺度である。
高精度でリーク制御された開発サイクルは、レバーによって分類器レバーを改良し、それぞれが予め登録されたマージンに対して推進される。
0.80のフロアでリコールを行い、封印されたシングルリードロックボックスに対して認証を行うと、プロモーションモデルでは運用前の0.927の精度が報告される。
事前整合された報告はバランスをとっており、ストリームが明らかになると前へと移動し、まだ発見されていない希少な検知器をブートストラップする地球観測サービスに転送する。
関連論文リスト
- A Bayesian Correlated Equilibrium for Early Insider-Threat Detection [11.643788980306235]
我々は、内部脅威検出を、プラットフォームが戦略認定者の委員会を調整し、誠実なユーザ間の均衡を維持する動的ベイズゲームとしてモデル化する。
CERT r6.2では、我々のメカニズムは1.6%以下の偽陽性で28.3%の事前濾過検出を達成し、トランスフォーマーベースラインとストリーミング 前駆体近似の両方がほぼゼロの事前濾過検出を実現する。
論文 参考訳(メタデータ) (2026-09-02T19:12:56Z) - Excitation-Supervised Closed-Loop Self-Calibration and Target Seeking for an Unknown-Pose Range-Bearing Relay [0.0]
本論文は、識別可能性を管理する閉ループ層を提供する。
励起教師付きアルゴリズムは、励起リセットコントローラを監督するために使用される。
崩壊率のスイープは、固定されたスケジュールの崩壊が未知の時間から適切な励振を追い越すとき、監督が重要であることを示している。
論文 参考訳(メタデータ) (2026-08-12T19:00:07Z) - Cybersecurity Detection Classification with Reasoning-enabled Language Models [50.72675435043546]
セキュリティオペレーションセンター(SOC)の大きな問題は、警告疲労である。
以前の作業では、大きな言語モデル(LLM)がトリアージラベルを直接出力するように促すか、あるいは微調整するが、検出が真の脅威であるかどうかを判断するよう訓練することはない。
我々は、実際の人間ラベルのWindowsエンドポイント検出に対して、推論可能なトリアージ分類器(CoT)を訓練する。
論文 参考訳(メタデータ) (2026-07-30T16:22:13Z) - PerceptionRubrics: Calibrating Multimodal Evaluation to Human Perception [75.70273182182397]
PerceptionRubricsはルーブリックベースの評価フレームワークである。
飽和ベンチマークスコアと現実世界の脆さのギャップに対処する。
1,038枚のインフォメーションセンス画像と1万個以上のインスタンス固有のルーリックをペアリングする。
論文 参考訳(メタデータ) (2026-06-26T17:59:15Z) - Anytime-Valid Confirmation of Label-Shift Corrections [0.6599344783327052]
小規模の科学的展開では、ラベル付けされた目標結果が、信頼できるシフト推定には不足している可能性がある。
本研究では,ラベルシフト補正予測とソース予測との観測確率比が条件付きe値であることを示す。
論文 参考訳(メタデータ) (2026-06-12T02:03:21Z) - When Evidence is Sparse: Weakly Supervised Early Failure Alerting in Dialogs and LLM-Agent Trajectories [20.332123003765837]
早期の障害警告では、ダイアログやエージェントのトラジェクトリがまだ展開されている間に、フェールするかどうかを判断する必要がある。
一般的には、トラジェクトリレベルの成功/失敗ラベルとしてのみ、監視が利用可能であるのに対して、アラートは部分的なインタラクションから引き上げなければならないため、これは難しい。
本稿では、このスパースエビデンス構造から学習し、その結果のリスク推定を制御可能な早期警報に利用する2段階のアプローチを提案する。
論文 参考訳(メタデータ) (2026-06-03T20:28:27Z) - Anomaly-Informed Confidence Calibration for Vision-Based Safety Prediction [1.0981335059631014]
既存の異常信号における臨界知覚-力学ギャップを同定する。
本研究では,世界モデルから抽出した2つの異常スコアを融合する異常情報オンライン手法を提案する。
論文 参考訳(メタデータ) (2026-05-20T12:43:09Z) - The Illusion of Certainty: Decoupling Capability and Calibration in On-Policy Distillation [67.26315138466312]
モデルロールアウトから経験的信頼性を推定するキャリブレーション対応のOPDフレームワークであるCaOPDを提案する。
本研究は, 能力蒸留が信頼性を示唆するものではないこと, 信頼性をポストトレーニングの本質的な目的として扱うべきであることを明らかにする。
論文 参考訳(メタデータ) (2026-04-18T04:43:40Z) - Correct Answers from Sound Reasoning: Verifiable Process Supervision for Language Models [94.68358825189738]
本稿では,予測精度と推論品質を協調的に最適化する検証済み領域の学習後フレームワークを提案する。
我々は,エンジン信号に対して推論ステップを確定的に検証できる制御テストベッドであるチェスのVPSを評価する。
VPSは、推論品質を著しく向上させながら精度を保ち、勝利率エラーを最大30%削減し、一貫性をほぼ飽和状態に回復する。
論文 参考訳(メタデータ) (2026-04-03T15:19:46Z) - Temperature Scaling Attack Disrupting Model Confidence in Federated Learning [4.863985119779627]
精度を保ちながらキャリブレーションを低下させる訓練時間攻撃である温度スケーリング攻撃(TSA)を提案する。
その結果, 校正整合性は, 連合学習における重要な攻撃面として確立された。
論文 参考訳(メタデータ) (2026-02-06T12:01:54Z) - Predicting Overtakes in Trucks Using CAN Data [51.28632782308621]
CANデータからトラックの積載量の検出について検討する。
私たちの分析では、オーバーテイクイベントの最大10秒前をカバーしています。
我々は、オーバーテイク・トリガーに近づくと、オーバーテイク・クラスの予測スコアが増加する傾向にあることを観察する。
論文 参考訳(メタデータ) (2024-04-08T17:58:22Z) - Deployment Prior Injection for Run-time Calibratable Object Detection [58.636806402337776]
検出器に追加のグラフ入力を導入し、事前にグラフが配置コンテキストを表す。
テストフェーズでは、事前に適切なデプロイメントコンテキストをグラフ編集を通じて検出器に注入することができる。
事前の配置が分かっていない場合でも、検出器は独自の予測を用いて、事前に近似した配置を用いて自己校正を行うことができる。
論文 参考訳(メタデータ) (2024-02-27T04:56:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。