論文の概要: The Premise Is the Problem: Exchangeability Failure in Self-Monitored Test-Time Adaptation
- arxiv url: http://arxiv.org/abs/2610.07038v1
- Date: Sun, 04 Oct 2026 23:17:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.529212
- Title: The Premise Is the Problem: Exchangeability Failure in Self-Monitored Test-Time Adaptation
- Title(参考訳): 自己監視型テスト時間適応における交換可能性の失敗
- Abstract要約: 本稿では,モニタリングと適応が同一のフィードバックを使用する場合,そのようなモニタの背後にある統計的保証が有効であるかどうかを問う。
重なり合う目標と予測誤差への依存が、保証が要求する重要な前提を破る可能性があることを示す。
また、従来の凍結モデルはより明確な信号を保持する一方、適応は自身のモニターから持続的な変化を隠蔽できることがわかった。
- 参考スコア(独自算出の注目度): 0.5004814662623873
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Modern forecasting models are often updated after deployment so they can respond to changing data. These updates can also make predictions worse, so practical systems need a reliable monitor that can detect harmful changes and trigger protection. A natural design is to monitor the same prediction errors that guide the updates. This paper asks whether the statistical guarantee behind such a monitor remains valid when monitoring and adaptation use the same feedback. We study this question in multi-step time-series forecasting. We show that overlapping targets and dependence in forecast errors can break a key assumption required by the guarantee. The monitor may then raise alarms even when no harmful change has occurred, and its response can further damage prediction quality. We also find that adaptation can hide sustained changes from its own monitor, while the original frozen model retains a clearer signal. These results expose a basic failure mode in self-monitored adaptation. They show why reliable deployment requires checking the monitor's assumptions, comparing adaptation with the frozen model under realistic feedback, and limiting the effect of every protective response.
- Abstract(参考訳): 現代的な予測モデルはデプロイ後に更新されることが多く、データの変更に対応できる。
これらのアップデートは予測を悪化させる可能性があるため、実用的なシステムでは、有害な変更を検出し、保護をトリガーする信頼性の高いモニターが必要である。
自然な設計は、更新を導くのと同じ予測エラーを監視することである。
本稿では,モニタリングと適応が同一のフィードバックを使用する場合,そのようなモニタの背後にある統計的保証が有効であるかどうかを問う。
我々は、この問題を多段階の時系列予測で研究する。
重なり合う目標と予測誤差への依存が、保証が要求する重要な前提を破る可能性があることを示す。
モニターは、有害な変化が起こらない場合でも警報を発生させ、その応答は予測品質をさらに損なう可能性がある。
また、従来の凍結モデルはより明確な信号を保持する一方、適応は自身のモニターから持続的な変化を隠蔽できることがわかった。
これらの結果は、自己監視適応における基本的な障害モードを明らかにする。
それらは、信頼性の高いデプロイメントがモニターの仮定をチェックし、現実的なフィードバックの下で凍結モデルと比較し、すべての保護応答の効果を制限する必要がある理由を示している。
関連論文リスト
- When the Martingale Never Stops Firing: Anytime-Valid Gating on Real Forecast Streams [0.614481021961242]
任意の時間価推論は、いつでも実行できる証拠を約束する。
デプロイは、監視するストリームが交換可能に振る舞う場合に限り、それを継承する。
論文 参考訳(メタデータ) (2026-08-31T09:32:11Z) - Beyond Uncertainty: Generalizable Failure Monitoring for Surgical Segmentation under Acquisition Degradation [2.287641923890767]
外科的セグメンテーションネットワークは、取得劣化時に静かに失敗することがある。
観測可能な形状,時間整合性,画像品質などの信頼性を組み合わせた,ホット後の障害監視フレームワークであるTCSR-Monitorを提案する。
論文 参考訳(メタデータ) (2026-08-17T15:57:19Z) - Do Activation Monitors Survive Model Updates? Benchmarking, Predicting, and Repairing Activation-Monitor Staleness [0.16921396880325779]
ベースモデル上でトレーニングされたアクティベーションモニタが,定期的なモデル更新後も信頼性が保たれているかどうかを検証した。
量子化スタイルの更新は、主に凍結プローブのパフォーマンスを保ち、微調整スタイルの更新は、しばしばプローブを不安定にする。
また、前処理機能から劣化が予測可能であることも示し、再配置予算をモニターに向けてトリアージすることが可能となり、最も失敗する可能性が最も高い。
論文 参考訳(メタデータ) (2026-06-14T19:07:22Z) - Does Reasoning Preserve Alignment? On the Trustworthiness of Large Reasoning Models [55.788110316999166]
教師付き微調整, RL を用いた後訓練, および命令調整ベースラインに対する蒸留による推論モデルの比較を行った。
推論モデルはしばしば推論ベンチマークを改善するが、アライメント回帰を示す。
これらの回帰は、KL発散によって測定された命令調整ベースラインからの挙動ドリフトと一致している。
論文 参考訳(メタデータ) (2026-06-09T16:14:27Z) - Detecting Object Tracking Failure via Sequential Hypothesis Testing [80.7891291021747]
ビデオにおけるリアルタイムのオンラインオブジェクト追跡は、コンピュータビジョンにおける中核的なタスクである。
本稿では,物体追跡を逐次的仮説テストとして解釈することを提案する。
本研究では,地中追跡情報と内部追跡情報の両方を活用することにより,教師なしと教師なしの両方の変種を提案する。
論文 参考訳(メタデータ) (2026-02-13T14:57:15Z) - Revisiting Multivariate Time Series Forecasting with Missing Values [65.30332997607141]
現実の時系列では欠落値が一般的である。
現在のアプローチでは、計算モジュールを使用して、不足した値を補う、計算済みの予測フレームワークが開発されている。
このフレームワークは、致命的な問題を見落としている: 欠落した値に対して基礎的な真理は存在せず、予測精度を劣化させる可能性のあるエラーの影響を受けやすいようにしている。
本稿では,Information Bottleneck原則に基づく新しいフレームワークであるConsistency-Regularized Information Bottleneck(CRIB)を紹介する。
論文 参考訳(メタデータ) (2025-09-27T20:57:48Z) - The Over-Certainty Phenomenon in Modern Test-Time Adaptation Algorithms [8.210473195536077]
本稿では,精度とキャリブレーションに対処する手法を提案する。
提案手法は,予測誤差と負ログ類似度の観点から,最先端の性能を実現する。
論文 参考訳(メタデータ) (2024-04-24T19:55:50Z) - Tracking the risk of a deployed model and detecting harmful distribution
shifts [105.27463615756733]
実際には、デプロイされたモデルのパフォーマンスが大幅に低下しないという、良心的なシフトを無視することは理にかなっている。
我々は,警告を発射する有効な方法は,(a)良性な警告を無視しながら有害なシフトを検知し,(b)誤報率を増大させることなく,モデル性能の連続的なモニタリングを可能にすることを論じる。
論文 参考訳(メタデータ) (2021-10-12T17:21:41Z) - Trust but Verify: Assigning Prediction Credibility by Counterfactual
Constrained Learning [123.3472310767721]
予測信頼性尺度は統計学と機械学習において基本的なものである。
これらの措置は、実際に使用される多種多様なモデルを考慮に入れるべきである。
この研究で開発されたフレームワークは、リスクフィットのトレードオフとして信頼性を表現している。
論文 参考訳(メタデータ) (2020-11-24T19:52:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。