論文の概要: Detecting is Easy, Adapting is Hard: Local Expert Growth for Visual Model-Based Reinforcement Learning under Distribution Shift
- arxiv url: http://arxiv.org/abs/2604.27411v1
- Date: Thu, 30 Apr 2026 04:28:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-01 16:31:53.923991
- Title: Detecting is Easy, Adapting is Hard: Local Expert Growth for Visual Model-Based Reinforcement Learning under Distribution Shift
- Title(参考訳): 検出は簡単で適応は難しい - 分散シフト下でのビジュアルモデルに基づく強化学習のためのローカルエキスパート成長
- Authors: Haiyang Zhao,
- Abstract要約: 我々は,罰則の計画,直接微調整,大域的残差補正,粗いゲーティングなど,変化に対応する方法を研究する。
これらの否定的な結果に基づき,JEPA-Indexed Local Expert Growthを提案する。
クラスタ固有の残留専門家が元のコントローラの上に局所的なアクション補正を追加するのに対して、このメソッドは問題インデックス化のみにフリーズされたJEPA表現を使用する。
- 参考スコア(独自算出の注目度): 2.233624388203003
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Visual model-based reinforcement learning (MBRL) agents can perform well on the training distribution, but often break down once the test environment shifts. In visual MBRL, recognizing that a shift has occurred is often the easier part; the harder part is turning that recognition into useful action-level correction. We study several ways of responding to shift, including planning penalties, direct fine-tuning, global residual correction, and coarse gating. In our experiments, these approaches either do not improve closed-loop control or hurt in-distribution (ID) performance. Based on these negative results, we propose JEPA-Indexed Local Expert Growth. The method uses a frozen JEPA representation only for problem indexing, while cluster-specific residual experts add local action corrections on top of the original controller. The baseline controller itself is not modified. Using paired-bootstrap evaluation, we find that the original naive-preference variant is not stable under stricter testing. In contrast, the harder-pair variant produces statistically significant OOD improvements on all four evaluated shift conditions while preserving ID performance. The learned experts also remain useful when the same shift is encountered again, which supports the view of adaptation as incremental knowledge growth rather than repeated full retraining. We further show that automatic ID rejection can be achieved with simple density models, whereas fine-grained discrimination among OOD sub-families is limited by the representation. Overall, the results indicate that, for visual MBRL under distribution shift, the main challenge is not simply noticing that the environment has changed, but applying the right local action correction after the change has been recognized.
- Abstract(参考訳): ビジュアルモデルベース強化学習(MBRL)エージェントは、トレーニング分布においてよく機能するが、テスト環境がシフトするとしばしば故障する。
視覚的MBRLでは、シフトが発生したことを認識することがより容易な部分であることが多い。
本研究では,罰則の策定,直接微調整,大域的残差補正,粗いゲーティングなど,変化に対応するいくつかの方法について検討する。
実験では,これらの手法は閉ループ制御を改善したり,分布内(ID)性能を損なうことはない。
これらの否定的な結果に基づき,JEPA-Indexed Local Expert Growthを提案する。
クラスタ固有の残留専門家が元のコントローラの上に局所的なアクション補正を追加するのに対して、このメソッドは問題インデックス化のみにフリーズされたJEPA表現を使用する。
ベースラインコントローラ自体は変更されていない。
ペア型ブートストラップ評価を用いて、より厳密なテストでは、元のナイーブ型は安定していないことがわかった。
対照的に、ハードペア変種は、ID性能を維持しながら、4つの評価されたシフト条件すべてに対して統計的に有意なOOD改善をもたらす。
学習した専門家は、同じシフトに再び遭遇した場合でも有用であり、完全なトレーニングを繰り返すのではなく、適応を漸進的な知識の成長と見なすことができる。
さらに,OODサブファミリ間のきめ細かい識別は表現によって制限されるのに対し,単純な密度モデルで自動ID拒否が可能であることを示す。
その結果, 分布変化下の視覚的MBRLでは, 環境の変化に注意するだけでなく, 変化が認識された後に適切な局所行動補正を適用することが主な課題であることがわかった。
関連論文リスト
- Mitigating the ID-OOD Tradeoff in Open-Set Test-Time Adaptation [52.620992698137236]
オープンセットテスト時間適応(OSTTA)は、新しい環境にモデルを適用するという課題に対処する。
本稿では,OSTTAにおけるエントロピーの限界をまず解析し,次に特徴ノルム等級を規制する角損失を導入する。
高いID分類性能を維持しながら強力なOOD検出を実現する。
論文 参考訳(メタデータ) (2026-04-02T04:00:57Z) - Online Bayesian Imbalanced Learning with Bregman-Calibrated Deep Networks [0.7106986689736825]
本報告では、クラス優先の仮定から確率比の推定を分離する原則的フレームワークであるOBIL(TextitOnline Bayesian Im Balanced Learning)を提案する。
我々のアプローチは、ブレグマンの発散と適切なスコアリングルールとの確立された接続に基づいて、そのような損失で訓練されたディープネットワークが後続確率推定を生成することを示す。
これらの確率比の推定は、クラス事前およびコスト構造における任意の変化の下でも有効であり、最適なベイズ決定のためのしきい値調整のみを必要とすることを証明している。
論文 参考訳(メタデータ) (2026-02-08T21:23:00Z) - Did Models Sufficient Learn? Attribution-Guided Training via Subset-Selected Counterfactual Augmentation [61.248535801314375]
Subset-Selected Counterfactual Augmentation (SS-CA)
我々は,モデル予測を選択的に変更可能な最小空間領域集合を識別するために,対実的LIMAを開発した。
実験により,SS-CAは分布内テストデータ(ID)の一般化を改善し,分布外ベンチマーク(OOD)において優れた性能を発揮することが示された。
論文 参考訳(メタデータ) (2025-11-15T08:39:22Z) - Federated Learning with Sample-level Client Drift Mitigation [15.248811557566128]
Federated Learningは、クライアント間のデータの不均一性によって、パフォーマンスが大幅に低下する。
本稿では,まず不均一性問題をサンプルレベルで緩和するFedBSSを提案する。
また,特徴分布とノイズラベルデータセット設定の効果的な結果を得た。
論文 参考訳(メタデータ) (2025-01-20T09:44:07Z) - Diagnosing and Rectifying Fake OOD Invariance: A Restructured Causal
Approach [51.012396632595554]
不変表現学習(IRL)は、不変因果的特徴から環境から切り離されたラベルへの予測を促進する。
最近の理論的結果は、IRLによって回復されたいくつかの因果的特徴は、訓練環境ではドメイン不変のふりをするが、目に見えない領域では失敗する。
本研究では,RS-SCMに関する条件付き相互情報に基づく手法を開発し,その効果を巧みに補正する。
論文 参考訳(メタデータ) (2023-12-15T12:58:05Z) - Distribution Mismatch Correction for Improved Robustness in Deep Neural
Networks [86.42889611784855]
正規化法は ノイズや入力の腐敗に関して 脆弱性を増大させる
本稿では,各層の活性化分布に適応する非教師なし非パラメトリック分布補正法を提案する。
実験により,提案手法は画像劣化の激しい影響を効果的に低減することを示した。
論文 参考訳(メタデータ) (2021-10-05T11:36:25Z) - Detecting Rewards Deterioration in Episodic Reinforcement Learning [63.49923393311052]
多くのRLアプリケーションでは、トレーニングが終了すると、エージェント性能の劣化をできるだけ早く検出することが不可欠である。
我々は,各エピソードにおける報酬が独立でもなく,同一に分散した,マルコフでもない,エピソード的枠組みを考察する。
平均シフトは、時間信号の劣化(報酬など)に対応する方法で定義し、最適な統計的パワーでこの問題の試行を導出する。
論文 参考訳(メタデータ) (2020-10-22T12:45:55Z) - Evaluating Prediction-Time Batch Normalization for Robustness under
Covariate Shift [81.74795324629712]
我々は予測時間バッチ正規化と呼び、共変量シフト時のモデル精度とキャリブレーションを大幅に改善する。
予測時間バッチ正規化は、既存の最先端アプローチに相補的な利点をもたらし、ロバスト性を向上させることを示します。
この手法は、事前トレーニングと併用して使用すると、さまざまな結果が得られるが、より自然なタイプのデータセットシフトでは、パフォーマンスが良くないようだ。
論文 参考訳(メタデータ) (2020-06-19T05:08:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。