論文の概要: Learning from World Feedback: Why Model Uncertainty Fails as a Risk Signal in Model-Based RL
- arxiv url: http://arxiv.org/abs/2607.16591v1
- Date: Sat, 18 Jul 2026 02:17:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.192996
- Title: Learning from World Feedback: Why Model Uncertainty Fails as a Risk Signal in Model-Based RL
- Title(参考訳): 世界からのフィードバックから学ぶ:モデルベースRLのリスク信号としてモデル不確かさが機能しない理由
- Authors: Zhaohui Wang,
- Abstract要約: 安全なモデルベースの制御でこの位置をインスタンス化し、3つの具体的な設計原則に分解します。
モデル内部のプロキシを3つのワールドフィードバック信号に置き換えることで、ワールドモデルやプランナーを再トレーニングすることなく、衝突を1-14%に削減できる。
- 参考スコア(独自算出の注目度): 3.556355987197792
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The RLxF programme argues that learning signals should come from world feedback rather than from internal model proxies. We instantiate this position in safe model-based control and distil it into three concrete design principles. Empirically, across four world-model architectures spanning a 2x MSE range, MPC planning is statistically equivalent (TOST, n=200), and dynamics-based uncertainty penalties increase collision rates from 26% to 34%: the standard MBRL safety proxy is anti-correlated with safety in this regime. Replacing the model-internal proxy with three world-feedback signals (a sensor-derived margin via minimum lidar, a temporal signal via time-to-collision, and an outcome-supervised feedback model g_psi trained on prior collision labels, structurally analogous to outcome-trained reward models in RLHF) reduces collisions to 1-14% without retraining the world model or the planner. The mechanism is structural: model uncertainty has support over state-prediction space, whereas task risk has support over constraint boundaries, with empirical correlation r < 0.15. From this we extract three RLxF principles (ground risk in world outcomes, validate proxies before deployment, and substitute outcome-trained feedback models when direct world signals are unavailable) and argue they apply equally to model-based control and to verifier-based or RLHF approaches in LLM alignment.
- Abstract(参考訳): RLxFプログラムは、学習信号は内部モデルプロキシからではなく、世界からのフィードバックから来るべきだと主張している。
安全なモデルベースの制御でこの位置をインスタンス化し、3つの具体的な設計原則に分解します。
実証的には、2x MSEの範囲にまたがる4つの世界モデルアーキテクチャにおいて、MPCプランニングは統計的に等価であり(TOST, n=200)、ダイナミックスに基づく不確実性ペナルティは衝突率を26%から34%に引き上げる。
モデル内プロキシを3つの世界フィードバック信号(最小ライダーによるセンサ由来マージン、時間対衝突による時間信号、RLHFにおける結果学習報酬モデルと構造的に類似した事前衝突ラベルで訓練された結果監視フィードバックモデルg_psi)で置き換えることで、世界モデルやプランナーをトレーニングすることなく、衝突を1-14%に削減する。
モデルの不確実性は状態予測空間よりもサポートされ、一方タスクリスクは制約境界よりもサポートされ、経験的相関 r < 0.15 である。
このことから、3つのRLxF原則(世界結果の地上リスク、展開前のプロキシの検証、直接世界信号が利用できない場合の結果訓練されたフィードバックモデル置換)を抽出し、LLMアライメントにおけるモデルベース制御や検証者ベースのRLHFアプローチにも等しく適用できると主張している。
関連論文リスト
- Self-Evolving World Models for LLM Agent Planning [72.99782619992361]
我々はWorldEvolverを紹介した。WorldEvolverは、ダウンストリームエージェントとすべてのモデルパラメータを凍結したまま、デプロイメント時間コンテキストを更新する自己進化型ワールドモデルフレームワークである。
WorldEvolverは3つのバックボーンで最高の予測精度を達成し、下流エージェントの成功率で他のワールドモデルベースラインを導く。
論文 参考訳(メタデータ) (2026-06-29T17:58:43Z) - PROWL: Prioritized Regret-Driven Optimization for World Model Learning [20.10187986360715]
我々は,拡散に基づく世界モデルの高次軌道を公開するための政策を訓練する,KL制約の逆行カリキュラムを導入する。
提案手法をMineRLフレームワークで実装し, 既設のアウト・オブ・ディストリビューション・トラジェクトリで評価する。
論文 参考訳(メタデータ) (2026-05-11T14:24:19Z) - FedTrident: Resilient Road Condition Classification Against Poisoning Attacks in Federated Learning [16.871281029100313]
FLはITS、特にカメラベースの道路条件分類(RCC)の変換パラダイムとして登場した。
RCCは敵に対してTLFA(Targeted Label-Flipping Attacks)を起動するシステムを公開する
我々は,TLFAを効果的に抑制できるFedTridentを提案する。
論文 参考訳(メタデータ) (2026-03-19T16:26:13Z) - Response-Aware Risk-Constrained Control Barrier Function With Application to Vehicles [0.0]
本稿では,車両の動的安全境界制御のための応答認識型リスク制約制御バリア関数に基づく統合制御フレームワークを提案する。
このフレームワークは、制御勾配の基準方向を提供するために、名目力学と直接車体応答を融合する。
また、従来の決定論的安全制約をバリア関数誘導体のテールリスクに関する確率論的制約に再構成する。
論文 参考訳(メタデータ) (2026-03-13T02:38:17Z) - AD-R1: Closed-Loop Reinforcement Learning for End-to-End Autonomous Driving with Impartial World Models [75.214287449744]
我々は,Impartial World Modelを中心に構築されたポストトレーニング政策改善のためのフレームワークを紹介する。
私たちの主な貢献は、このモデルに危険について正直であることを教えることです。
大規模な実験を通じて、我々のモデルは失敗を予測する上で、ベースラインを著しく上回っていることを実証する。
論文 参考訳(メタデータ) (2025-11-25T13:57:24Z) - Agentic World Modeling for 6G: Near-Real-Time Generative State-Space Reasoning [70.56067503630486]
第6世代(6G)インテリジェンスは、流動的なトークン予測ではなく、想像と選択の能力を校正している、と我々は主張する。
We showed that WM-MS3M cuts mean absolute error (MAE) by 1.69% vs MS3M with 32% less parameters and similar latency, and achieve a 35-80% lower root mean squared error (RMSE) than attention/hybrid baselines with 2.3-4.1x faster inference。
論文 参考訳(メタデータ) (2025-11-04T17:22:22Z) - Offline Robotic World Model: Learning Robotic Policies without a Physics Simulator [50.191655141020505]
強化学習(Reinforcement Learning, RL)は、ロボット制御において目覚ましい能力を示してきたが、高いサンプルの複雑さ、安全性の懸念、そしてシム・トゥ・リアルのギャップのため、依然として困難である。
物理シミュレータに頼らずに政策学習を改善するために不確実性を明示的に推定するモデルベースアプローチであるオフラインロボット世界モデル(RWM-O)を導入する。
論文 参考訳(メタデータ) (2025-04-23T12:58:15Z) - SafeAMC: Adversarial training for robust modulation recognition models [53.391095789289736]
通信システムには、Deep Neural Networks(DNN)モデルに依存する変調認識など、多くのタスクがある。
これらのモデルは、逆方向の摂動、すなわち、誤分類を引き起こすために作られた知覚不能な付加音に影響を受けやすいことが示されている。
本稿では,自動変調認識モデルのロバスト性を高めるために,逆方向の摂動を伴うモデルを微調整する逆方向トレーニングを提案する。
論文 参考訳(メタデータ) (2021-05-28T11:29:04Z) - Trust but Verify: Assigning Prediction Credibility by Counterfactual
Constrained Learning [123.3472310767721]
予測信頼性尺度は統計学と機械学習において基本的なものである。
これらの措置は、実際に使用される多種多様なモデルを考慮に入れるべきである。
この研究で開発されたフレームワークは、リスクフィットのトレードオフとして信頼性を表現している。
論文 参考訳(メタデータ) (2020-11-24T19:52:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。