論文の概要: Predicting Closed-Loop Performance of Latent World Models: Offline Checkpoint Selection for MPC and Model-Based RL Under Non-Markovian Rewards in LunarLander
- arxiv url: http://arxiv.org/abs/2607.01736v1
- Date: Thu, 02 Jul 2026 05:46:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.687563
- Title: Predicting Closed-Loop Performance of Latent World Models: Offline Checkpoint Selection for MPC and Model-Based RL Under Non-Markovian Rewards in LunarLander
- Title(参考訳): 潜在世界モデルの閉ループ性能予測:LunarLanderにおける非マルコフ逆流下でのMPCおよびモデルベースRLのオフラインチェックポイント選択
- Abstract要約: 検証時間のみで学習した潜在世界モデルの下流クローズドループ性能を予測する方法について検討する。
最適制御理論から導かれた構造的検証時間診断の組をGymnasiumのLunarLander v3に適用する。
- 参考スコア(独自算出の注目度): 0.6581214715240989
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We study how to predict the downstream closed-loop performance of a learned latent world model from validation-time diagnostics alone. Choosing the right checkpoint from a world-model training run is difficult: validation loss and multi-step prediction RMSE keep improving long after closed-loop performance has collapsed. We present a suite of structural validation-time diagnostics drawn from optimal-control theory and apply them to Gymnasium's LunarLander v3, which features shaped rewards. We train an RSSM [5, 4] world model on it and treat per checkpoint CEM-MPC return as the oracle for closed-loop quality. By evaluating 40 metrics against this oracle, we find that the strongest single predictor is the Reward Observability Fraction (ROF), which measures the reward predictor's dependence on the observable subspace. We combine ROF with three structural regularizers into a single-number offline checkpoint selection score, the Composite Reward Observability Fraction (CROF). The CROF-selected world model trains a model-based A2C policy that beats a fairly evaluated model-free A2C baseline by ~24.5 return points while using ~65x fewer real-environment interactions, and the same world model also drives a strong zero-shot CEM-MPC policy. Code and data: https://github.com/nsmoly/LunarLander_RSSM.
- Abstract(参考訳): 検証時間のみで学習した潜在世界モデルの下流クローズドループ性能を予測する方法について検討する。
検証損失とマルチステップ予測 RMSE は閉ループ性能が低下した後も改善し続ける。
本稿では,最適制御理論から得られた構造的検証時間診断の組を,Gymnasium の LunarLander v3 に適用する。
我々はRSSM[5, 4]ワールドモデルをトレーニングし、チェックポイント毎のCEM-MPCリターンを閉ループ品質のオラクルとして扱う。
このオラクルに対して40のメトリクスを評価することで、最も強い単一の予測器は、観測可能な部分空間への報酬予測器の依存を測定するReward Observability Fraction (ROF)であることがわかった。
ROFを3つの構造正則化器と組み合わせて、単一数のオフラインチェックポイント選択スコア、Composite Reward Observability Fraction (CROF) を合成する。
CROF選択された世界モデルはモデルベースのA2Cポリシーを訓練し、モデルなしのA2Cベースラインを約24.5リターンポイントで打ち負かし、実際の環境相互作用を65倍少なくし、同じ世界モデルは強力なゼロショットCEM-MPCポリシーも推進する。
コードとデータ:https://github.com/nsmoly/LunarLander_RSSM。
関連論文リスト
- Beyond the Current Observation: Evaluating Multimodal Large Language Models in Controllable Non-Markov Games [69.57330692969543]
RNG-Benchは、過去の観測を再構築するベースモデルの能力を分離するために設計されたベンチマークスイートである。
RNG-Benchには2つの補完ゲームがある: マッチングペア(英語版) - 特定の場所でカードのIDを短期間明らかにする) と、エゴセントリックなビューを空間地図に統合する3D Maze である。
最も難しい構成では、約128Kのトークンと350のイメージ入力のコンテキストが必要であり、フロンティアMLLMによる飽和には程遠いままである。
論文 参考訳(メタデータ) (2026-06-17T17:59:34Z) - Reward Models Are Secretly Value Functions: Temporally Coherent Reward Modeling [0.68233044479196]
RLHFのリワードモデルは、応答の最終トークンのみを取得するように訓練される。
十分に訓練された報酬モデルの任意のトークンでの出力は、最終的な報酬の条件付き期待を表すべきです。
我々は、標準的なBradley-Terry損失の上に2つの正規化項を通してこの特性を誘導するテンポラリコヒーレント・リワード・モデリングを導入する。
論文 参考訳(メタデータ) (2026-04-24T19:49:56Z) - RK-MPC: Residual Koopman Model Predictive Control for Quadruped Locomotion in Offroad Environments [1.4610038284393168]
Residual Koopman MPC (RK-MPC) はデータ駆動型モデル予測制御フレームワークである。
RK-MPCは、昇降座標のデータから学習したコンパクトな線形残留予測器を備えた名目テンプレートモデルを強化する。
RK-MPCは、非構造化環境における四重項のデータ駆動予測制御のための実用的なハードウェア検証経路を提供する。
論文 参考訳(メタデータ) (2026-04-05T18:43:23Z) - Learning Ordinal Probabilistic Reward from Preferences [25.069054134899744]
確率的リワードモデル(PRM: Probabilistic Reward Model)を提案する。
提案手法では,報酬を決定論的スカラーとしてモデル化する代わりに,ランダム変数として扱い,各応答の品質の完全な確率分布を学習する。
OPRM上に構築したRerea Flooding Tuning(RgFT)と呼ばれるデータ効率のトレーニング戦略を提案する。
論文 参考訳(メタデータ) (2026-02-13T06:43:02Z) - Agentic World Modeling for 6G: Near-Real-Time Generative State-Space Reasoning [70.56067503630486]
第6世代(6G)インテリジェンスは、流動的なトークン予測ではなく、想像と選択の能力を校正している、と我々は主張する。
We showed that WM-MS3M cuts mean absolute error (MAE) by 1.69% vs MS3M with 32% less parameters and similar latency, and achieve a 35-80% lower root mean squared error (RMSE) than attention/hybrid baselines with 2.3-4.1x faster inference。
論文 参考訳(メタデータ) (2025-11-04T17:22:22Z) - One Model to Critique Them All: Rewarding Agentic Tool-Use via Efficient Reasoning [54.580646706013965]
リワードモデル(RM)は、大きな言語モデルと人間の嗜好の整合において重要な役割を果たす。
一般的なツール使用シナリオに適した軽量な生成型RMのファミリーであるToolRMを紹介する。
これらのモデルを構築するために,ルールベースのスコアリングと多次元サンプリングを用いたペアワイズ選好データを構築するパイプラインを提案する。
論文 参考訳(メタデータ) (2025-10-30T06:08:27Z) - ReasonFlux-PRM: Trajectory-Aware PRMs for Long Chain-of-Thought Reasoning in LLMs [75.72672339168092]
本稿では,新しいトラジェクトリ対応PRMであるReasonFlux-PRMを紹介し,トラジェクトリ応答型推論トレースの評価を行う。
ReasonFlux-PRMはステップレベルとトラジェクトリレベルの両方の監視機能を備えており、構造化された連鎖データと整合した微粒な報酬割り当てを可能にする。
得られたReasonFlux-PRM-7Bは、教師付き微調整で平均12.1%、強化学習で4.5%、テスト時間スケーリングで6.3%向上した。
論文 参考訳(メタデータ) (2025-06-23T17:59:02Z) - How to Evaluate Reward Models for RLHF [51.31240621943791]
我々は、RLHF(Reinforcement Learning from Human Feedback)を通して強力な言語モデルを生成する能力を定量化する報酬モデルのための新しいベンチマークを導入する。
我々は,プロキシタスクの報酬モデルを評価することにより,下流LLM性能の予測モデルを構築した。
大規模クラウドソースによる人選好プラットフォーム上でのエンドツーエンドのRLHF実験をローンチした。
論文 参考訳(メタデータ) (2024-10-18T21:38:21Z) - Post-hoc Reward Calibration: A Case Study on Length Bias [38.47276516266]
リワードモデル(RM)は、トレーニングデータに突発的な相関を利用してバイアスを発生させることができる。
これらのバイアスは、誤った出力ランキング、準最適モデル評価、望ましくない振る舞いの増幅につながる可能性がある。
本稿では、追加データやトレーニングを使わずにバイアスを修正するという課題に対処する。
論文 参考訳(メタデータ) (2024-09-25T22:30:42Z) - Towards Robust Model-Based Reinforcement Learning Against Adversarial Corruption [60.958746600254884]
本研究は、モデルベース強化学習(RL)における敵対的腐敗の課題に取り組む。
本稿では,MLE に対する不確実性重みとして全変量 (TV) に基づく情報比を利用する,汚損楽観的 MLE (CR-OMLE) アルゴリズムを提案する。
我々は、重み付け手法をオフライン設定にまで拡張し、汚損性悲観的MLE (CR-PMLE) というアルゴリズムを提案する。
論文 参考訳(メタデータ) (2024-02-14T07:27:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。