論文の概要: Supervise What Decides Success: Criterion-Aligned Auxiliary Losses for Latent World-Model Planning
- arxiv url: http://arxiv.org/abs/2610.01224v1
- Date: Thu, 01 Oct 2026 07:27:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.966097
- Title: Supervise What Decides Success: Criterion-Aligned Auxiliary Losses for Latent World-Model Planning
- Title(参考訳): 遅れた世界モデル計画のための基準付き補助的損失
- Abstract要約: 本稿では,学習目標として成功基準量を用いる補助的損失を提案する。
トレーニングターゲットとして直接機能できることを示します。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Latent world models plan by scoring candidate action sequences with distances in latent space. However, task success is judged by physical quantities, which we call the success-criterion quantities. In all four latent world models we examine, the end-effector position is encoded in the latent state with an error larger than the success criterion allows. Such a latent state cannot separate successful candidates from failing ones. We propose an auxiliary loss that uses success-criterion quantities as training targets, whereas existing latent world models take them only as inputs. During training, a linear head on the encoder and predictor outputs regresses the success-criterion quantities, and the regression error is added to the training loss. The head is discarded after training, so the model, its cost, and its inputs at test time are unchanged. This loss alone improves the success rate on PushT and cube by 3.5% and 3.4% (absolute), respectively, and both improvements are statistically significant. A success criterion thus specifies what a world model must retain in its latent state, and we show that it can serve directly as a training target.
- Abstract(参考訳): ラテントワールドモデルは、ラテント空間内の距離で候補アクションシーケンスをスコアリングすることで計画する。
しかし、タスクの成功は、成功基準量と呼ばれる物理量によって判断される。
検証した4つの潜在世界モデルにおいて、エンドエフェクタ位置は、成功基準よりも大きい誤差で潜時状態に符号化される。
このような潜伏状態は、成功した候補と失敗した候補を区別することはできない。
本稿では,学習目標として成功基準量を用いる補助的損失を提案するが,既存の潜在世界モデルはそれらを入力としてのみ扱う。
訓練中、エンコーダ及び予測器の線形ヘッドは、成功基準量の回帰を出力し、トレーニング損失に回帰誤差を付加する。
ヘッドはトレーニング後に破棄されるため、モデル、コスト、テスト時の入力は変更されない。
この損失だけでPushTと立方体の成功率は3.5%と3.4%(絶対)改善され、どちらも統計的に有意である。
したがって、成功基準は、世界モデルが潜伏状態に保持しなければならないものを特定し、トレーニングターゲットとして直接機能できることを示す。
関連論文リスト
- Learning Counterfactual World Models for Embodied Reasoning under Partial Observability [0.562873332680314]
世界モデルは予測力学を一度学習し、推論し、計画し、行動することを約束します。
このようなモデルの下の表現は、大規模ビデオ、インタラクション、マルチモーダルコーパスで事前訓練されている。
モデルは視覚的に妥当な未来を予測し、異なる行動結果の介入を区別できない。
論文 参考訳(メタデータ) (2026-09-05T02:56:47Z) - VIScore: Diagnosing Planning-Relevant Quality in Latent World Models [21.894781659564817]
潜在空間を等方性ガウス分布に規制することは、世界モデル計画のための安定で情報に最適化された景観を提供する。
SIGReg と VISReg の2つの正規化損失関数を同じ分布対象の異なる性質で比較して検討する。
SIGRegと比較すると、VISRegは中心、スケール、形状の正規化の重みを制御できる柔軟性が高く、バッチサイズが大きいほど分布近似が微妙になる。
符号化された予測器の到達性とキャパシティを定量化する指標であるVeracity-Influence-Sobriety score (VIScore)を提案する。
論文 参考訳(メタデータ) (2026-08-11T17:34:10Z) - The World Model Remembers, the Actor Forgets: Dream Rehearsal for Continual Model-Based RL [0.0]
強化学習エージェントは、タスクシーケンスでトレーニングされたときに破滅的に忘れる。
我々は,この方式を忘れることはチャネルの問題であり,記憶の問題ではないことを示した。
論文 参考訳(メタデータ) (2026-07-22T04:46:49Z) - Foresight Residual RL for Long-Horizon Robot Manipulation with Vision-Language-Action Models [32.14222486099161]
VLA(Vision-Language-Action)ポリシーは、強力な汎用的な操作先を提供するが、厳密で接触に富んだアセンブリでは失敗することが多い。
凍結VLA基本方針に対する残留強化学習において,この障害モードを示す。
本稿では,各サブタスクのスパース成功報酬をオフライン推定フォレスト値で加算することにより,ハンドオフ品質を最適化するResidual RLを提案する。
論文 参考訳(メタデータ) (2026-07-17T21:00:28Z) - DenseReward: Dense Reward Learning via Failure Synthesis for Robotic Manipulation [67.08835970838996]
強化学習は模倣学習の限界を超えてロボットポリシーを改善するための大きな約束である。
2つの重要な課題は、さまざまな障害データを大規模に取得し、スパース軌道レベルの成功ラベルを超えて、きめ細かい報酬信号を取得することである。
両課題に対処する高密度ロボット報酬モデルであるDenseRewardを紹介した。
論文 参考訳(メタデータ) (2026-07-14T17:59:29Z) - DreamAvoid: Critical-Phase Test-Time Dreaming to Avoid Failures in VLA Policies [65.27025563507961]
本稿では,ビジョン・ランゲージ・アクション(VLA)モデルのためのクリティカルフェーズテストタイムドリームフレームワークであるDreamAvoidを提案する。
また、自律的な境界学習パラダイムを導入し、成功と失敗の微妙な境界に対するシステムの理解を深める。
その結果、DreamAvoidは失敗を効果的に回避し、全体的なタスク成功率を改善することができた。
論文 参考訳(メタデータ) (2026-05-12T08:27:16Z) - Train for Truth, Keep the Skills: Binary Retrieval-Augmented Reward Mitigates Hallucinations [103.16279860448874]
新たな二分探索強化報酬(RAR)を用いたオンライン強化学習手法を提案する。
オープンエンド世代では、バイナリRARは幻覚率を39.3%減少させる。
短い形式の質問応答では、モデルは、パラメトリック知識の不足に直面した時に、戦略的に"I don't know"を出力して、控えめに学習する。
論文 参考訳(メタデータ) (2025-10-20T16:45:43Z) - The Perils of Optimizing Learned Reward Functions: Low Training Error Does Not Guarantee Low Regret [64.04721528586747]
報奨モデルの十分に低いテスト誤差は、最悪の場合の後悔を確実にすることを示す。
次に、ポリシー正則化技術を用いても、同様の問題が持続することを示す。
論文 参考訳(メタデータ) (2024-06-22T06:43:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。