論文の概要: Low-Rank Dynamics-Effective Latent Carriers for Counterfactual Rollout in Learned World Models
- arxiv url: http://arxiv.org/abs/2608.15156v2
- Date: Wed, 19 Aug 2026 10:02:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-20 15:48:19.524934
- Title: Low-Rank Dynamics-Effective Latent Carriers for Counterfactual Rollout in Learned World Models
- Title(参考訳): 学習世界モデルにおける非現実的ロールアウトのための低ランクダイナミクス効果潜航機
- Authors: Yang Liu, Yuming Chen,
- Abstract要約: 制御された2物体2次元衝突環境において,192次元隠れ状態の繰り返し世界モデルについて検討した。
我々は、モデルの将来的な計算を持続的かつターゲット固有の方法で変更する介入を記述するために、ダイナミックス効果を使用します。
- 参考スコア(独自算出の注目度): 6.556150313826966
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: World models may predict the future without making clear which parts of their hidden state actually drive those predictions. We ask whether a small, directly addressable hidden-state change can place a learned world model on the intended counterfactual trajectory and then let the model continue that future on its own. We study a recurrent world model with a 192-dimensional hidden state in a controlled two-object, two-dimensional collision environment. For a bounded family of local velocity edits, we first verify that the model can natively represent and roll out the edited future. We then construct candidate low-rank carriers from training-only factual-to-counterfactual hidden differences and learn a map from the factual state and requested edit to carrier coefficients. On the registered rank grid, rank 4 is the smallest tested rank that satisfies the full development-panel criteria. A single rank-4 patch at the anchor is sufficient to redirect a 12-step autonomous rollout, with no future observations, teacher forcing, or repeated correction. The frozen procedure satisfies the preregistered replication rule across independently trained checkpoints and remains usable across nearby intervention times. Random equal-norm, wrong-object, and wrong-time controls do not explain the effect. A position-edit stress test provides a negative contrast: the intended position patch can pass the raw rollout criteria, but no-patch and random controls can pass the same criteria, and wrong-object specificity is not established. Thus, successful editing alone is not enough. We use dynamics-effective to describe an intervention that changes the model's future computation in a sustained and target-specific way under autonomous rollout. The rank-4 result identifies a compact intervention interface for the tested velocity-edit family, not a closed four-dimensional state or an intrinsic state dimension.
- Abstract(参考訳): 世界モデルは、隠れた状態のどの部分が実際にこれらの予測を駆動しているかを明確にすることなく、未来を予測することができる。
我々は、小さな、直接対応可能な隠れ状態の変化が、意図した反事実軌道に学習された世界モデルを置くことができるかどうかを問う。
制御された2物体2次元衝突環境において,192次元隠れ状態の繰り返し世界モデルについて検討した。
局所的なベロシティ編集の限定されたファミリに対して、まず、モデルが編集された未来をネイティブに表現し、ロールアウトできることを検証する。
そこで,本研究では,訓練のみによる実数と実数に隠れた差分から候補の低ランクキャリアを構築し,実数状態からマップを学習し,キャリア係数の編集を依頼する。
登録されたランクグリッドでは、ランク4は完全な開発パネル基準を満たす最小のランクである。
アンカーの1ランク4パッチは12ステップの自律ロールアウトをリダイレクトするのに十分であり、将来の観察、教師の強制、修正を繰り返しない。
凍結された手順は、独立に訓練されたチェックポイントにまたがる事前登録された複製ルールを満たす。
ランダムな等ノルム、間違った対象、間違った時間制御は効果を説明できない。
意図された位置パッチは生のロールアウト基準をパスできるが、非パッチとランダム制御は同じ基準をパスでき、間違った対象の特異性は確立されない。
したがって、編集が成功しただけでは不十分である。
我々は、自律的なロールアウトの下で、持続的でターゲット固有の方法でモデルの将来的な計算を変更する介入を記述するために、ダイナミックス効果を使用します。
ランク4の結果は、クローズドな4次元状態や本質的な状態次元ではなく、テストされたベロシティ・エジット族に対するコンパクトな介入インターフェースを識別する。
関連論文リスト
- Robust Ambiguity Detection (RAD) From Model- and Feature-Space Consistency [6.07595146080737]
ロバストなあいまいさ検出(RAD)フレームワークは、2つの相補的な指標を用いて予測曖昧さを定量化する。
RADは、体系的に制御されたオーバーラップを伴う合成データセットと、いくつかの実世界のデータセットで評価される。
論文 参考訳(メタデータ) (2026-08-12T01:13:33Z) - A Control Theory of Predictability in Latent World Models [39.22646915328561]
現在のプラクティスでは、トレーニングとモデル選択の目的として、ホールトアウトデータに対する単一または複数ステップのロールアウト損失である予測エラーを採用しています。
この仮定は構造上の理由から信頼できないことを示す。
プランナーはトレーニング分布についてモデルに問い合わせるのではなく、その候補となるアクションが到達し、一般にデータ多様体を残します。
論文 参考訳(メタデータ) (2026-07-11T15:42:26Z) - Sensorimotor World Models: Perception for Action via Inverse Dynamics [59.121736411156384]
Inverse dynamics regularization で訓練されたエンド・ツー・エンドのセンサモレータ・ワールドモデルを導入する。
表現の崩壊を防ぎ、アクション整列表現を誘導する。
コンパクトで解釈可能な潜在空間を学習し、単純な2Dおよび3D制御タスク間の競合計画性能を実現する。
論文 参考訳(メタデータ) (2026-06-18T11:25:16Z) - CIAware-Bench: Benchmarking Control Intervention Awareness Across Frontier LLMs [100.38986535324284]
我々は、フロンティアモデル全体でのtextbfcontrol textbfintervention (CI) の認識を測定するベンチマークである textbfCIAware-Bench を紹介する。
CIAware-Benchは、モデルが自身の軌跡を制御介入によって修正されたものと区別できるかどうかをテストする。
論文 参考訳(メタデータ) (2026-06-09T16:24:16Z) - Silent Commitment Failure in Instruction-Tuned Language Models: Evidence of Governability Divergence Across Architectures [0.0]
我々は、モデルのエラーが出力コミット前に検出可能で、一度検出されると修正できる程度、統治性を導入します。
ベンチマーク精度は支配可能性を予測するものではなく、補正能力は検出と独立に異なり、同一のガバナンス足場はモデル間で逆の効果をもたらす。
本稿では,モデルとタスクの組み合わせをGovernable, Monitor Only, Steer Blind, Ungovernableの4つに分類する。
論文 参考訳(メタデータ) (2026-03-22T21:50:28Z) - CorrectionPlanner: Self-Correction Planner with Reinforcement Learning in Autonomous Driving [55.88697462014118]
CorrectionPlannerは自己補正を備えた自動回帰プランナーである。
Waymaxでは衝突率を20%以上削減し、nuPlanでは最先端の計画スコアを達成している。
論文 参考訳(メタデータ) (2026-03-16T18:03:21Z) - Real-Time Model Checking for Closed-Loop Robot Reactive Planning [0.0]
本稿では,実自律ロボットにおいて,リアルタイムなマルチステップ計画と障害物回避を実現するモデル検査の新たな応用を提案する。
我々は,生物エージェントに見られる「中核的」知識と注意に基づいて,その場で計画を生成する,小型で汎用的なモデル検査アルゴリズムを開発した。
当社のアプローチは, 局所環境の障害に対処するために発生する一時制御系をチェーン化することに基づいている。
論文 参考訳(メタデータ) (2025-08-26T16:49:30Z) - Mitigating Covariate Shift in Imitation Learning for Autonomous Vehicles Using Latent Space Generative World Models [60.87795376541144]
World Model(ワールドモデル)は、エージェントの次の状態を予測できるニューラルネットワークである。
エンド・ツー・エンドのトレーニングでは、人間のデモで観察された状態と整合してエラーから回復する方法を学ぶ。
クローズドループ試験における先行技術に有意な改善がみられた定性的,定量的な結果を示す。
論文 参考訳(メタデータ) (2024-09-25T06:48:25Z) - Model Checking for Closed-Loop Robot Reactive Planning [0.0]
モデル検査を用いて、ディファレンシャルドライブホイールロボットの多段階計画を作成することにより、即時危険を回避できることを示す。
簡単な生物エージェントのエゴセントリックな反応を反映した,小型で汎用的なモデル検査アルゴリズムを用いて,リアルタイムで計画を生成する。
論文 参考訳(メタデータ) (2023-11-16T11:02:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。