論文の概要: Marionette: Predicting World States, Rendering Geometry, Painting Appearance
- arxiv url: http://arxiv.org/abs/2608.14530v1
- Date: Fri, 14 Aug 2026 17:48:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-17 20:14:29.461302
- Title: Marionette: Predicting World States, Rendering Geometry, Painting Appearance
- Title(参考訳): Marionette: 世界の予測、幾何学のレンダリング、絵画の外観
- Authors: Zian Meng, Zhen Li, Chuanhao Li, Qiang Li, Kaipeng Zhang,
- Abstract要約: われわれはこのアイデアを,対話型ゲームと明瞭なキャラクタを持つ世界モデルであるMarionetteとしてインスタント化する。
二段階自己回帰力学モデルは、明示的で解釈可能な276次元の3次元世界状態を予測する。
制御条件付きビデオ拡散観測モデルは、結果として得られる制御からフォトリアリスティックなRGB観測を合成する。
- 参考スコア(独自算出の注目度): 30.170848813370444
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Interactive game world models typically autoregress visual observations directly in pixel or latent space, forcing structured properties such as pose, geometry, and occlusion to be implicitly maintained by the same generative sequence. Over long horizons, errors in these latent world properties accumulate, making consistency and controllability fragile. We explicitly model the evolving world state, delegate exact geometric computation to a fixed, zero-parameter renderer, and leave the neural model to synthesize appearance. We instantiate this idea as Marionette, a world model for interactive games with articulated characters. First, a two-stage autoregressive dynamics model predicts an explicit and interpretable 276-dimensional 3D world state comprising multi-entity articulated skeletons, metric root trajectories, and rotations. Second, a zero-parameter graphics bridge converts the predicted state into pose-control videos, computing world-space geometry and occlusion in closed form. Third, a control-conditioned video-diffusion observation model synthesizes photorealistic RGB observations from the resulting structured controls. Our experiments establish two properties of Marionette. First, the predicted world state is directly controllable. Forcing a mismatched action stream changes root-aligned joint error by 31% across 48 held-out segments. Second, long-horizon behaviour is determined in the state, and can be repaired there. Left free, the two generated characters drift to 21.2 m apart (recorded sessions stay near 5 m) and a third of frames show ground penetration. Two rules imposed on the explicit state, a terrain collider and a separation cap, cut penetration by 66% and keep the pair engaged, with no change to the observation model. Routing appearance through the predicted state costs no fidelity we can detect, at an FVD of 831 against 799 for recorded pose.
- Abstract(参考訳): インタラクティブなゲームワールドモデルは、通常、ピクセルまたは潜在空間で直接視覚的観察を自動回帰し、ポーズ、幾何学、閉塞といった構造的特性を同じ生成配列によって暗黙的に維持することを強制する。
長い地平線の中で、これらの潜伏する世界の特性のエラーが蓄積され、一貫性と制御性は脆弱になる。
我々は、進化する世界の状態を明示的にモデル化し、正確な幾何計算を固定されたゼロパラメータレンダラーに委譲し、ニューラルモデルを残して外観を合成する。
われわれはこのアイデアを,対話型ゲームと対話型キャラクタを用いた世界モデルであるMarionetteとしてインスタンス化する。
まず、二段階自己回帰力学モデルにより、多関節関節骨格、計量根軌跡、回転を含む明示的で解釈可能な276次元3次元世界状態を予測する。
第2に、ゼロパラメータグラフィックスブリッジは、予測された状態をポーズ制御ビデオに変換し、世界空間の幾何学を計算し、クローズドフォームで閉塞する。
第3に、制御条件付きビデオ拡散観測モデルが、得られた構造制御から光現実性RGB観測を合成する。
我々の実験はマリオネットの2つの性質を確立した。
まず、予測された世界状態は直接制御可能である。
ミスマッチした動作ストリームを強制すると、48個の保持されたセグメントでルート整列の関節誤差が31%変化する。
第二に、長い水平行動は州で決定され、そこで修復することができる。
2つの生成した文字は21.2m離れ(記録されたセッションは5m近くに留まる)、フレームの3分の1は地中への侵入を示している。
明示的な状態に課された2つのルール、地形コライダーと分離キャップは、観測モデルを変更することなく、侵入を66%削減し、ペアを係留し続ける。
予測された状態の出現は、記録されたポーズに対して799対831のFVDで検出できる忠実さを伴わない。
関連論文リスト
- MASS: Multiplayer World Models with Authoritative Shared State [65.85526248184442]
MASS (Multiplayer world model with Authoritative Shared State) はマルチプレイヤーゲームアーキテクチャにインスパイアされている。
学習されたLogic Engineは、グローバルで権威のある型付きステートをジョイントアクションから前進させる。
学習されたレンダリングエンジンは、要求されたカメラに対して、独立して一貫したビューを生成する。
論文 参考訳(メタデータ) (2026-08-06T16:47:24Z) - StatePlay: State-Aware Game World Models for Mechanics-Consistent Generation [53.07918503798731]
StatePlayは、ビジュアルコンテンツとゲーム状態を予測する新しいステート対応ゲームワールドモデルであり、メカニクスと一貫性のある生成を促進する。
我々の研究は、状態認識型ゲームワールドモデリングの重要性を強調し、完全かつ機械的に忠実なゲーム生成に向けたピクセルレベルのリアリズムを超えて進歩している。
論文 参考訳(メタデータ) (2026-07-29T10:49:30Z) - Deform360: A Massive Multi-view Visuotactile Dataset for Deformable World Models [36.26785019314161]
Deform360は、198個の日常生活オブジェクト、1,980個の相互作用シーケンス、41個のサラウンドビューカメラとバイマンの触覚からの215時間以上の観測を特徴とする大規模なビゾタクティルデータセットである。
2次元映像モデルと3次元粒子モデルを比較し,現状の世界のモデルを評価する。
論文 参考訳(メタデータ) (2026-07-06T17:59:18Z) - Sensorimotor World Models: Perception for Action via Inverse Dynamics [59.121736411156384]
Inverse dynamics regularization で訓練されたエンド・ツー・エンドのセンサモレータ・ワールドモデルを導入する。
表現の崩壊を防ぎ、アクション整列表現を誘導する。
コンパクトで解釈可能な潜在空間を学習し、単純な2Dおよび3D制御タスク間の競合計画性能を実現する。
論文 参考訳(メタデータ) (2026-06-18T11:25:16Z) - RAYNOVA: Scale-Temporal Autoregressive World Modeling in Ray Space [51.441415833480505]
RAYNOVAは、二重因果自己回帰フレームワークを使用するシナリオを駆動するための多視点世界モデルである。
相対的なシャーカー線位置符号化に基づいて、ビュー、フレーム、スケールにまたがる等方的時間的表現を構築する。
論文 参考訳(メタデータ) (2026-02-24T08:41:40Z) - Walk through Paintings: Egocentric World Models from Internet Priors [65.30611174953958]
本稿では,エゴセントリック・ワールド・モデル(EgoWM)について述べる。
我々は、スクラッチからトレーニングするよりも、インターネット規模のビデオモデルのリッチワールドを再利用し、軽量なコンディショニング層を通じてモーターコマンドを注入する。
当社のアプローチは,3-DoF移動ロボットから25-DoFヒューマノイドまで,エボディメントやアクションスペースを自然に拡張する。
論文 参考訳(メタデータ) (2026-01-21T18:59:32Z) - Towards High-Consistency Embodied World Model with Multi-View Trajectory Videos [24.111891848073288]
身体的世界モデルは、視覚的な観察と行動を通じて物理的世界と予測し、相互作用することを目的としている。
MTV-Worldは正確なビジュモータ予測のためのマルチビュートラジェクトリ・ビデオ制御を導入した。
MTV-Worldは、複雑なデュアルアームシナリオにおける正確な制御実行と正確な物理的相互作用モデリングを実現する。
論文 参考訳(メタデータ) (2025-11-17T02:17:04Z) - DSG-World: Learning a 3D Gaussian World Model from Dual State Videos [14.213608866611784]
本稿では,Dual Stateの観測から3次元ガウス世界モデルを明示的に構築する,新しいエンドツーエンドフレームワークDSG-Worldを提案する。
提案手法は、二分割対応ガウス場を構築し、双方向の測光および意味的整合性を実現する。
論文 参考訳(メタデータ) (2025-06-05T16:33:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。