論文の概要: Programmable World Model
- arxiv url: http://arxiv.org/abs/2609.10540v1
- Date: Wed, 09 Sep 2026 17:59:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:09.144049
- Title: Programmable World Model
- Title(参考訳): プログラマブルワールドモデル
- Abstract要約: 本稿では、視覚的観察生成から世界状態の進化を分離するフレームワークであるProgrammable World Modelを紹介する。
エージェントは自然言語の命令をエンティティの状態と状態遷移規則を指定する実行可能なプログラムに変換する。
軽量エンジンはこれらのプログラムを実行し、明示的で永続的な世界状態を更新し維持する。
- 参考スコア(独自算出の注目度): 37.43654073749753
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent video world models generate increasingly realistic and interactive visual experiences, yet lack reliable mechanisms for maintaining persistent world state and enforcing programmable rules over extended interactions. We introduce Programmable World Model, a framework that decouples world-state evolution from visual observation generation. An agent translates natural-language instructions into executable programs that specify entity states and state-transition rules, enabling direct control over individual entities and their interactions. A lightweight engine executes these programs to update and maintain an explicit, persistent global world state, including off-screen entities and non-visual attributes. To connect world state with visual generation, we introduce state-augmented 3D oriented bounding boxes (OBBs) as an intermediate representation. This representation, together with the target camera trajectory, is deterministically compiled into pixel-aligned spatiotemporal conditioning signals for a pretrained video model serving as the generative renderer. This design allows users to create playable games with predefined mechanics, direct control over individual entities, and persistent world state throughout gameplay. We further introduce CombatStateBench, a benchmark for evaluating programmable world models. On CombatStateBench, our method achieves 94% Count Accuracy and 98% State Accuracy, substantially outperforming existing interactive video world models while supporting coherent long-horizon generation. These results demonstrate the effectiveness of separating explicit state evolution from generative rendering for building persistent, programmable worlds.
- Abstract(参考訳): 最近のビデオワールドモデルは、ますます現実的でインタラクティブな視覚体験を生み出すが、永続的な世界状態を維持するための信頼性のあるメカニズムが欠如しており、拡張された相互作用に対してプログラム可能なルールを強制している。
本稿では、視覚的観察生成から世界状態の進化を分離するフレームワークであるProgrammable World Modelを紹介する。
エージェントは自然言語命令を、エンティティの状態と状態遷移規則を指定する実行可能なプログラムに変換し、個々のエンティティとその相互作用を直接制御できる。
軽量エンジンはこれらのプログラムを実行し、オフスクリーンエンティティや非視覚属性を含む、明示的で永続的なグローバルな世界状態を更新し維持する。
本研究では,世界状態と視覚的生成を結びつけるために,状態拡張型3次元配向ボックス(OBB)を中間表現として導入する。
この表現は、対象のカメラ軌跡とともに、生成レンダラーとして機能する予め訓練されたビデオモデルに対して、画素整列時空間条件信号に決定的にコンパイルされる。
このデザインでは、事前に定義されたメカニクス、個々のエンティティの直接制御、ゲームプレイを通して永続的な世界状態を備えたプレイ可能なゲームを作成することができる。
プログラム可能な世界モデルを評価するベンチマークであるCombatStateBenchについても紹介する。
CombatStateBenchでは,94%のカウント精度と98%のステート精度を実現し,コヒーレントなロングホライゾン生成をサポートしながら,既存のインタラクティブなビデオワールドモデルを大幅に上回っている。
これらの結果は、持続的でプログラム可能な世界を構築するための生成的レンダリングから、明示的な状態進化を分離する効果を示す。
関連論文リスト
- Code World Model: Coding Agent as World Brain [51.31807545747191]
私たちは、世界進化と視覚的実現を分離するフレームワークであるCode World Modelを紹介します。
コーディングエージェントは世界脳として機能し、出来事とその結果について推論する。
実行可能状態と視覚的生成を結びつけるために,フレームの時間的制約をプロキシビデオにエンコードするプロキシ表現を導入する。
論文 参考訳(メタデータ) (2026-08-26T15:37:33Z) - PlayWorld: Benchmarking World Models with Agent Players over Long-Horizon Objectives [86.3073067035531]
ビデオワールドモデルは、現在の観察とユーザーアクションに基づいて、将来の状態をシミュレートする。
近年のシステムでは、長いシーケンス上での映像の一貫性とアクション制御性が顕著に示されている。
しかし、これらのインタラクティブモデルを比較することは依然として困難だ。
我々はマルチモーダル・エージェント・プレイヤーを用いて、特定の長距離目標に向けて世界モデルと対話する。
論文 参考訳(メタデータ) (2026-08-13T17:59:30Z) - Streaming Multi-Agent Autoregressive Diffusion Model with World State Registers [50.3000377325823]
We present WorldWeaver, a streaming multi-agent video diffusion model that a rollout with cross-agent world state registers。
これらのレジスタには、個々のエージェントの状態、鳥眼ビューを含むグローバルステートビュー、シーンテキストの監視信号が配置されている。
2エージェントのMinecraftビデオ生成の実験では、明示的な世界状態モデリングが論理的一貫性と生成品質を向上させることが示されている。
論文 参考訳(メタデータ) (2026-07-23T17:59:58Z) - LiveWorld: Simulating Out-of-Sight Dynamics in Generative Video World Models [32.92934803081681]
近年の世代別ビデオワールドモデルは、視覚環境の進化をシミュレートすることを目的としており、観察者はカメラ制御によってシーンをインタラクティブに探索することができる。
彼らは、世界は観察者の視野内でしか進化しないと暗黙的に仮定している。
オブジェクトがオブザーバの視点を離れると、その状態はメモリ内で"凍結"され、その後同じ領域を再考しても、その間に発生すべき出来事を反映できないことがしばしばある。
永続的な世界進化をサポートするために,ビデオワールドモデルを拡張する新しいフレームワークであるLiveWorldを提案する。
論文 参考訳(メタデータ) (2026-03-07T10:31:39Z) - WorldLens: Full-Spectrum Evaluations of Driving World Models in Real World [100.68103378427567]
エージェントは現実的な4D駆動環境を合成し、説得力があるように見えるが、物理的または行動的に失敗することが多い。
モデルがどのように構築され、理解され、その生成された世界の中でどのように振る舞うかを評価するフルスペクトルベンチマークであるWorldLensを紹介します。
さらに、数値的なスコアとテキストの合理性を備えた人間の注釈付きビデオの大規模データセット WorldLens-26K を構築し、WorldLens-Agent を開発した。
論文 参考訳(メタデータ) (2025-12-11T18:59:58Z) - Simulating the Visual World with Artificial Intelligence: A Roadmap [48.64639618440864]
ビデオ生成は、視覚的に魅力的なクリップを生成するものから、インタラクションをサポートし、物理的な可視性を維持する仮想環境を構築するものへとシフトしている。
この調査は、この進化の体系的な概要を提供し、現代のビデオ基盤モデルを2つのコアコンポーネントの組み合わせとして概念化した。
4世代にわたる映像生成の進展を追究し,本質的な物理的妥当性を具現化した映像生成モデルを構築した。
論文 参考訳(メタデータ) (2025-11-11T18:59:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。