論文の概要: Code Plans, Diffusion Renders: Open-Ended Generative World Modeling
- arxiv url: http://arxiv.org/abs/2609.26458v1
- Date: Tue, 22 Sep 2026 14:12:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-24 01:05:39.685149
- Title: Code Plans, Diffusion Renders: Open-Ended Generative World Modeling
- Title(参考訳): コードプラン,拡散レンダ - オープンな生成的世界モデリング
- Abstract要約: 我々は世界モデリングの新しいパラダイムである textbfCoDeR を紹介する。
本システムは,コードによる実行可能世界を明示的に構築し,映像生成モデルを用いて視覚的実現を行う。
- 参考スコア(独自算出の注目度): 82.36042129562516
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We introduce \textbf{CoDeR}, a new paradigm for world modeling. Unlike existing video world models that implicitly represent world dynamics through visual observations, our system explicitly constructs an executable world with code and employs video generation models for visual realization. Specifically, we coordinate five complementary roles to translate high-level concepts into structured world rules, executable dynamics, and perceptual observations. This design enables \textit{long-term memory}, \textit{open-ended interactions}, \textit{autonomous world evolution}, and \textit{multi-agent scenarios}, where multiple entities can act, interact, and evolve persistently beyond the current observation. Extensive experiments demonstrate that our framework substantially extends the capabilities of existing world models, enabling long-term memory, open-ended interactions, autonomous evolution, and persistent multi-agent dynamics, while achieving state-of-the-art performance across multiple evaluation settings. Code and model weights will be made publicly available. Project Page: \href{https://becauseimbatman0.github.io/CoDeR}{CoDeR}.
- Abstract(参考訳): 我々は世界モデリングの新しいパラダイムである \textbf{CoDeR} を紹介する。
視覚的観察を通して世界ダイナミクスを暗黙的に表現する既存のビデオワールドモデルとは異なり,本システムはコードによる実行可能世界を明示的に構築し,映像生成モデルを用いて視覚的実現を行う。
具体的には、高レベルの概念を構造化世界ルール、実行可能なダイナミクス、知覚観察に変換するために、5つの補完的な役割を協調する。
この設計により、複数のエンティティが動作し、相互作用し、現在の観察を超えて永続的に進化する、 \textit{open-ended interaction}、 \textit{autonomous world evolution}、 \textit{multi-agent scenarios} が実現される。
大規模な実験により、我々のフレームワークは既存の世界モデルの能力を大幅に拡張し、長期記憶、オープンエンドインタラクション、自律的進化、永続的マルチエージェントダイナミクスを可能にしつつ、複数の評価設定をまたいで最先端のパフォーマンスを実現している。
コードとモデルの重み付けは公開されます。
プロジェクトページ: \href{https://becauseimbatman0.github.io/CoDeR}{CoDeR}
関連論文リスト
- Code World Model: Coding Agent as World Brain [51.31807545747191]
私たちは、世界進化と視覚的実現を分離するフレームワークであるCode World Modelを紹介します。
コーディングエージェントは世界脳として機能し、出来事とその結果について推論する。
実行可能状態と視覚的生成を結びつけるために,フレームの時間的制約をプロキシビデオにエンコードするプロキシ表現を導入する。
論文 参考訳(メタデータ) (2026-08-26T15:37:33Z) - AlayaWorld: Long-Horizon and Playable Video World Generation [36.52656377442462]
インタラクティブな生成世界を構築するためのフルスタックのオープンソースフレームワークである textbfAlayaWorld を提示する。
AlayaWorldはオープンなリアルタイムインタラクションを可能にし、ユーザーは自由に戦闘、スペルキャスティング、モンスター呼び出しなどの多様なアクションを操作できる。
論文 参考訳(メタデータ) (2026-07-07T13:59:57Z) - WorldBagel: Uncovering the Power of Unified Multimodal Models for Vision-Language-Action-World Modeling [53.14409745466386]
世界モデルは、知覚、推論、行動をサポートする方法で環境力学を捉えることを目的としている。
我々は,現代のマルチモーダル統一モデルであるBAGEL上に構築された統一VLAWフレームワークであるtextttWorldBagelを紹介した。
textttWorldBagelは、タスク固有の代替品を一貫して上回り、より構造化され、視覚的および言語的コンテキストにセマンティックに整合したアクション表現を学ぶ。
論文 参考訳(メタデータ) (2026-07-03T16:18:20Z) - Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends [97.83859431619874]
我々は,最近の研究動向,技術開発,評価ベンチマークを体系的にレビューし,インタラクティブな世界モデリングにおける今後の方向性を提案することを目的とする。
具体的には、アプリケーションシナリオ、世界状態の進化、シーンのモダリティの観点から、最近の取り組みとトレンドを最初に要約する。
アクションコンディショナビリティ、長期的なインタラクションとメモリ、リアルタイムの対話性に対するアクションフォロー応答性など、重要な3つの課題を掘り下げる。
論文 参考訳(メタデータ) (2026-05-31T11:12:30Z) - MotuBrain: An Advanced World Action Model for Robot Control [23.733029557644354]
We present MotuBrain, a unified World Action Model that jointly model video and action under a UniDiffuser formulation。
単一のモデルは、ポリシー学習、世界モデリング、ビデオ生成、逆ダイナミクス、共同ビデオアクション予測をサポートする。
Motus上に構築されているMotuBrainは、言語と相互作用の結合を強くするための独立したテキストストリームである、統一されたマルチビューモデリングも導入している。
我々の推論スタックは、ステップの削減、コンパイル、FP8量子化、DiTキャッシュ、V2Aスタイルのアクション専用推論、リアルタイムチャンククループ実行を組み合わせたものです。
論文 参考訳(メタデータ) (2026-04-30T12:34:44Z) - Simulating the Visual World with Artificial Intelligence: A Roadmap [48.64639618440864]
ビデオ生成は、視覚的に魅力的なクリップを生成するものから、インタラクションをサポートし、物理的な可視性を維持する仮想環境を構築するものへとシフトしている。
この調査は、この進化の体系的な概要を提供し、現代のビデオ基盤モデルを2つのコアコンポーネントの組み合わせとして概念化した。
4世代にわたる映像生成の進展を追究し,本質的な物理的妥当性を具現化した映像生成モデルを構築した。
論文 参考訳(メタデータ) (2025-11-11T18:59:50Z) - Can World Models Benefit VLMs for World Dynamics? [59.73433292793044]
本研究では,世界モデル先行モデルがビジョンランゲージモデルに移行した場合の能力について検討する。
最高の性能を持つDynamic Vision Aligner (DyVA) と名付けます。
DyVAはオープンソースとプロプライエタリの両方のベースラインを超え、最先端または同等のパフォーマンスを実現しています。
論文 参考訳(メタデータ) (2025-10-01T13:07:05Z) - Inter-environmental world modeling for continuous and compositional dynamics [7.01176359680407]
環境全体にわたってシミュレートする継続的潜在アクション表現を学習する、教師なしのフレームワークであるLie Actionを紹介した。
WLAはビデオフレームのみを用いてトレーニングが可能であり、アクションラベルが最小でも無ければ、新しいアクションセットを持つ新しい環境に迅速に適応できることを実証する。
論文 参考訳(メタデータ) (2025-03-13T00:02:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。