論文の概要: GS-Agent: Creating 4D Physical Worlds With Generative Simulation
- arxiv url: http://arxiv.org/abs/2607.21522v1
- Date: Thu, 23 Jul 2026 17:04:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-24 18:26:25.493132
- Title: GS-Agent: Creating 4D Physical Worlds With Generative Simulation
- Title(参考訳): GS-Agent:生成シミュレーションで4D物理世界を作る
- Authors: Hongxin Zhang, Chunru Lin, Junyan Li, Zhou Xian, Tsun-Hsuan Wang, Chuang Gan,
- Abstract要約: 本稿では,物理エンジンをループに統合し,自然言語から4次元物理世界を生成する,エンドツーエンドのマルチエージェントフレームワークであるGS-Agentを提案する。
GS-Agentは、人間が4D世界を構築する方法に触発されて、タスクをエンティティ管理に分解し、3Dアセットキュレーション、マテリアルチューニング、配置、モーションコントロール、レンダリング構成をカバーした。
我々は、GS-Agentを、4Dワールドジェネレーションの新しいパラダイムの基盤として想定し、クリエイティブなコンテンツ制作と物理的なAIの強化を図っている。
- 参考スコア(独自算出の注目度): 41.82781441252822
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Creating dynamic and physically realistic 4D worlds from natural language descriptions is both fascinating and challenging. Traditional computer graphics methods rely on manual creation, requiring extensive human effort to fine-tune materials, motions, and visual fidelity. Recent advances in generative foundation models have sparked interest in learning to generate such 4D worlds from large-scale data; however, existing methods still struggle to ensure physical plausibility and controllability. In this work, we take a different path by leveraging foundation models to construct an agentic system that emulates how humans traditionally create 4D worlds, yet automates the entire process. We present GS-Agent, an end-to-end multi-agent framework that integrates physics engines in the loop to generate realistic, dynamic, and controllable 4D physical worlds from natural language. Inspired by how humans build 4D worlds, GS-Agent decomposes the task into entity management, covering 3D asset curation, material tuning, placement, and motion control, and rendering configuration, including camera and lighting manipulation. Multiple agents with distinct expertise interact with the physics engine via code, seek multimodal feedback, and collaborate to iteratively construct 4D worlds that align with the given descriptions. Experimental results show that GS-Agent effectively converts natural language into diverse and physically plausible 4D worlds exhibiting rich interactions among liquids, deformable objects, and rigid bodies, while achieving cinematic camera and lighting control. We envision GS-Agent as a foundation for a new paradigm in 4D world generation, empowering creative content creation and physical AI. Project page at https://umass-embodied-agi.github.io/gs-agent/
- Abstract(参考訳): 自然言語の記述から動的で物理的に現実的な4D世界を作るのは、魅力的で難しい。
従来のコンピュータグラフィックスの手法は手作業による作成に依存しており、素材、動き、視覚的忠実さを微調整するために広範囲の人的努力を必要とする。
生成基盤モデルの最近の進歩は、大規模なデータからこのような4D世界を生成することへの関心を喚起しているが、既存の手法は、物理的な可視性と制御性を確保するのに依然として苦労している。
本研究では,従来の4Dワールドの作り方を模倣しながら,プロセス全体を自動化したエージェントシステムを構築するために,基礎モデルを活用することで,異なる道をたどる。
本稿では,現実的,動的,制御可能な4次元物理世界を自然言語から生成するための物理エンジンをループに統合する,エンドツーエンドのマルチエージェントフレームワークであるGS-Agentを提案する。
GS-Agentは、人間が4D世界を構築する方法に触発され、3Dアセットのキュレーション、素材のチューニング、配置、モーションコントロール、カメラや照明操作などのレンダリング構成を含む、エンティティ管理にタスクを分解する。
異なる専門知識を持つ複数のエージェントは、コードを介して物理エンジンと対話し、マルチモーダルなフィードバックを求め、与えられた記述に沿って反復的に4Dワールドを構築する。
実験の結果,GS-Agentは,映像カメラと照明制御を達成しつつ,自然言語を多様かつ物理的に可視な4D世界へと効果的に変換し,液体,変形性物体,剛体間のリッチな相互作用を示すことを示した。
我々は、GS-Agentを、4Dワールドジェネレーションの新しいパラダイムの基盤として想定し、クリエイティブなコンテンツ制作と物理的なAIの強化を図っている。
Project page at https://umass-embodied-agi.github.io/gs-agent/
関連論文リスト
- SimWorlds: A Multi-Agent System for Dynamic 3D Scene Creation [50.175987640001644]
テキストから動的に編集可能な4Dシーンを生成するマルチエージェントフレームワークであるSimWorldsを紹介する。
また,プロシージャのダイナミックな3Dシーンの視覚的忠実度と身体的整合性を評価するベンチマークである4DBuildBenchも導入した。
論文 参考訳(メタデータ) (2026-07-02T06:29:18Z) - CP4D: Compositional Physics-aware 4D Scene Generation [37.130324925592795]
複雑な物理力学に忠実に固執した4次元シーン合成のための新しいパラダイムであるCP4Dを提案する。
CP4Dは探索可能なインタラクティブな4Dシーンを生成できることを示す。
論文 参考訳(メタデータ) (2026-06-08T08:23:12Z) - Code2Worlds: Empowering Coding LLMs for 4D World Generation [14.349376975089607]
我々は、4D生成を言語間コード生成として定式化するフレームワークであるCode2Worldsを紹介した。
本稿では,階層的な環境オーケストレーションから拡張オブジェクトを生成する2重ストリームアーキテクチャを提案する。
我々は,ポストプロシースエージェントが動的にスクリプトする物理対応閉ループ機構と,反復的に洗練されたシミュレーションコードに対して自己回帰を行うVLM-Motion Criticとを結合して構築する。
論文 参考訳(メタデータ) (2026-02-12T09:34:28Z) - WorldReel: 4D Video Generation with Consistent Geometry and Motion Modeling [63.37476802589492]
We present WorldReel, a 4D video that are native-temporally consistent。
WorldReelは、ポイントマップ、カメラ軌道、高密度フローを含む4Dシーン表現と共にフレームを生成する。
We believe that WorldReel bring video generation to 4D-consistent world modeling。
論文 参考訳(メタデータ) (2025-12-08T18:54:12Z) - WorldGen: From Text to Traversable and Interactive 3D Worlds [87.95088818329403]
本稿では,テキストプロンプトから直接,大規模でインタラクティブな3Dワールドを自動生成するシステムWorldGenを紹介する。
我々のアプローチは、自然言語記述を標準のゲームエンジン内で即座に探索または編集できる完全にテクスチャ化された環境に変換する。
この研究は、ゲーム、シミュレーション、没入型社会環境における応用のための3D生成AIのフロンティアを前進させる、アクセス可能で、大規模に生成可能な世界構築への一歩である。
論文 参考訳(メタデータ) (2025-11-20T22:13:18Z) - LatticeWorld: A Multimodal Large Language Model-Empowered Framework for Interactive Complex World Generation [35.4193352348583]
本稿では,3D環境の産業生産パイプラインを効率化する,シンプルで効果的な3Dワールドジェネレーションフレームワークを提案する。
LatticeWorldは、競合するマルチエージェントインタラクションを特徴とする、動的エージェントを備えた大規模な3Dインタラクティブワールドを生成する。
LatticeWorldは90倍以上の工業生産効率の向上を実現している。
論文 参考訳(メタデータ) (2025-09-05T17:22:33Z) - WorldCraft: Photo-Realistic 3D World Creation and Customization via LLM Agents [67.31920821192323]
大規模言語モデル(LLM)エージェントがプロシージャ生成を利用してオブジェクトを集約したシーンを生成するシステムであるWorldCraftを紹介する。
本フレームワークでは,コーディネータエージェントが全体の処理を管理し,シーン作成を完了させるために2つの特殊なLLMエージェントと連携する。
パイプラインには軌道制御エージェントが組み込まれており、ユーザはシーンをアニメーション化し、自然言語による対話を通じてカメラを操作することができる。
論文 参考訳(メタデータ) (2025-02-21T17:18:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。