論文の概要: WorldSolver: Can LLM Agents Simulate the Physical Dynamics via Solver Generation?
- arxiv url: http://arxiv.org/abs/2610.08720v1
- Date: Tue, 06 Oct 2026 17:26:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:30.147878
- Title: WorldSolver: Can LLM Agents Simulate the Physical Dynamics via Solver Generation?
- Title(参考訳): WorldSolver: LLMエージェントはソルバー生成を介して物理力学をシミュレートできるのか?
- Abstract要約: 我々は、61の古典的コンピュータグラフィックス論文に物理現象から導かれる168のシミュレーションタスクのベンチマークであるWorldrを紹介する。
各タスクにはシーンの固定されたシミュレーション環境が含まれており、ソルバの実装はエージェントが完了するまで残っている。
実行を成功させるための実行チェック,意図した動的動作を再現するための視覚的忠実度,生成した動的動作の検証のための物理的プラウザビリティの3つの側面で評価する。
- 参考スコア(独自算出の注目度): 43.45780908251363
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM-based agents are increasingly advancing scientific and engineering problem solving, with physics simulation emerging as a challenging yet practical testbed for reproducing complex physical phenomena with application in embodied AI, games and films. As the workhorse of such simulation, a solver computes how the state of a dynamic system evolves over time. Building such solvers requires physical understanding to identify appropriate models, mathematical reasoning to formulate the underlying dynamics, and software engineering to implement them as executable code, yet this capability of LLM agents remains underexplored. To this end, we introduce WorldSolver, a benchmark of 168 simulation tasks derived from physical phenomena in 61 classic computer graphics papers, spanning 7 physical domains. Each task contains a code scaffold that provides a fixed simulation environment for the scene, with the solver implementation left for the agent to complete. Specifically, we evaluate them along three dimensions: Execution Checks for successful execution, Visual Fidelity for reproducing the intended dynamic behavior in the rendered simulation, and Physical Plausibility for physics-grounded verification of the generated dynamics. Experiments on frontier agents reveal that producing executable solvers is difficult itself, and satisfying visual and physical correctness is even harder. GPT-5.6-Sol and Claude-Opus-5 perform comparatively better than the other evaluated agents, yet achieve overall scores of only 48.7% and 46.7%, respectively. WorldSolver is an early step toward agentic solver generation, and we hope it helps drive progress toward agents that can faithfully simulate the dynamic physical world. Code is available at https://github.com/sirujiang/WorldSolver.
- Abstract(参考訳): LLMベースのエージェントは、科学と工学の問題解決をますます進めている。物理シミュレーションは、複雑な物理現象を再現し、具体化されたAI、ゲーム、映画に適用するための、挑戦的で実用的なテストベッドとして出現している。
そのようなシミュレーションの成果として、解法は動的システムの状態が時間とともにどのように進化するかを計算する。
このような解法を構築するには、適切なモデルを特定するための物理的理解、基礎となる力学を定式化するための数学的推論、実行可能なコードとして実装するソフトウェア工学が必要であるが、LLMエージェントのこの能力はまだ未熟である。
この目的のために、61の古典的コンピュータグラフィックス論文において、物理現象から導かれる168のシミュレーションタスクのベンチマークであるWorldSolverを紹介した。
各タスクには、シーンの固定されたシミュレーション環境を提供するコードスキャフォールドが含まれており、エージェントが完了するまでにはソルバの実装が残っている。
具体的には、実行を成功させる実行チェック、レンダリングされたシミュレーションで意図した動的な振る舞いを再現する視覚的忠実度、生成したダイナミクスの物理基底検証のための物理プラウザビリティの3つの次元で評価する。
フロンティアエージェントの実験では、実行可能なソルバの生成はそれ自体が困難であり、視覚的および物理的正確性を満たすことはさらに困難である。
GPT-5.6-Sol と Claude-Opus-5 は、他の評価薬よりも比較的優れているが、それぞれ48.7%と46.7%のスコアしか得られていない。
WorldSolverは、エージェントソルバー生成に向けた初期のステップであり、ダイナミックな物理世界を忠実にシミュレートできるエージェントへの前進を促進することを願っている。
コードはhttps://github.com/sirujiang/WorldSolver.comで入手できる。
関連論文リスト
- PhysAgent: Reflective Agentic Physics Control for Physically Plausible Video Generation [68.13035350819901]
PhysAgentは物理プログラム生成、物理シミュレーション、ステージ固有の検証、ターゲットプログラム修復のループを閉じるフレームワークである。
我々のフレームワークは、より物理的に妥当なビデオを生成し、より優れたプロンプトアライメントを実現し、多様な物理的シナリオにわたってより効果的に一般化する。
論文 参考訳(メタデータ) (2026-07-17T08:55:09Z) - Coding Agent Is Good As World Simulator [5.161736405778465]
本稿では,物理に基づく世界モデル構築のためのエージェントフレームワークを提案する。
このフレームワークは、計画、コード生成、ビジュアルレビュー、物理分析エージェントを調整する。
実験の結果,本フレームワークは,物理精度,命令忠実度,視覚的品質において,高度な映像ベースモデルよりも優れていた。
論文 参考訳(メタデータ) (2026-05-14T05:33:41Z) - PhysCodeBench: Benchmarking Physics-Aware Symbolic Simulation of 3D Scenes via Self-Corrective Multi-Agent Refinement [35.63080643326192]
物理を意識した3Dシーンのシンボルシミュレーションは、ロボット工学、AI、科学計算に不可欠である。
我々はPhysCodeBenchを紹介した。PhysCodeBenchは物理学を意識したシンボリックシミュレーションを評価するための、最初の総合的なベンチマークである。
評価フレームワークは、自動的および視覚的評価により、コード実行可能性と身体的精度の両方を測定する。
論文 参考訳(メタデータ) (2026-04-26T07:37:20Z) - SimuScene: Training and Benchmarking Code Generation to Simulate Physical Scenarios [71.65387146697319]
大規模言語モデル(LLM)は、数学の競争、複雑なコーディング、科学的推論といったタスクのために広く研究されている。
物理シナリオをシミュレートしてLLMを訓練し,評価する最初の体系的な研究であるSimuSceneを提案する。
品質を保証するために、人間の検証とともに、データ収集のための自動パイプラインを構築します。
論文 参考訳(メタデータ) (2026-02-11T13:26:02Z) - SIMPACT: Simulation-Enabled Action Planning using Vision-Language Models [60.80050275581661]
VLM(Vision-Language Models)は、目覚しい常識と意味論的推論能力を示す。
物理力学に関する基礎的な理解は欠如している。
テストタイムでシミュレーション可能な ACTion Planning フレームワークである S を提案する。
本手法は,5つの難易度,実世界の剛体および変形可能な操作課題に対して,最先端の性能を示す。
論文 参考訳(メタデータ) (2025-12-05T18:51:03Z) - Dyna-Mind: Learning to Simulate from Experience for Better AI Agents [62.21219817256246]
私たちは、現在のAIエージェントは、行動する前に、別の未来を精神的にシミュレートする能力である「悪意ある試行錯誤」を必要としていると論じます。
我々は、(V)LMエージェントに対して、そのようなシミュレーションを推論に組み込むように明示的に教える2段階のトレーニングフレームワークであるDyna-Mindを紹介した。
論文 参考訳(メタデータ) (2025-10-10T17:30:18Z) - PlasticineLab: A Soft-Body Manipulation Benchmark with Differentiable
Physics [89.81550748680245]
PasticineLabと呼ばれる新しい微分可能な物理ベンチマークを導入する。
各タスクにおいて、エージェントはマニピュレータを使用して、プラスチックを所望の構成に変形させる。
本稿では,既存の強化学習(RL)手法と勾配に基づく手法について評価する。
論文 参考訳(メタデータ) (2021-04-07T17:59:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。