論文の概要: Recursive Code World Models: Building Complex Worlds through Recursive Scene Programs
- arxiv url: http://arxiv.org/abs/2609.11499v2
- Date: Sun, 13 Sep 2026 02:25:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 07:15:04.949187
- Title: Recursive Code World Models: Building Complex Worlds through Recursive Scene Programs
- Title(参考訳): Recursive Code World Models: Recursive Scene Programsによる複雑な世界の構築
- Abstract要約: 本稿では,1つの参照画像から複雑な3Dワールドを再構成するフレームワークであるRecursive Code World Models (RCWM)を紹介する。
RSPは、実行可能世界を合成シーンコードとして表現し、各ソルバ呼び出しは、全体を確立するために同じ完全なプロセスに従う。
このグローバル・ローカル・グローバル再帰は、シーン全体の幾何学と関係を保ちながら、微細な構造に独自の知覚・編集ループを与える。
- 参考スコア(独自算出の注目度): 9.169512074478662
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Code world models represent worlds as executable programs, but this representation alone does not determine how to construct a complex world. We introduce Recursive Code World Models (RCWM), a framework for reconstructing complex 3D worlds in code from a single reference image. RCWM couples a Recursive Scene Program (RSP) representation with a construction solver that recursively calls itself. An RSP represents the executable world as compositional scene code, while each solver call follows the same complete process: establish the whole, recursively reconstruct unresolved parts, and revisit the whole to refine their composition. This global-local-global recursion gives fine-scale structures their own perception-and-editing loops while preserving scene-wide geometry and relationships. Reference-aligned views propagate a shared camera projection across levels, while parent revisitation addresses boundaries, spatial relations, and shared errors that emerge after local refinement. A vision-language coding agent directly compares reference images with scene renders to guide refinement, recursive descent, and return. Across complex scenes, RCWM outperforms prior code-based image-to-scene reconstruction methods. Ablation studies further support the benefits of recursive construction and suggest that deeper calls can improve finer-scale reconstruction. RCWM provides a recursive construction principle for building complex executable worlds from visual evidence.
- Abstract(参考訳): コードワールドモデルは、世界を実行可能なプログラムとして表現するが、この表現だけでは、複雑な世界を構築する方法を決定できない。
本稿では,1つの参照画像から複雑な3Dワールドを再構成するフレームワークであるRecursive Code World Models (RCWM)を紹介する。
RCWMは、再帰的シーンプログラム(Recursive Scene Program、RSP)の表現と、再帰的に自身を呼ぶ構成解決器を結合する。
RSPは、実行可能世界を構成シーンコードとして表現し、各ソルバコールは、全体を確立し、未解決部分を再帰的に再構築し、全体を再考し、構成を洗練させるという、同じ完全なプロセスに従っている。
このグローバル・ローカル・グローバル再帰は、シーン全体の幾何学と関係を保ちながら、独自の知覚と編集のループを与える。
参照アライメントされたビューは、レベルにわたって共有カメラプロジェクションを伝播させ、親のリビジョンは境界、空間的関係、局所的な改善後に現れる共有エラーに対処する。
視覚言語符号化エージェントは、参照画像とシーンレンダリングを直接比較して、洗練、再帰降下、返却を誘導する。
複雑なシーン全体にわたって、RCWMは以前のコードベースの画像からシーンへの再構成方法よりも優れている。
アブレーション研究は再帰的構築の利点をさらに支援し、より深い呼び出しがより微細な再構築を改善することを示唆している。
RCWMは、視覚的証拠から複雑な実行可能世界を構築するための再帰的な構成原理を提供する。
関連論文リスト
- GraLoD: Graphics-Inspired Continuous Level-of-Detail Learning for Image Restoration [54.85451496831771]
再生スケールを空間変化およびステージ依存変数として扱うプラグイン・アンド・プレイフレームワークであるGraLoDを提案する。
GraLoDはネイティブエンコーダ階層を再利用し、そのマルチスケール機能を共有LOD表現空間に整列し、デコーダの各段階でステージ条件付きLODフィールドを予測する。
実験はタスク固有とオールインワンの復元において一貫した改善を示す。
論文 参考訳(メタデータ) (2026-09-15T03:22:22Z) - LIST3R: Long-sequence Instance-aware 3D Reconstruction [12.683912509337992]
LIST3Rは、ロングシーケンス3D再構成のためのインスタンス対応フレームワークである。
インスタンスアンカーを中心に再構築を編成し、断片化されたサブシーケンスを再接続する。
提案手法は,より正確な軌道と高品質な3D再構成を実現する。
論文 参考訳(メタデータ) (2026-07-01T03:20:32Z) - SceneCode: Executable World Programs for Editable Indoor Scenes with Articulated Objects [69.20984454755512]
室内シーンの合成は、AI、ロボット操作、シミュレーションベースのポリシー評価を具体化する。
既存のパイプラインは、生成されたコンテンツを静的メッシュとして表現し、キュレートされたアセットライブラリからのみ調音を継承する。
我々は、自然言語プロンプトを実行可能なコード駆動屋内世界にコンパイルするフレームワークであるSceneCodeを紹介する。
論文 参考訳(メタデータ) (2026-05-19T09:31:04Z) - DecoRec: Decomposed 3D Scene Reconstruction from Single-View Images via Object-Level Diffusion [65.65756111062005]
textitDecoRecは、単一のビュー2D画像を分解された3Dシーンメッシュに高めるように設計されたシステムである。
以上の結果から,DecoRecはジオメトリと新規合成の両面において,高品質なワンビューシーン再構築を促進することが示唆された。
論文 参考訳(メタデータ) (2026-05-16T04:23:48Z) - Complet4R: Geometric Complete 4D Reconstruction [28.173503112119374]
幾何学的完全 4D 再構成のための新しいエンドツーエンドフレームワーク Complet4R を紹介する。
本手法は,幾何完全4次元再構成の課題を再構築と完成の統一的な枠組みとして定式化する。
論文 参考訳(メタデータ) (2026-03-28T15:06:42Z) - Scene Grounding In the Wild [27.597534811067348]
大規模な現実世界のシーンの正確な3Dモデルを、非構造的で、その中の画像から再構築することは、コンピュータビジョンにおける重要な課題である。
シーンの完全な参照モデルに各部分再構成を基礎とするフレームワークを提案する。
従来のパイプラインや学習ベースのパイプラインでは,我々のアプローチが一貫してグローバルアライメントを改善することを示す。
論文 参考訳(メタデータ) (2026-03-27T16:41:20Z) - 3D Reconstruction via Incremental Structure From Motion [1.4999444543328293]
本稿では,幾何推定の整合性およびバンドル調整による反復的改善の効果に着目し,逐次SfMパイプラインの詳細な実装について述べる。
その結果、視覚的に構造化された環境下でのスパース3次元再構成のための信頼性の高い方法として、インクリメンタルSfMの実用性をサポートした。
論文 参考訳(メタデータ) (2025-08-01T18:45:05Z) - DepR: Depth Guided Single-view Scene Reconstruction with Instance-level Diffusion [59.25479674775212]
DepRは深度誘導のシングルビューシーン再構築フレームワークである。
個々のオブジェクトを生成し、それらをコヒーレントな3Dレイアウトに構成する。
限られた合成データで訓練されているにもかかわらず、最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2025-07-30T16:40:46Z) - Fast3R: Towards 3D Reconstruction of 1000+ Images in One Forward Pass [68.78222900840132]
我々は,DUSt3Rに並列に複数のビューを処理することで,効率よくスケーラブルな3D再構成を実現する新しい多視点一般化であるFast3Rを提案する。
Fast3Rは最先端のパフォーマンスを示し、推論速度とエラーの蓄積が大幅に改善された。
論文 参考訳(メタデータ) (2025-01-23T18:59:55Z) - LucidFusion: Reconstructing 3D Gaussians with Arbitrary Unposed Images [23.96972213606037]
3次元再構成を画像から画像への変換として再構成し、相対座標マップ(RCM)を導入する。
RCMは、ポーズ推定なしで複数の未提示画像をメインビューにアライメントする。
RCMはプロセスを単純化するが、グローバルな3D監視の欠如によりノイズの多い出力が得られる。
我々のLucidFusionフレームワークは、任意の数の未用意な入力を処理し、数秒で堅牢な3D再構成を実現し、より柔軟でポーズなしの3Dパイプラインを実現する。
論文 参考訳(メタデータ) (2024-10-21T04:47:01Z) - Gen3DSR: Generalizable 3D Scene Reconstruction via Divide and Conquer from a Single View [5.222115919729418]
シングルビュー3D再構成は現在、2つの主要な視点からアプローチされている。
分割・分散戦略に従うハイブリッド手法を提案する。
我々は,合成シーンと実世界のシーンの両方において,我々のアプローチの再構築性能を実証する。
論文 参考訳(メタデータ) (2024-04-04T12:58:46Z) - UCLID-Net: Single View Reconstruction in Object Space [60.046383053211215]
三次元潜在空間を保存する幾何学的空間の構築は,オブジェクト座標空間における大域的形状規則性と局所的推論を同時に学習する上で有効であることを示す。
ベンチマーク目的でよく使用されるShapeNet合成画像と、我々のアプローチが最先端の画像より優れている実世界の画像の両方を実証する。
論文 参考訳(メタデータ) (2020-06-06T09:15:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。