論文の概要: RenderBench: Benchmarking Render-to-Real Video Transfer with Reconstructed Digital Twins
- arxiv url: http://arxiv.org/abs/2610.08684v1
- Date: Tue, 06 Oct 2026 17:03:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:30.136279
- Title: RenderBench: Benchmarking Render-to-Real Video Transfer with Reconstructed Digital Twins
- Title(参考訳): RenderBench: デジタルツインを再構築したレンダーツーリアルビデオ転送のベンチマーク
- Abstract要約: RenderBenchは、大規模な屋内環境と自我中心の視点にまたがる12の現実世界シーンのベンチマークである。
私たちの建設パイプラインは、視覚幾何学、神経再構築、補助的な3Dオーサリングを組み合わせています。
実写映像とPAI-Bench-C互換構造投影に対する転送モデルの評価を行い、シーンアノテーションを用いてオブジェクト、可視性、調音性、動きによる障害のローカライズを行う。
- 参考スコア(独自算出の注目度): 10.586890894442071
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Modern video models can generate realistic videos from real appearance references and proxy renders that specify scene structure, viewpoint changes, and motion. Evaluating this render-to-real capability requires a real target video depicting the same scene evolution, paired with an editable, geometrically registered 3D replica. Such data has traditionally required substantial manual modeling, calibration, and animation effort. We introduce RenderBench, a benchmark of 12 reconstructed real-world scenes spanning large-scale indoor environments and egocentric viewpoints, with both static and dynamic settings. Our construction pipeline combines visual geometry, neural reconstruction, and assisted 3D authoring. Each scene is decomposed into static objects and dynamic actors, registered to the capture cameras, and accepted only after multi-view geometric and temporal validation. Each evaluation unit contains appearance reference images, a held-out real target video, an editable digital twin, a matched proxy render, and renderer-native scene annotations. We evaluate transfer models against paired real target videos, retain PAI-Bench-C-compatible structural projections, and use scene annotations to localize failures by object, visibility, articulation, and motion. The first release retains 12 of 14 registered samples (85.7%), comprising 1,496 paired real-proxy frames. All released scenes pass file-integrity and environment-edit audits, while proxy diagnostics yield a depth si-RMSE of 0.2170 and instance mIoU of 0.3673. RenderBench provides paired real observations and editable scene state for assessing both appearance fidelity and preservation of geometry and dynamics.
- Abstract(参考訳): 現代のビデオモデルは、シーン構造、視点の変化、動きを規定する実際の外観参照とプロキシレンダリングからリアルなビデオを生成することができる。
このレンダリング・トゥ・リアルの能力を評価するには、同じシーンの進化を描いた実際のターゲットビデオが必要で、編集可能で幾何学的に登録された3Dレプリカと組み合わせられる。
このようなデータには従来、手動モデリング、キャリブレーション、アニメーションの作業が必要だった。
RenderBenchは、大規模な屋内環境と自我中心の視点にまたがる12の現実世界のシーンを静的かつ動的に再現したベンチマークである。
私たちの建設パイプラインは、視覚幾何学、神経再構築、補助的な3Dオーサリングを組み合わせています。
各シーンは静的なオブジェクトと動的アクターに分解され、キャプチャーカメラに登録され、幾何的および時間的検証の後にのみ受け入れられる。
各評価ユニットは、外観参照画像、保持されたリアルターゲットビデオ、編集可能なデジタルツイン、マッチングされたプロキシレンダリング、レンダラネイティブなシーンアノテーションを含む。
PAI-Bench-C互換構造投影を保ち、シーンアノテーションを用いて、オブジェクト、可視性、調音性、動きによって障害をローカライズする。
最初のリリースでは、14の登録サンプル(85.7%)のうち12が保持されており、1,496のペアのリアルプロキシフレームで構成されている。
リリースされたすべてのシーンはファイル統合と環境編集監査をパスし、プロキシ診断では深さのsi-RMSEが0.2170、インスタンスのmIoUが0.3673である。
RenderBenchは、外観の忠実さと幾何学と力学の保存の両方を評価するために、ペア化された実観測と編集可能なシーン状態を提供する。
関連論文リスト
- Fysiverse-3D-Vision Technical Report: Generating Executable 3D Worlds from Images through Unified Spatial Reasoning [62.09790533047924]
生成モデルは、高度な画像条件付き3Dコンテンツ生成が可能だが、単一の画像から制御可能で実行可能な3Dシーンを生成することは、依然として困難である。
本研究では,Fysiverse-3D-Visionを提案する。Fysiverse-3D-Visionは1つの画像から生成した3次元シーンの再構成と実行可能アセット構築のための統合視覚言語-幾何学フレームワークである。
本フレームワークは,既存の手法と比較して,幾何学的整合性,レイアウト推定,レンダリング品質,物理的特性の理解に優れる。
論文 参考訳(メタデータ) (2026-09-22T06:22:31Z) - GeoT2V-Bench: Benchmarking 3D Consistency in Text-to-Video Models via 3D Reconstruction [23.56618120729796]
GeoT2V-Benchは、カメラプロップされたT2Vクリップが明確な3D再構成をサポートするかどうかを評価するための診断ベンチマークである。
可視的な動き、静的なレンダリングエラー、フローコンセンサス、フレキシブル-vs-静的な動作は、しばしば相反する。
論文 参考訳(メタデータ) (2026-06-23T17:12:21Z) - BRDFusion: Physics Meets Generation for Urban Scene Inverse Rendering [6.454961474516282]
キャプチャービデオからの都市シーンの逆レンダリングは、コンテンツ作成や自律運転シミュレーションなど、多数のアプリケーションを可能にする。
本稿では,逆レンダリングと前方レンダリングの2つの補完モデルを組み合わせた統合フレームワークであるBRDFusionを提案する。
論文 参考訳(メタデータ) (2026-06-15T17:58:31Z) - Thinking in Blender: Staged Executable Inverse Graphics with Vision-Language Models [29.14307229425815]
1枚の画像から3Dシーンを再構成するエージェントフレームワークであるSEIG(Staged Executable Inverse Graphics)を導入する。
我々は,画素レベル,知覚的,意味的忠実度にまたがるさまざまな再現指標を用いて,様々な場面におけるフレームワークの評価を行った。
論文 参考訳(メタデータ) (2026-06-01T17:59:53Z) - RealMaster: Lifting Rendered Scenes into Photorealistic Video [55.04231137698114]
最先端のビデオ生成モデルは驚くべきフォトリアリズムを生み出すが、生成したコンテンツをシーン要求に合わせるために必要な正確な制御は欠如している。
本稿では,3Dエンジンの出力と完全な整合性を維持しつつ,映像拡散モデルを用いてレンダリング映像をフォトリアリスティックビデオに引き上げる手法であるRealMasterを提案する。
RealMasterは既存のビデオ編集のベースラインを大幅に上回り、ジオメトリ、ダイナミックス、アイデンティティを元の3Dコントロールで指定しながら、フォトリアリズムを改善している。
論文 参考訳(メタデータ) (2026-03-24T17:32:42Z) - LiteReality: Graphics-Ready 3D Scene Reconstruction from RGB-D Scans [64.31686158593351]
LiteRealityは、屋内環境のRGB-Dスキャンをコンパクトでリアルでインタラクティブな3D仮想レプリカに変換する、新しいパイプラインである。
LiteRealityは、オブジェクトの個性、明瞭さ、高品質なレンダリング材料、物理ベースのインタラクションなど、グラフィックパイプラインに不可欠な重要な機能をサポートしている。
本研究は,LiteRealityが実生活スキャンと公開データセットの両方に与える影響を実証する。
論文 参考訳(メタデータ) (2025-07-03T17:59:55Z) - Differentiable Blocks World: Qualitative 3D Decomposition by Rendering
Primitives [70.32817882783608]
本稿では,3次元プリミティブを用いて,シンプルでコンパクトで動作可能な3次元世界表現を実現する手法を提案する。
既存の3次元入力データに依存するプリミティブ分解法とは異なり,本手法は画像を直接操作する。
得られたテクスチャ化されたプリミティブは入力画像を忠実に再構成し、視覚的な3Dポイントを正確にモデル化する。
論文 参考訳(メタデータ) (2023-07-11T17:58:31Z) - Neural Groundplans: Persistent Neural Scene Representations from a
Single Image [90.04272671464238]
本稿では,シーンの2次元画像観察を永続的な3次元シーン表現にマッピングする手法を提案する。
本稿では,永続的でメモリ効率のよいシーン表現として,条件付きニューラルグラウンドプランを提案する。
論文 参考訳(メタデータ) (2022-07-22T17:41:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。