論文の概要: 4DGS-Craft: Consistent and Interactive 4D Gaussian Splatting Editing
- arxiv url: http://arxiv.org/abs/2510.01991v1
- Date: Thu, 02 Oct 2025 13:13:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-10-03 16:59:21.139776
- Title: 4DGS-Craft: Consistent and Interactive 4D Gaussian Splatting Editing
- Title(参考訳): 4DGS-Craft: 一貫性とインタラクティブな4Dガウシアンスプレイティング編集
- Authors: Lei Liu, Can Wang, Zhenghao Chen, Dong Xu,
- Abstract要約: 4DGS-Craftは一貫性のあるインタラクティブな4DGS編集フレームワークである。
まず、4D対応のInstructPix2Pixモデルを紹介し、ビューと時間的一貫性の両立を保証する。
そして、このモデルをマルチビューグリッドモジュールで拡張し、複数ビューの入力画像を反復的に精細化することで整合性を実現する。
- 参考スコア(独自算出の注目度): 16.52434744545005
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent advances in 4D Gaussian Splatting (4DGS) editing still face challenges with view, temporal, and non-editing region consistency, as well as with handling complex text instructions. To address these issues, we propose 4DGS-Craft, a consistent and interactive 4DGS editing framework. We first introduce a 4D-aware InstructPix2Pix model to ensure both view and temporal consistency. This model incorporates 4D VGGT geometry features extracted from the initial scene, enabling it to capture underlying 4D geometric structures during editing. We further enhance this model with a multi-view grid module that enforces consistency by iteratively refining multi-view input images while jointly optimizing the underlying 4D scene. Furthermore, we preserve the consistency of non-edited regions through a novel Gaussian selection mechanism, which identifies and optimizes only the Gaussians within the edited regions. Beyond consistency, facilitating user interaction is also crucial for effective 4DGS editing. Therefore, we design an LLM-based module for user intent understanding. This module employs a user instruction template to define atomic editing operations and leverages an LLM for reasoning. As a result, our framework can interpret user intent and decompose complex instructions into a logical sequence of atomic operations, enabling it to handle intricate user commands and further enhance editing performance. Compared to related works, our approach enables more consistent and controllable 4D scene editing. Our code will be made available upon acceptance.
- Abstract(参考訳): 近年の4D Gaussian Splatting (4DGS)編集の進歩は、ビュー、時間的、非編集領域の一貫性、複雑なテキスト命令の処理といった課題に直面している。
これらの課題に対処するため,一貫した対話型4DGS編集フレームワークである4DGS-Craftを提案する。
まず、4D対応のInstructPix2Pixモデルを紹介し、ビューと時間的一貫性の両立を保証する。
このモデルには、初期シーンから抽出された4D VGGT幾何学的特徴が含まれており、編集中に下層の4D幾何学的構造をキャプチャすることができる。
このモデルをさらに強化し、マルチビュー入力画像を反復的に修正し、基礎となる4Dシーンを協調的に最適化することで、一貫性を実現するマルチビューグリッドモジュールを開発した。
さらに,編集領域内のガウスのみを識別・最適化する新しいガウス選択機構により,非編集領域の整合性を維持する。
一貫性の他に、ユーザインタラクションの促進は、4DGSの効率的な編集にも不可欠である。
そこで本研究では,ユーザ意図理解のためのLLMベースのモジュールを設計する。
このモジュールは、アトミックな編集操作を定義するためにユーザー命令テンプレートを使用し、推論にLLMを利用する。
その結果,複雑な命令をアトミックな操作の論理列に分解することで,複雑なユーザコマンドを処理し,さらに編集性能を向上させることが可能となった。
関連作品と比較して,本手法はより一貫性があり,制御可能な4Dシーン編集を可能にする。
私たちのコードは受け入れ次第利用可能になります。
関連論文リスト
- Instruct-4DGS: Efficient Dynamic Scene Editing via 4D Gaussian-based Static-Dynamic Separation [25.047474784265773]
Instruct-4DGSは時間次元の面でよりスケーラブルな効率的な動的シーン編集手法である。
編集結果から,Instruct-4DGSは効率が高く,既存の方法に比べて編集時間が半減することがわかった。
論文 参考訳(メタデータ) (2025-02-04T08:18:49Z) - Instruct 4D-to-4D: Editing 4D Scenes as Pseudo-3D Scenes Using 2D Diffusion [30.331519274430594]
命令4D-to-4Dは、高品質な命令誘導動的シーン編集結果を生成する。
我々は、4Dシーンを擬似3Dシーンとして扱い、ビデオ編集における時間的一貫性を実現し、擬似3Dシーンに適用する2つのサブプロブレムに分解する。
様々な場面でのアプローチと編集指示を幅広く評価し,空間的・時間的に一貫した編集結果が得られることを示した。
論文 参考訳(メタデータ) (2024-06-13T17:59:30Z) - DGE: Direct Gaussian 3D Editing by Consistent Multi-view Editing [72.54566271694654]
オープンな言語命令に基づいて3Dオブジェクトやシーンを編集する際の問題点を考察する。
この問題に対する一般的なアプローチは、3D編集プロセスをガイドするために2Dイメージジェネレータまたはエディタを使用することである。
このプロセスは、コストのかかる3D表現の反復的な更新を必要とするため、しばしば非効率である。
論文 参考訳(メタデータ) (2024-04-29T17:59:30Z) - View-Consistent 3D Editing with Gaussian Splatting [50.6460814430094]
View-Consistent Editing (VcEdit)は、3DGSをシームレスに画像編集プロセスに組み込む新しいフレームワークである。
一貫性モジュールを反復パターンに組み込むことで、VcEditはマルチビューの不整合の問題を十分に解決する。
論文 参考訳(メタデータ) (2024-03-18T15:22:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。