論文の概要: View-Consistent 3D Scene Editing via Dual-Path Structural Correspondense and Semantic Continuity
- arxiv url: http://arxiv.org/abs/2604.17801v2
- Date: Fri, 24 Apr 2026 14:52:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-27 13:34:21.941814
- Title: View-Consistent 3D Scene Editing via Dual-Path Structural Correspondense and Semantic Continuity
- Title(参考訳): デュアルパス構造対応とセマンティック連続性によるビュー一貫性のある3次元シーン編集
- Abstract要約: テキスト駆動の3Dシーン編集において、クロスビューの不整合は依然として大きなボトルネックとなっている。
マルチビューで一貫した3D編集を配信の観点から再放送する。
本稿では,プロジェクション誘導型構造誘導とパッチレベルのセマンティックな伝搬からなる二重経路整合性機構を提案する。
- 参考スコア(独自算出の注目度): 11.663455227298122
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Text-driven 3D scene editing has recently attracted increasing attention. Most existing methods follow a render-edit-optimize pipeline, where multi-view images are rendered from a 3D scene, edited with 2D image editors, and then used to optimize the underlying 3D representation. However, cross-view inconsistency remains a major bottleneck. Although recent methods introduce geometric cues, cross-view interactions, or video priors to mitigate this issue, they still largely rely on inference-time synchronization and thus remain limited in robustness and generalization.In this work, we recast multi-view consistent 3D editing from a distributional perspective: 3D scene editing essentially requires a joint distribution modeling across viewpoints.Based on this insight, we propose a view-consistent 3D editing framework that explicitly introduces cross-view dependencies into the editing process. Furthermore, motivated by the observation that structural correspondence and semantic continuity rely on different cross-view cues, we introduce a dual-path consistency mechanism consisting of projection-guided structural guidance and patch-level semantic propagation for effective cross-view editing. Further, we construct a paired multi-view editing dataset that provides reliable supervision for learning cross-view consistency in edited scenes. Extensive experiments demonstrate that our method achieves superior editing performance with precise and consistent views for complex scenes.
- Abstract(参考訳): テキスト駆動の3Dシーン編集が最近注目を集めている。
既存のほとんどのメソッドはレンダリング-編集-最適化パイプラインに従っており、マルチビューイメージは3Dシーンからレンダリングされ、2Dイメージエディタで編集され、基礎となる3D表現の最適化に使用される。
しかし、クロスビューの不整合は依然として大きなボトルネックである。
近年の手法では、この問題を緩和するために、幾何的キュー、クロスビューインタラクション、あるいはビデオの先行処理を導入しているが、いまだに推論時同期に大きく依存しており、堅牢性や一般化に制限されているため、分散的な視点から、マルチビュー一貫した3D編集をリキャストする。
さらに、構造的対応と意味的連続性は異なる視点的手がかりに依存しているという観察に動機付けられ、プロジェクション誘導型構造ガイダンスとパッチレベルのセマンティック・プロパゲーションからなる二重パス整合性機構を導入し、効果的なクロスビュー編集を行う。
さらに,一対のマルチビュー編集データセットを構築し,編集シーンにおけるクロスビューの一貫性を学習するための信頼性の高い監視を行う。
大規模な実験により,複雑なシーンを精度よく一貫したビューで編集性能が向上することが実証された。
関連論文リスト
- VGGT-Edit: Feed-forward Native 3D Scene Editing with Residual Field Prediction [59.303842406260124]
VGGT-Editはテキスト条件のネイティブ3Dシーン編集のためのフィードフォワードフレームワークである。
本研究では,奥行き同期テキストインジェクションを導入し,意味的指導をバックボーンの空間的ポーズと整合させる。
VGGT-Editは2Dリフトベースラインを大幅に上回り、よりシャープなオブジェクトの詳細、より強力なマルチビュー一貫性、ほぼインスタントな推論速度を生み出している。
論文 参考訳(メタデータ) (2026-05-14T17:59:04Z) - Tri-Prompting: Video Diffusion with Unified Control over Scene, Subject, and Motion [69.64308172688368]
Tri-Promptingは、シーン構成、マルチビューの主題整合性、モーションコントロールを統合する統合フレームワークである。
その結果,Tri-Promptingは多視点被写体識別,3次元整合性,運動精度においてPhantomやDaSなどの特殊ベースラインよりも有意に優れていた。
論文 参考訳(メタデータ) (2026-03-16T17:59:05Z) - Geometry-Guided Reinforcement Learning for Multi-view Consistent 3D Scene Editing [106.07976338405793]
3次元編集における2次元拡散モデルの先行的活用は、有望なパラダイムとして現れている。
我々は3次元基礎モデルであるVGGTから得られた新たな報酬を用いて、強化学習によって駆動されるシングルパスフレームワークであるtextbfRL3DEditを提案する。
実験により、RL3DEditは安定したマルチビューの一貫性を実現し、高い効率で品質を編集する最先端の手法より優れていることが示された。
論文 参考訳(メタデータ) (2026-03-03T16:31:10Z) - CoreEditor: Consistent 3D Editing via Correspondence-constrained Diffusion [24.144486805878596]
CoreEditorは、一貫したテキストから3D編集のための新しいフレームワークである。
本稿では,画素間の正確な相互作用を強制するアテンション制約付アテンション機構を提案する。
実験では、CoreEditorはよりシャープなディテールで高品質な3D一貫性のある編集を生成する。
論文 参考訳(メタデータ) (2025-08-15T17:13:11Z) - Mastering Regional 3DGS: Locating, Initializing, and Editing with Diverse 2D Priors [67.22744959435708]
3Dセマンティックパーシングは2Dに比べて性能が劣ることが多く、3D空間内でのターゲット操作がより困難になり、編集の忠実さが制限される。
本稿では,2次元拡散編集を利用して各ビューの修正領域を正確に同定し,次に3次元ローカライゼーションのための逆レンダリングを行う。
実験により,提案手法は最新技術の性能を実現し,最大4倍のスピードアップを実現した。
論文 参考訳(メタデータ) (2025-07-07T19:15:43Z) - Pro3D-Editor : A Progressive-Views Perspective for Consistent and Precise 3D Editing [25.237699330731395]
テキスト誘導型3D編集は意味のある局所的な3D領域を正確に編集することを目的としている。
既存の方法は通常、2Dビューを無差別に編集し、3D空間に投影する。
理想的な一貫した3D編集は、テキストプログレッシブ・ビューのパラダイムによって実現できると我々は主張する。
論文 参考訳(メタデータ) (2025-05-31T11:11:55Z) - DragScene: Interactive 3D Scene Editing with Single-view Drag Instructions [9.31257776760014]
3D編集は、様々な指示に基づいてシーンを編集する際、顕著な能力を示した。
既存の方法は直感的で局所的な編集に苦労する。
DragSceneは、ドラッグスタイルの編集と多様な3D表現を統合するフレームワークである。
論文 参考訳(メタデータ) (2024-12-18T07:02:01Z) - TrAME: Trajectory-Anchored Multi-View Editing for Text-Guided 3D Gaussian Splatting Manipulation [35.951718189386845]
TAS(Trajectory-Anchored Scheme)による複数ビューの整合性を保証するプログレッシブな3D編集戦略を提案する。
TASは2Dビュー編集と3D更新の間に密結合された反復プロセスを促進し、テキスト・ツー・イメージ・プロセスから得られるエラーの蓄積を防ぐ。
本稿では,2次元ビューの編集中に,ソースブランチからのクロスビューセマンティクスと幾何参照を利用して,対象ブランチからアライメントされたビューを出力する,調整不要なビュー一貫性注意制御(VCAC)モジュールを提案する。
論文 参考訳(メタデータ) (2024-07-02T08:06:58Z) - SyncNoise: Geometrically Consistent Noise Prediction for Text-based 3D Scene Editing [58.22339174221563]
高忠実度3Dシーン編集のための新しい幾何誘導型マルチビュー一貫したノイズ編集手法SyncNoiseを提案する。
SyncNoiseは2次元拡散モデルで複数のビューを同期的に編集し、幾何的に一貫した多視点ノイズ予測を行う。
本手法は,特に複雑なテクスチャを持つシーンにおいて,テキストの指示に配慮した高品質な3D編集結果を実現する。
論文 参考訳(メタデータ) (2024-06-25T09:17:35Z) - View-Consistent 3D Editing with Gaussian Splatting [50.6460814430094]
View-Consistent Editing (VcEdit)は、3DGSをシームレスに画像編集プロセスに組み込む新しいフレームワークである。
一貫性モジュールを反復パターンに組み込むことで、VcEditはマルチビューの不整合の問題を十分に解決する。
論文 参考訳(メタデータ) (2024-03-18T15:22:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。