論文の概要: GeoEdit: Geometry-Aware Object Editing via Dual-Branch Denoising
- arxiv url: http://arxiv.org/abs/2606.30003v1
- Date: Mon, 29 Jun 2026 09:12:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:16.157817
- Title: GeoEdit: Geometry-Aware Object Editing via Dual-Branch Denoising
- Title(参考訳): ジオ編集:デュアルブランチによる幾何学的オブジェクト編集
- Abstract要約: 現在の2D手法では空間認識が欠如し、視点違反が発生する。
構造的プロキシを潜伏空間に強制すると、分散均質性が損なわれ、結果として自己注意の漏れがゴーストや背景のぼやけにつながる。
トレーニング不要なLft-Manipulate-Render-DenoiseパイプラインであるGeoEditについて述べる。
- 参考スコア(独自算出の注目度): 21.123575984555927
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Precisely manipulating objects in a single photograph (translation, rotation, scaling) while obeying 3D physical constraints remains unsolved for diffusion-based editors. Current 2D methods lack spatial awareness and produce perspective violations. Forcing structural proxies into the latent space also disrupts variance homogeneity, and the resulting self-attention leakage leads to ghosting and background blur. The core difficulty is asymmetric: the relocated object must follow a rigid geometry, yet the uncovered background needs freedom to synthesize plausible content. We present GeoEdit, a training-free Lift-Manipulate-Render-Denoise pipeline that satisfies both constraints. We decouple scene and object in 3D, align them through point correspondence, and render a geometry-aligned proxy with a structural depth map. A Dual-Branch Denoising stage then refines this proxy: a video diffusion backbone preserves object identity, while 3D constraints are injected into the foreground within a narrow denoising window at matching noise variance (variance-homogeneous injection). The background denoises freely. Because the injected signal matches the native latent statistics, self-attention stays undisturbed. We also introduce GeoEditBench, a pose-aware benchmark covering object translation, object rotation, and camera movement with pose-aware evaluation metrics. Experiments confirm consistent gains in geometric accuracy, identity fidelity, and background quality. Our codes are available at https://github.com/Heey731/GeoEdit.
- Abstract(参考訳): 1枚の写真(翻訳、回転、スケーリング)でオブジェクトを正確に操作する一方で、3Dの物理的制約に従うことは、拡散ベースのエディターには未解決のままである。
現在の2D法では空間認識が欠如し、視点違反が発生する。
構造的プロキシを潜伏空間に強制すると、分散均質性が損なわれ、結果として自己注意の漏れがゴーストや背景のぼやけにつながる。
移動対象は厳密な幾何学に従わなければならないが、発見されている背景は可塑性コンテンツを合成する自由が必要である。
トレーニング不要なLft-Manipulate-Render-DenoiseパイプラインであるGeoEditについて述べる。
我々は、シーンとオブジェクトを3Dで分離し、点対応を通してそれらを整列し、幾何学的に整列したプロキシを構造深度マップで描画する。
ビデオ拡散バックボーンはオブジェクトのアイデンティティを保存し、3D制約はノイズの分散(分散均質な注入)に合わせて狭いデノナイジングウィンドウ内で前景に注入される。
背景は自由に装飾されている。
注入された信号はネイティブの潜伏統計値と一致するため、自己注意は混乱しないままである。
また、GeoEditBenchは、オブジェクト翻訳、オブジェクト回転、カメラの動きを、ポーズ認識評価メトリクスでカバーする、ポーズ認識ベンチマークである。
実験により、幾何的精度、アイデンティティの忠実度、背景品質において一貫した利得が確認される。
私たちのコードはhttps://github.com/Heey731/GeoEditで公開されています。
関連論文リスト
- Attention-DP3: Spatially Object-aware 3D Diffusion Policy via Geometry-aligned Attentional Conditioning [54.692734738738885]
空間的オブジェクト認識型3D拡散ポリシーである textbfAttention-DP3 を提案する。
我々のパイプラインはRGB画像上でオープン語彙2Dセグメンテーションを行い、キャリブレーションされたカメラ幾何を用いて予測されたターゲットマスクを3Dに持ち上げる。
Adroit、DexArt、MetaWorld、および現実世界のSO101プラットフォームに関する実験は、DP3よりも一貫した改善を示し、最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2026-09-10T19:05:25Z) - Reliability-Aware 3D Geometric Injection for Universal Person Re-identification [47.874819213762926]
本稿では,一貫性を考慮した信頼性ゲートとDual-Stream Residual Fusionによって駆動されるUniversal Monocular 3D-Enhanced ReIDフレームワークを提案する。
本手法は,クリーンドメイン上での競合性能を維持しながら,難易度,構造に敏感なシナリオを改善する。
論文 参考訳(メタデータ) (2026-07-21T08:54:25Z) - When 2D Cues Fail: Improving Image Manipulation Localization with Reliable 3D Geometry [13.71230113114533]
既存の画像操作ローカライゼーション(IML)手法は、2D法医学的手がかりに大きく依存している。
我々は、純粋に2次元の証拠を超えて、IMLに幾何学的推論を導入することを提案する。
我々は,RGB機能と信頼性のある幾何学的手がかりを融合した幾何学的枠組み(GFrame)を設計し,より微細な局所化を改善するために大規模に伝播する。
論文 参考訳(メタデータ) (2026-07-20T15:08:46Z) - JanusMesh: Fast and Zero-Shot 3D Visual Illusion Generation via Cross-Space Denoising [4.625351881266883]
テキスト駆動型3次元視覚錯覚を生成するためのフレームワークを提案する。
提案手法は,3~5分で2次元のリアルな3Dイリュージョンを生成できる。
これは、幾何学的整合性、意味認識可能性、効率性において既存の手法を著しく上回っている。
論文 参考訳(メタデータ) (2026-06-18T17:59:55Z) - VGGT-Edit: Feed-forward Native 3D Scene Editing with Residual Field Prediction [59.303842406260124]
VGGT-Editはテキスト条件のネイティブ3Dシーン編集のためのフィードフォワードフレームワークである。
本研究では,奥行き同期テキストインジェクションを導入し,意味的指導をバックボーンの空間的ポーズと整合させる。
VGGT-Editは2Dリフトベースラインを大幅に上回り、よりシャープなオブジェクトの詳細、より強力なマルチビュー一貫性、ほぼインスタントな推論速度を生み出している。
論文 参考訳(メタデータ) (2026-05-14T17:59:04Z) - Velocity-Space 3D Asset Editing [45.94997633532406]
ローカルに3Dアセットを編集し、残りの部分を保存しながらターゲット領域を変更することは、ネイティブな3D編集の基本的な要件である。
Inversion-free, training-free, and mask-free framework that address each problem with a target intervention in the sampler。
論文 参考訳(メタデータ) (2026-05-08T07:42:12Z) - Interp3D: Correspondence-aware Interpolation for Generative Textured 3D Morphing [63.141976759536625]
テクスチャ化された3DモーフィングのためのトレーニングフリーフレームワークであるInterp3Dを提案する。
生成的先行性を利用し、幾何学的忠実さとテクスチャコヒーレンスの両方を保証するために、プログレッシブアライメント原理を採用する。
包括的評価のために, 難易度の高い専用データセットInterp3DDataを構築し, 忠実度, 遷移滑らか度, 可視性から生成結果を評価する。
論文 参考訳(メタデータ) (2026-01-20T16:03:22Z) - WorldWarp: Propagating 3D Geometry with Asynchronous Video Diffusion [78.20778143251171]
WorldWarpは、3D構造アンカーと2D生成ファインダを結合するフレームワークだ。
WorldWarpは、各ステップで3Dキャッシュを動的に更新することで、ビデオチャンク間の一貫性を維持する。
3Dロジックが構造をガイドし、拡散ロジックがテクスチャを完璧にすることで、最先端の忠実さを実現する。
論文 参考訳(メタデータ) (2025-12-22T18:53:50Z) - GeoPurify: A Data-Efficient Geometric Distillation Framework for Open-Vocabulary 3D Segmentation [57.8059956428009]
2次元視覚言語モデルから3次元セマンティックセグメンテーションへ機能を移行しようとする最近の試みは、永続的なトレードオフを露呈している。
3次元教師モデルから抽出した幾何学的事前情報を用いて2次元VLM生成した3次元点特徴に小さな学生親和性ネットワークを適用したGeoPurifyを提案する。
遅延幾何学情報と学習された親和性ネットワークから恩恵を受けることで、GeoPurifyはトレードオフを効果的に軽減し、優れたデータ効率を実現する。
論文 参考訳(メタデータ) (2025-10-02T16:37:56Z) - PG-SLAM: Photo-realistic and Geometry-aware RGB-D SLAM in Dynamic Environments [49.38692556283867]
ガウススプラッティングを拡張した写真リアリスティックかつ幾何学的RGB-D SLAM法を提案する。
本手法は,1)非剛体人や剛体物を含む動的前景のマッピング,2)静的背景の再構築,3)カメラのローカライズを行うための3つの主要モジュールから構成される。
実世界の様々なデータセットに対する実験により、カメラのローカライゼーションとシーン表現の観点から、我々の手法が最先端のアプローチより優れていることが示された。
論文 参考訳(メタデータ) (2024-11-24T12:00:55Z) - A3D: Does Diffusion Dream about 3D Alignment? [73.97853402817405]
幾何学的アライメントの観点からテキスト駆動型3D生成の問題に取り組む。
テキストプロンプトのセットが与えられたら、意味的に対応する部分同士が整列したオブジェクトの集合を生成することを目指している。
我々は、これらのオブジェクトを共通の潜在空間に埋め込み、これらのオブジェクト間の連続的な遷移を最適化することを提案する。
論文 参考訳(メタデータ) (2024-06-21T09:49:34Z) - OCM3D: Object-Centric Monocular 3D Object Detection [35.804542148335706]
モノクロ3次元物体検出のための新しい物体中心ボクセル表現を提案する。
具体的には、各オブジェクトの提案に基づいてボクセルを構築し、それらのサイズは点の3次元空間分布によって適応的に決定される。
本手法は、最先端の手法を大きなマージンで上回る。
論文 参考訳(メタデータ) (2021-04-13T09:15:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。