論文の概要: When 2D Cues Fail: Improving Image Manipulation Localization with Reliable 3D Geometry
- arxiv url: http://arxiv.org/abs/2607.18040v1
- Date: Mon, 20 Jul 2026 15:08:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.67118
- Title: When 2D Cues Fail: Improving Image Manipulation Localization with Reliable 3D Geometry
- Title(参考訳): 2次元キュウリが機能しないとき:信頼性3次元幾何による画像操作の局所化の改善
- Abstract要約: 既存の画像操作ローカライゼーション(IML)手法は、2D法医学的手がかりに大きく依存している。
我々は、純粋に2次元の証拠を超えて、IMLに幾何学的推論を導入することを提案する。
我々は,RGB機能と信頼性のある幾何学的手がかりを融合した幾何学的枠組み(GFrame)を設計し,より微細な局所化を改善するために大規模に伝播する。
- 参考スコア(独自算出の注目度): 13.71230113114533
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Existing image manipulation localization (IML) methods rely heavily on 2D forensic cues, such as low-level artifacts, noise traces, and semantic inconsistencies in the manipulated image. While effective in many cases, these cues become much less discriminative when manipulated regions are well blended with their surrounding context in appearance. In such cases, a manipulated region may remain locally appearance-consistent, but still violate the geometric structure of the surrounding scene. This limitation motivates us to go beyond purely 2D evidence and introduce geometric reasoning into IML. To this end, we leverage monocular reconstruction to obtain auxiliary geometric cues, including depth and surface normals. However, a key challenge lies in the fact that reconstructed geometry on manipulated images is inherently noisy and cannot be used naively. Rather than treating depth and normals as direct evidence, we estimate their reliability and exploit them selectively for localization. Based on this principle, we design a geometry-aware framework (GFrame) that fuses reliable geometric cues with RGB features and propagates them across scales to improve fine-grained localization. Extensive experiments show that the proposed method achieves excellent performance under limited budget constraints. These results indicate that reliable 3D geometry provides complementary forensic evidence beyond traditional 2D cues for IML. Related code will be released.
- Abstract(参考訳): 既存の画像操作ローカライゼーション(IML)手法は、低レベルのアーティファクト、ノイズトレース、操作された画像のセマンティックな矛盾など、2Dの法医学的手がかりに大きく依存している。
多くの場合は有効であるが、操作された領域が周囲の状況とよく混ざり合っていると、これらのキューはより差別的になりがちである。
このような場合、操作された領域は局所的な外観に一貫性が保たれるが、それでも周囲の風景の幾何学的構造に反する。
この制限は、純粋に2Dの証拠を超えて、IMLに幾何学的推論を導入する動機となります。
この目的のために、単分子再構成を利用して、深さや表面の正常を含む補助的な幾何学的手がかりを得る。
しかし、重要な課題は、操作された画像上の再構成された幾何学が本質的にノイズがあり、鼻で使うことができないという事実にある。
深度と正規度を直接的証拠として扱うのではなく、信頼性を推定し、局所化のためにそれらを選択的に活用する。
この原理に基づいて、RGB機能と信頼性のある幾何学的手がかりを融合させ、それらをスケールにわたって伝播させ、微粒化ローカライゼーションを改善する幾何学的枠組み(GFrame)を設計する。
拡張実験により,提案手法は限られた予算制約下で優れた性能を発揮することが示された。
これらの結果から,信頼性の高い3次元幾何は,従来の2次元手技以上の補足的法学的な証拠をもたらすことが示唆された。
関連コードはリリースされます。
関連論文リスト
- PhyEdit: Towards Real-World Object Manipulation via Physically-Grounded Image Editing [24.0524480042673]
画像編集フレームワークであるPhyEditを開発した。
このプラグアンドプレイ3Dとジョイント2D-3Dの監督を組み合わせることで,物理的精度と操作の整合性を効果的に向上する。
ペア画像と奥行きアノテーションを備えた3次元オブジェクト操作のための実世界のデータセットであるRealManip-10Kを提案する。
論文 参考訳(メタデータ) (2026-04-08T15:53:57Z) - Make Geometry Matter for Spatial Reasoning [62.61667611352403]
視覚言語モデル(VLM)は、強いイメージと映像理解を実現するが、静的シーンとダイナミックビデオの両方で空間的推論を行う能力は限られている。
近年の進歩は、事前訓練された3次元基礎モデルから幾何学トークンをVLMに注入することで、この制限に対処しようとしている。
我々は、VLMが幾何トークンで積極的に推論するように促すことにより、幾何学的問題を作るためのフレームワークGeoSRを提案する。
論文 参考訳(メタデータ) (2026-03-27T17:45:12Z) - ControlVP: Interactive Geometric Refinement of AI-Generated Images with Consistent Vanishing Points [32.23473666846317]
生成した画像の点不整合を補正するユーザガイドフレームワークである制御VPを提案する。
提案手法は, 構造物の輪郭から導出される構造的ガイダンスを組み込むことにより, 事前学習拡散モデルを拡張する。
本手法は,ベースラインに匹敵する視力を維持しながら,グローバルな幾何整合性を向上させる。
論文 参考訳(メタデータ) (2025-12-08T12:38:11Z) - G4Splat: Geometry-Guided Gaussian Splatting with Generative Prior [53.762256749551284]
我々は,3次元シーン再構成を効果的に活用するための基本的な前提条件として,正確な幾何学を同定する。
生成パイプライン全体にこの幾何学的ガイダンスを導入し、可視性マスク推定を改善し、新しいビュー選択をガイドし、ビデオ拡散モデルに着色した場合の多視点一貫性を向上させる。
本手法は,屋内および屋外の両方のシナリオにおいて,高い一般化性を有するシングルビュー入力とアンポーズ映像を自然にサポートする。
論文 参考訳(メタデータ) (2025-10-14T03:06:28Z) - GeoPurify: A Data-Efficient Geometric Distillation Framework for Open-Vocabulary 3D Segmentation [57.8059956428009]
2次元視覚言語モデルから3次元セマンティックセグメンテーションへ機能を移行しようとする最近の試みは、永続的なトレードオフを露呈している。
3次元教師モデルから抽出した幾何学的事前情報を用いて2次元VLM生成した3次元点特徴に小さな学生親和性ネットワークを適用したGeoPurifyを提案する。
遅延幾何学情報と学習された親和性ネットワークから恩恵を受けることで、GeoPurifyはトレードオフを効果的に軽減し、優れたデータ効率を実現する。
論文 参考訳(メタデータ) (2025-10-02T16:37:56Z) - GSGTrack: Gaussian Splatting-Guided Object Pose Tracking from RGB Videos [18.90495041083675]
本稿では,新しいRGBベースのポーズトラッキングフレームワークであるGSGTrackを紹介する。
トラッキング中のノイズに過度に敏感な画素ワイド損失の問題に対処するために,物体のシルエット損失を提案する。
OnePoseとHO3Dの実験では、6DoFのポーズトラッキングとオブジェクト再構成の両方においてGSGTrackの有効性が示されている。
論文 参考訳(メタデータ) (2024-12-03T08:38:44Z) - GeoLRM: Geometry-Aware Large Reconstruction Model for High-Quality 3D Gaussian Generation [65.33726478659304]
GeoLRM(Geometry-Aware Large Restruction Model)は、512kガウスと21の入力画像で11GBのGPUメモリで高品質な資産を予測できる手法である。
従来の作品では、3D構造の本質的な空間性は無視されており、3D画像と2D画像の間の明示的な幾何学的関係は利用されていない。
GeoLRMは、3Dポイントを直接処理し、変形可能なクロスアテンション機構を使用する新しい3D対応トランスフォーマー構造を導入することで、これらの問題に対処する。
論文 参考訳(メタデータ) (2024-06-21T17:49:31Z) - Flattening-Net: Deep Regular 2D Representation for 3D Point Cloud
Analysis [66.49788145564004]
我々は、任意の幾何学と位相の不規則な3次元点雲を表現するために、Flattning-Netと呼ばれる教師なしのディープニューラルネットワークを提案する。
我々の手法は、現在の最先端の競合相手に対して好意的に機能する。
論文 参考訳(メタデータ) (2022-12-17T15:05:25Z) - Beyond 3DMM: Learning to Capture High-fidelity 3D Face Shape [77.95154911528365]
3Dモーフィブルモデル(3DMM)の適合性は、その強力な3D先行性のため、顔解析に広く有用である。
以前に再建された3次元顔は、微細な形状が失われるため、視差の低下に悩まされていた。
本論文は, パーソナライズされた形状が対応する人物と同一に見えるよう, パーソナライズされた形状を捉えるための完全な解を提案する。
論文 参考訳(メタデータ) (2022-04-09T03:46:18Z) - Depth Completion using Geometry-Aware Embedding [22.333381291860498]
本稿では,幾何認識の埋め込みを効率的に学習する手法を提案する。
局所的および大域的な幾何学的構造情報を、例えば、シーンレイアウト、オブジェクトのサイズと形状などの3Dポイントから符号化し、深度推定を導く。
論文 参考訳(メタデータ) (2022-03-21T12:06:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。