論文の概要: Wavelet Phase Diffusion for Structurally and Semantically Consistent Sim-to-Real Translation
- arxiv url: http://arxiv.org/abs/2607.21628v2
- Date: Wed, 29 Jul 2026 19:07:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-02 22:55:38.951686
- Title: Wavelet Phase Diffusion for Structurally and Semantically Consistent Sim-to-Real Translation
- Title(参考訳): ウェーブレット位相拡散によるSim-to-Real翻訳の構造的・意味的整合性
- Authors: Kaiwen Wang, Frank Bieder, Yinzhe Shen, Carlos Fernandez, Jan-Hendrik Pauls, Omer Sahin Tas,
- Abstract要約: シミュレーションから現実への変換は、合成ドメインと実際のドメインの間の外観ギャップを橋渡ししなければならない。
本稿では,大域スペクトル干渉を伴わない空間適応位相注入を実現するウェーブレット位相拡散法を提案する。
我々の手法は、競争的な構造的アライメントを維持しながら、リアリズムとセマンティック一貫性の先行手法より優れている。
- 参考スコア(独自算出の注目度): 8.622300381959768
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Simulation-to-reality translation must bridge the appearance gap between synthetic and real domains while preserving structural and semantic consistency. Conditioning-based methods achieve spatial alignment but introduce computationally expensive control modules. Paired-data methods achieve realism but rely on complex synthesis pipelines, often altering scene geometry and semantics. Training-free editing methods avoid both constraints but lack a learned appearance prior, limiting their perceptual quality. Recently proposed phase-preserving diffusion presents a promising alternative, but Fourier-domain formulations are constrained by global spectral coupling. This coupling induces spatial artifacts such as ringing and boundary leakage, thereby degrading structural and semantic consistency. We introduce Wavelet Phase Diffusion, which addresses this through two components. First, we operate in the Dual-Tree Complex Wavelet Packet Transform domain, whose localized wavelet packets enable spatially adaptive phase injection without global spectral interference. Second, Low-Frequency Randomization (LFR) replaces the low-frequency packet, decoupling the model from the synthetic illumination prior and enabling in-distribution real-world appearance. Both components train on unpaired open-domain data, and introduce negligible inference overhead. The spatial locality further enables instance-level translation, where individual objects or regions are translated to photorealistic appearance independently while the surrounding scene remains untranslated. On vKITTI $\to$ KITTI image translation, ours outperforms prior methods in realism and semantic consistency while maintaining competitive structural alignment. For CARLA video translation, ours approaches the realism of paired-data methods while reducing VLM planner ADE and FDE by $5.4\%$ and $5.1\%$, respectively.
- Abstract(参考訳): シミュレーションから現実への変換は、構造的および意味的一貫性を維持しながら、合成ドメインと実際のドメインの間の外観ギャップを橋渡ししなければならない。
コンディショニングに基づく手法は空間アライメントを実現するが、計算コストの高い制御モジュールを導入する。
ペアデータ手法はリアリズムを実現するが、複雑な合成パイプラインに依存し、しばしばシーンの幾何学や意味論を変化させる。
トレーニング不要な編集手法は、両方の制約を回避できるが、学習前の外観が欠如しており、知覚的品質が制限されている。
最近提案された位相保存拡散は有望な代替となるが、フーリエ領域の定式化は大域的なスペクトル結合によって制約される。
この結合は、リングや境界漏れなどの空間的アーティファクトを誘導し、構造的および意味的一貫性を低下させる。
本稿では、ウェーブレット位相拡散(Wavelet Phase Diffusion)を紹介します。
まず、Dual-Tree Complex Wavelet Packet Transform ドメインで動作し、局所的なウェーブレットパケットは、大域的なスペクトル干渉を伴わずに空間適応的な位相注入を可能にする。
第二に、低周波ランダム化(LFR)は低周波パケットを置き換え、合成照明の前のモデルから切り離し、非分配的な実世界の出現を可能にする。
どちらのコンポーネントも、未実装のオープンドメインデータをトレーニングし、無視可能な推論オーバーヘッドを導入する。
空間的局所性はさらに、個々のオブジェクトや領域が、周囲のシーンが翻訳されていないまま、独立してフォトリアリスティックな外観に変換されるインスタンスレベルの変換を可能にする。
vKITTI $\to$ KITTI画像変換では、競合構造アライメントを維持しながら、リアリズムとセマンティック一貫性の先行手法よりも優れている。
CARLAビデオ翻訳では、VLMプランナーADEとFDEをそれぞれ5.4\%$と5.1\%$に削減しながらペアデータ方式のリアリズムにアプローチする。
関連論文リスト
- Weaving Light and Time: Unified Harmonic-Geometric Representation Learning for Dense RGB-Event Parsing [55.13802890769086]
我々は、専用のRGB-Event解析用に特別に設計された最初の統一バックボーンであるEvitaを紹介する。
深いモーダルなシナジーを達成するため、Evitaはすべてのエンコーダ層に直接固有のコラーニングモジュール群を組み込む。
Evitaは、リアルタイムマルチモーダル認識において、より優れた精度とレイテンシのトレードオフを提供しながら、新しい最先端メトリクスを確立する。
論文 参考訳(メタデータ) (2026-07-10T06:52:09Z) - Hierarchical Consistency Learning for Test-time Adaptation in Camouflage Perception [50.278200968044665]
カモフラージュされた物体検出(COD)は、物理的属性を通して背景から最小限の知覚差を示すターゲットをローカライズすることを目的としている。
既存のメソッドは、静的なTrain-then-freezeパラダイムによって制約されており、ドメインの剛性と依存性のアノテーションに悩まされている。
動的表現再構成のためのテスト時間適応を統合した階層的一貫性学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-25T09:57:46Z) - OmniLiDAR: A Unified Diffusion Framework for Multi-Domain 3D LiDAR Generation [100.36917520403227]
本稿では,8つの代表領域にまたがる共有範囲画像表現において,LiDARスキャンを生成する統一テキスト条件拡散フレームワークを提案する。
パブリックな統合ベンチマークがなければ、実世界のスキャンと物理ベース気象シミュレーションとシステマティックビームリダクションを組み合わせた8ドメインデータセットを構築する。
論文 参考訳(メタデータ) (2026-05-13T17:42:20Z) - FD-DB: Frequency-Decoupled Dual-Branch Network for Unpaired Synthetic-to-Real Domain Translation [2.0687092208681923]
周波数分離型2分岐モデルであるFD-DBを提案する。
YCB-Vデータセットの実験により、FD-DBは実際のドメインの外観の整合性を改善し、下流セマンティックセマンティクスの性能を大幅に向上させることが示された。
論文 参考訳(メタデータ) (2026-02-10T07:16:53Z) - Adaptive Domain Shift in Diffusion Models for Cross-Modality Image Translation [35.54089670586124]
画像の相互変換は不安定で非効率である。
標準拡散アプローチはドメイン間の1つの大域的線型移動に依存することが多い。
生成プロセスに直接ドメインシフトダイナミクスを組み込む。
論文 参考訳(メタデータ) (2026-01-26T16:00:36Z) - Cross-Domain Transfer with Self-Supervised Spectral-Spatial Modeling for Hyperspectral Image Classification [5.784164305429653]
本稿では,自己管理型クロスドメイン転送フレームワークを提案する。
ソースラベルなしで伝送可能なスペクトル-空間結合表現を学習する。
実験結果は、安定した分類性能と強いクロスドメイン適応性を示す。
論文 参考訳(メタデータ) (2026-01-26T02:52:35Z) - REGLUE Your Latents with Global and Local Semantics for Entangled Diffusion [11.138412313646995]
本稿では,統合潜在拡散フレームワークREGLUEを紹介する。
軽量な畳み込み意味論は、多層VFM特徴を低次元空間構造表現に集約する。
ImageNet 256x256では、REGLUEは一貫して、REPA、ReDi、REGと同様に、SiT-B/2およびSiT-XL/2ベースラインのFIDと収束を改善している。
論文 参考訳(メタデータ) (2025-12-18T15:10:42Z) - Let Synthetic Data Shine: Domain Reassembly and Soft-Fusion for Single Domain Generalization [68.41367635546183]
単一ドメインの一般化は、単一のソースからのデータを使用して、さまざまなシナリオで一貫したパフォーマンスでモデルをトレーニングすることを目的としている。
モデル一般化を改善するために合成データを活用した学習フレームワークDRSFを提案する。
論文 参考訳(メタデータ) (2025-03-17T18:08:03Z) - LAW-Diffusion: Complex Scene Generation by Diffusion with Layouts [107.11267074981905]
LAW拡散(LAW-Diffusion)と呼ばれる意味制御可能なレイアウト・AWare拡散モデルを提案する。
LAW拡散は、特にコヒーレントな対象関係を持つ最先端の生成性能をもたらすことを示す。
論文 参考訳(メタデータ) (2023-08-13T08:06:18Z) - CSformer: Bridging Convolution and Transformer for Compressive Sensing [65.22377493627687]
本稿では,CNNからの詳細な空間情報を活用するためのハイブリッドフレームワークと,表現学習の強化を目的としたトランスフォーマーが提供するグローバルコンテキストを統合することを提案する。
提案手法は、適応的なサンプリングとリカバリからなるエンドツーエンドの圧縮画像センシング手法である。
実験により, 圧縮センシングにおける専用トランスアーキテクチャの有効性が示された。
論文 参考訳(メタデータ) (2021-12-31T04:37:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。