論文の概要: FD-DB: Frequency-Decoupled Dual-Branch Network for Unpaired Synthetic-to-Real Domain Translation
- arxiv url: http://arxiv.org/abs/2602.09476v2
- Date: Wed, 11 Feb 2026 10:17:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-02-12 15:03:20.137748
- Title: FD-DB: Frequency-Decoupled Dual-Branch Network for Unpaired Synthetic-to-Real Domain Translation
- Title(参考訳): FD-DB:未ペア合成ドメイン翻訳のための周波数分離型デュアルブランチネットワーク
- Abstract要約: 周波数分離型2分岐モデルであるFD-DBを提案する。
YCB-Vデータセットの実験により、FD-DBは実際のドメインの外観の整合性を改善し、下流セマンティックセマンティクスの性能を大幅に向上させることが示された。
- 参考スコア(独自算出の注目度): 2.0687092208681923
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Synthetic data provide low-cost, accurately annotated samples for geometry-sensitive vision tasks, but appearance and imaging differences between synthetic and real domains cause severe domain shift and degrade downstream performance. Unpaired synthetic-to-real translation can reduce this gap without paired supervision, yet existing methods often face a trade-off between photorealism and structural stability: unconstrained generation may introduce deformation or spurious textures, while overly rigid constraints limit adaptation to real-domain statistics. We propose FD-DB, a frequency-decoupled dual-branch model that separates appearance transfer into low-frequency interpretable editing and high-frequency residual compensation. The interpretable branch predicts physically meaningful editing parameters (white balance, exposure, contrast, saturation, blur, and grain) to build a stable low-frequency appearance base with strong content preservation. The free branch complements fine details through residual generation, and a gated fusion mechanism combines the two branches under explicit frequency constraints to limit low-frequency drift. We further adopt a two-stage training schedule that first stabilizes the editing branch and then releases the residual branch to improve optimization stability. Experiments on the YCB-V dataset show that FD-DB improves real-domain appearance consistency and significantly boosts downstream semantic segmentation performance while preserving geometric and semantic structures.
- Abstract(参考訳): 合成データは、幾何学的視覚タスクのための低コストで正確に注釈付けされたサンプルを提供するが、合成ドメインと実際のドメインの外観と画像の違いは、深刻なドメインシフトを引き起こし、下流のパフォーマンスを低下させる。
しかし、既存の手法では光現実主義と構造安定性のトレードオフに直面している: 制約のない生成は変形や刺激的なテクスチャを導入し、一方、厳密な制約は実統計統計に適応することを制限している。
周波数分離型2分岐モデルであるFD-DBを提案する。
解釈可能な分岐は、物理的に意味のある編集パラメータ(ホワイトバランス、露光、コントラスト、飽和、ぼかし、穀物)を予測し、強いコンテンツ保存を伴う安定した低周波外観ベースを構築する。
フリーブランチは残留生成を通じて詳細を補完し、ゲート融合機構は2つの分岐を明示的な周波数制約の下で結合し、低周波ドリフトを制限する。
さらに、2段階のトレーニングスケジュールを採用し、まず編集ブランチを安定化させ、その後、残枝をリリースして最適化の安定性を向上させる。
YCB-Vデータセットの実験により、FD-DBは実際のドメインの外観の整合性を改善し、幾何学的・意味的構造を保ちながら下流のセマンティックセグメンテーション性能を大幅に向上することが示された。
関連論文リスト
- Null-Space Diffusion Restoration with Adaptive Uncertainty-Guided Fusion for Ultrasound Speckle Reduction [2.081691729410268]
超音波Bモードイメージングは通常、スペックルノイズやアーティファクトに悩まされる。
新しい不確実性誘導型ヌル空間拡散(UGNS)フレームワークは、安定化された正エンベローププロキシ上での整合性を強制する。
UGNSは細かな空間分解能を保ちながらスペックルノイズを効果的に抑制することが検証された。
論文 参考訳(メタデータ) (2026-08-30T14:45:13Z) - FAN-LoRA: A Fourier-Adaptive Nonlinear Low-Rank Adaptor for Medical Foundation Model Domain Adaptation [11.04143971119602]
本稿では,周波数分離型ファインチューニングアーキテクチャであるFAN-LoRAを提案する。
FAN-LoRAは、最先端のPEFTベースラインを一貫して上回ることを示す。
提案手法は,最強の競合相手と比較して,平均Diceスコアにおける一貫した改善と境界誤差の顕著な低減を実現している。
論文 参考訳(メタデータ) (2026-08-27T02:08:57Z) - Wavelet Phase Diffusion for Structurally and Semantically Consistent Sim-to-Real Translation [8.622300381959768]
シミュレーションから現実への変換は、合成ドメインと実際のドメインの間の外観ギャップを橋渡ししなければならない。
本稿では,大域スペクトル干渉を伴わない空間適応位相注入を実現するウェーブレット位相拡散法を提案する。
我々の手法は、競争的な構造的アライメントを維持しながら、リアリズムとセマンティック一貫性の先行手法より優れている。
論文 参考訳(メタデータ) (2026-07-08T13:30:26Z) - Distilling Temporal Coherence into 2D Networks for Transrectal Ultrasound Prostate Video Segmentation [2.65131397683555]
経直腸超音波(TRUS)における前立腺のリアルタイムビデオセグメンテーションは画像誘導的介入に不可欠である。
本稿では,時間的コヒーレンスをトレーニング中に2次元ネットワークに蒸留する時間的一貫性学習フレームワークを提案する。
前立腺は幾何学的安定性を示し,周囲の音環境は生理的動きや振動子圧力によって変動する。
論文 参考訳(メタデータ) (2026-06-30T06:27:02Z) - Where to Refine, When to Stop: Rethinking Redundancy via Latent Discrepancy for Efficient Visual Autoregressive Generation [50.139984798361375]
遅延不一致による冗長性を除去する学習自由フレームワークを提案する。
LD-Pruningは、Infinity-8Bの最大2.35倍のスピードアップを実現し、高い生成品質を維持しながら推論を大幅に削減する。
論文 参考訳(メタデータ) (2026-05-29T19:34:39Z) - Hierarchical Consistency Learning for Test-time Adaptation in Camouflage Perception [50.278200968044665]
カモフラージュされた物体検出(COD)は、物理的属性を通して背景から最小限の知覚差を示すターゲットをローカライズすることを目的としている。
既存のメソッドは、静的なTrain-then-freezeパラダイムによって制約されており、ドメインの剛性と依存性のアノテーションに悩まされている。
動的表現再構成のためのテスト時間適応を統合した階層的一貫性学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-25T09:57:46Z) - OmniLiDAR: A Unified Diffusion Framework for Multi-Domain 3D LiDAR Generation [100.36917520403227]
本稿では,8つの代表領域にまたがる共有範囲画像表現において,LiDARスキャンを生成する統一テキスト条件拡散フレームワークを提案する。
パブリックな統合ベンチマークがなければ、実世界のスキャンと物理ベース気象シミュレーションとシステマティックビームリダクションを組み合わせた8ドメインデータセットを構築する。
論文 参考訳(メタデータ) (2026-05-13T17:42:20Z) - PRISM: Prior Rectification and Uncertainty-Aware Structure Modeling for Diffusion-Based Text Image Super-Resolution [51.96078493242164]
PRISMは単一ステップ拡散ベースのText-SRフレームワークである。
PRISMはミリ秒レベルの推論で最先端の性能を達成する。
論文 参考訳(メタデータ) (2026-05-13T05:31:06Z) - Better with Less: Tackling Heterogeneous Multi-Modal Image Joint Pretraining via Conditioned and Degraded Masked Autoencoder [34.73963627819185]
高分解能光合成開口レーダ(SAR)プレトレーニングは、単一ソース表現を相互に強化するために、モダリティの相乗効果を求める。
我々は、アライメントの少ないテキスト・ベッター・シナジーの先駆者であるCoDe-MAEを提案する。
CoDe-MAEは、表現の劣化を防ぎ、多様な単一および双方向の下流タスクにまたがる新しい最先端のパフォーマンスを確立する。
論文 参考訳(メタデータ) (2026-04-18T10:23:00Z) - Silent Inconsistency in Data-Parallel Full Fine-Tuning: Diagnosing Worker-Level Optimization Misalignment [27.352639822596146]
クロスワーカーの損失と勾配のばらつきは、従来の監視信号では見えない。
本稿では,標準パイプラインで容易に利用できるトレーニング信号を用いて,作業者レベルの一貫性を定量化する,モデルに依存しない診断フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-16T04:42:30Z) - TIP: Resisting Gradient Inversion via Targeted Interpretable Perturbation in Federated Learning [8.156452885913108]
フェデレートラーニング(FL)は、データの局所性を維持しながら協調的なモデルトレーニングを促進する。
勾配の交換により、システムはグラディエント・インバージョン・アタック(GIAs)に弱い。
本稿では、モデル解釈可能性と周波数領域解析を統合する新しい防御フレームワークTIPを提案する。
論文 参考訳(メタデータ) (2026-02-12T06:32:49Z) - Generalizing GNNs with Tokenized Mixture of Experts [75.8310720413187]
安定性の向上には,変化に敏感な特徴への依存を低減し,既約最悪の一般化フロアを残す必要があることを示す。
本研究では,STEM-GNNを提案する。STEM-GNN,STEM-GNN,STEM-GNN,STEM-GNN,STEM-GNN,STEM-GNN,STEM-GNN,STEM-GNN,STEM-GNN。
9つのノード、リンク、グラフのベンチマークで、STEM-GNNはより強力な3方向バランスを実現し、クリアグラフ上での競争力を維持しながら、次数/ホモフィリーシフトや特徴/エッジの破損に対する堅牢性を改善している。
論文 参考訳(メタデータ) (2026-02-09T22:48:30Z) - Cross-Domain Transfer with Self-Supervised Spectral-Spatial Modeling for Hyperspectral Image Classification [5.784164305429653]
本稿では,自己管理型クロスドメイン転送フレームワークを提案する。
ソースラベルなしで伝送可能なスペクトル-空間結合表現を学習する。
実験結果は、安定した分類性能と強いクロスドメイン適応性を示す。
論文 参考訳(メタデータ) (2026-01-26T02:52:35Z) - Knowledge-Embedded and Hypernetwork-Guided Few-Shot Substation Meter Defect Image Generation Method [0.0]
変電所メータは電力グリッドの安定運用の監視と確保において重要な役割を担っている。
クラックやその他の物理的欠陥の検出は、しばしば、注釈付きサンプルの深刻な不足によって妨げられる。
本研究では,条件付き知識埋め込みとHypernetwork-Guided Controlを安定拡散パイプラインに統合する新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2026-01-14T07:21:57Z) - Robust-R1: Degradation-Aware Reasoning for Robust Visual Understanding [54.05243949024302]
既存の堅牢なMLLMは、視覚エンコーダの一般化にのみ焦点をあてた暗黙のトレーニング/適応に依存している。
本稿では,構造的推論連鎖による視覚的劣化を明示的にモデル化する新しいフレームワークであるRobust-R1を提案する。
提案手法は, (i) 劣化を考慮した推論基盤の微調整, (ii) 劣化パラメータを正確に知覚するための報酬駆動アライメント, (iii) 劣化強度に適応した動的推論深度スケーリングの2つを統合した。
論文 参考訳(メタデータ) (2025-12-19T12:56:17Z) - Error-Propagation-Free Learned Video Compression With Dual-Domain Progressive Temporal Alignment [92.57576987521107]
両ドメインのプログレッシブな時間的アライメントと品質条件の混合(QCMoE)を備えた新しい統合変換フレームワークを提案する。
QCMoEは、魅力的なR-Dパフォーマンスで連続的かつ一貫したレート制御を可能にする。
実験結果から,提案手法は最先端技術と比較して,競争力のあるR-D性能を実現することが示された。
論文 参考訳(メタデータ) (2025-12-11T09:14:51Z) - Morphing Through Time: Diffusion-Based Bridging of Temporal Gaps for Robust Alignment in Change Detection [51.56484100374058]
既存の変更検出ネットワークを変更することなく空間的・時間的ロバスト性を改善するモジュールパイプラインを導入する。
拡散モジュールは、大きな外観ギャップをブリッジする中間変形フレームを合成し、RoMaは段階的に対応を推定できる。
LEVIR-CD、WHU-CD、DSIFN-CDの実験は、登録精度と下流変化検出の両方において一貫した利得を示した。
論文 参考訳(メタデータ) (2025-11-11T08:40:28Z) - Quality-Aware Language-Conditioned Local Auto-Regressive Anomaly Synthesis and Detection [30.77558600436759]
ARAS(ARAS)は、言語条件付き自動回帰異常合成手法である。
トークンアンコールによる遅延編集によって、ローカルでテキスト指定の欠陥を通常の画像に注入する。
欠陥リアリズムを著しく強化し、きめ細かい材料テクスチャを保存し、合成された異常に対して連続的な意味制御を提供する。
論文 参考訳(メタデータ) (2025-08-05T15:07:32Z) - Low-Light Video Enhancement via Spatial-Temporal Consistent Decomposition [52.89441679581216]
低照度ビデオエンハンスメント(LLVE)は、激しい視認性とノイズに悩まされる動的または静的なシーンの復元を目指している。
本稿では、ビューに依存しない、ビューに依存しないコンポーネントを組み込んだ革新的なビデオ分解戦略を提案する。
我々のフレームワークは、既存のメソッドを一貫して上回り、新しいSOTAパフォーマンスを確立します。
論文 参考訳(メタデータ) (2024-05-24T15:56:40Z) - Unpaired Adversarial Learning for Single Image Deraining with Rain-Space
Contrastive Constraints [61.40893559933964]
我々は,CDR-GAN という名称の GAN フレームワークにおいて,比較学習手法により,経験者の相互特性を探索する有効な非経験的 SID 手法を開発した。
提案手法は, 合成および実世界の両方のデータセットにおいて, 既存の非対効果のデラミニング手法に対して良好に動作し, 完全教師付きモデルや半教師付きモデルよりも優れている。
論文 参考訳(メタデータ) (2021-09-07T10:00:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。