論文の概要: Retrieval-guided Cross-view Image Synthesis
- arxiv url: http://arxiv.org/abs/2411.19510v1
- Date: Fri, 29 Nov 2024 07:04:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2024-12-02 15:21:49.731323
- Title: Retrieval-guided Cross-view Image Synthesis
- Title(参考訳): 検索誘導型クロスビュー画像合成
- Authors: Hongji Yang, Yiru Li, Yingying Zhu,
- Abstract要約: クロスビュー画像合成は、異なる視点や視点からシーンの新しい画像を生成する。
本稿では,ドメインギャップを埋め込むために,検索ネットワークを組込みとして利用する新しい検索誘導フレームワークを提案する。
また,都市環境における多彩なクロスビュー画像ペアの提供により,データセットの多様性を向上する新たなデータセットVIGOR-GENを提案する。
- 参考スコア(独自算出の注目度): 3.7477511412024573
- License:
- Abstract: Cross-view image synthesis involves generating new images of a scene from different viewpoints or perspectives, given one input image from other viewpoints. Despite recent advancements, there are several limitations in existing methods: 1) reliance on additional data such as semantic segmentation maps or preprocessing modules to bridge the domain gap; 2) insufficient focus on view-specific semantics, leading to compromised image quality and realism; and 3) a lack of diverse datasets representing complex urban environments. To tackle these challenges, we propose: 1) a novel retrieval-guided framework that employs a retrieval network as an embedder to address the domain gap; 2) an innovative generator that enhances semantic consistency and diversity specific to the target view to improve image quality and realism; and 3) a new dataset, VIGOR-GEN, providing diverse cross-view image pairs in urban settings to enrich dataset diversity. Extensive experiments on well-known CVUSA, CVACT, and new VIGOR-GEN datasets demonstrate that our method generates images of superior realism, significantly outperforming current leading approaches, particularly in SSIM and FID evaluations.
- Abstract(参考訳): クロスビュー画像合成は、他の視点から1つの入力画像が与えられた場合、異なる視点または視点からシーンの新しい画像を生成する。
最近の進歩にもかかわらず、既存の方法にはいくつかの制限がある。
1) ドメインギャップを埋めるためにセマンティックセグメンテーションマップや前処理モジュールなどの追加データに依存する。
2)ビュー固有のセマンティクスに焦点が当てられず、画像の品質とリアリズムが損なわれる。
3)複雑な都市環境を表す多様なデータセットの欠如。
これらの課題に取り組むために、我々は次のように提案する。
1) ドメインギャップに対処するため,検索ネットワークを埋め込みとして利用する新たな検索誘導フレームワーク
2 画像の質とリアリズムを改善するため、対象視点に特有の意味的整合性と多様性を高める革新的な生成装置
3) 新しいデータセットであるVIGOR-GENは、データセットの多様性を豊かにするために、都市環境における多様なクロスビューイメージペアを提供する。
CVUSA,CVACT,新しいVIGOR-GENデータセットの広汎な実験により,本手法は優れたリアリズムの画像を生成し,特にSSIMおよびFID評価において,現在の先行するアプローチを著しく上回っていることが示された。
関連論文リスト
- A Multimodal Approach Combining Structural and Cross-domain Textual Guidance for Weakly Supervised OCT Segmentation [12.948027961485536]
Weakly Supervised Semantic (WSSS) アプローチを提案する。
本手法は診断精度の向上と医用画像の効率向上に資する技術である。
論文 参考訳(メタデータ) (2024-11-19T16:20:27Z) - Where Do We Stand with Implicit Neural Representations? A Technical and Performance Survey [16.89460694470542]
Inlicit Neural Representation (INR) は知識表現のパラダイムとして登場した。
INRは、データを連続的な暗黙の関数としてモデル化するために多層パーセプトロン(MLP)を利用する。
この調査では、アクティベーション機能、位置エンコーディング、統合戦略、ネットワーク構造という4つの重要な領域に分類する明確な分類法を紹介した。
論文 参考訳(メタデータ) (2024-11-06T06:14:24Z) - Trustworthy Image Semantic Communication with GenAI: Explainablity, Controllability, and Efficiency [59.15544887307901]
画像意味コミュニケーション(ISC)は,高効率な映像コンテンツ伝送を実現する可能性に注目されている。
既存のISCシステムは、解釈可能性、操作性、互換性の課題に直面している。
我々は、複数の下流推論タスクにGenerative Artificial Intelligence(GenAI)を利用する新しい信頼できるISCフレームワークを提案する。
論文 参考訳(メタデータ) (2024-08-07T14:32:36Z) - Multimodal Relation Extraction with Cross-Modal Retrieval and Synthesis [89.04041100520881]
本研究は,対象物,文,画像全体に基づいて,テキストおよび視覚的証拠を検索することを提案する。
我々は,オブジェクトレベル,画像レベル,文レベル情報を合成し,同一性と異なるモダリティ間の推論を改善する新しい手法を開発した。
論文 参考訳(メタデータ) (2023-05-25T15:26:13Z) - Autoencoder for Synthetic to Real Generalization: From Simple to More
Complex Scenes [13.618797548020462]
我々は,自己エンコーダアーキテクチャに注目し,シミュレーション画像と実画像の領域シフトに起因する帰納的バイアスに不変な潜在空間表現の学習を目指す。
本稿では,視覚的複雑性が増大する実際のデータセットに対して,一般化可能性を高め,セマンティクスの保存を改善するためのアプローチを提案する。
論文 参考訳(メタデータ) (2022-04-01T12:23:41Z) - Deep Partial Multi-View Learning [94.39367390062831]
クロスパーシャル・マルチビュー・ネットワーク(CPM-Nets)と呼ばれる新しいフレームワークを提案する。
我々はまず、多視点表現に対する完全性と汎用性の形式的な定義を提供する。
そして、理論的に学習された潜在表現の多元性を証明する。
論文 参考訳(メタデータ) (2020-11-12T02:29:29Z) - Synthetic Convolutional Features for Improved Semantic Segmentation [139.5772851285601]
本稿では、中間畳み込み特徴を生成することを提案し、そのような中間畳み込み特徴に対応する最初の合成手法を提案する。
これにより、ラベルマスクから新機能を生成し、トレーニング手順にうまく組み込むことができます。
Cityscapes と ADE20K の2つの挑戦的なデータセットに関する実験結果と分析により,生成した特徴がセグメンテーションタスクのパフォーマンスを向上させることが示された。
論文 参考訳(メタデータ) (2020-09-18T14:12:50Z) - Bowtie Networks: Generative Modeling for Joint Few-Shot Recognition and
Novel-View Synthesis [39.53519330457627]
本稿では,複数ショット認識と新規ビュー合成という新たな課題を提案する。
我々は、オブジェクト分類器を同時に学習し、新しい視点からそのタイプのオブジェクトの画像を生成することを目的としている。
生成モデルと識別モデルとの相互作用と協調に焦点を当てる。
論文 参考訳(メタデータ) (2020-08-16T19:40:56Z) - Example-Guided Image Synthesis across Arbitrary Scenes using Masked
Spatial-Channel Attention and Self-Supervision [83.33283892171562]
実例誘導画像合成は,最近セマンティックラベルマップと模範画像から画像を合成するために試みられている。
本稿では,ラベルマップと意味的に異なる任意のシーンイメージを例に,より困難で汎用的な課題に取り組む。
本稿では,グローバル・ローカルな特徴アライメントと合成のためのエンドツーエンドネットワークを提案する。
論文 参考訳(メタデータ) (2020-04-18T18:17:40Z) - Hierarchy Composition GAN for High-fidelity Image Synthesis [57.32311953820988]
本稿では,革新的階層構成GAN(HIC-GAN)を提案する。
HIC-GANは、幾何学と外観領域における画像合成をエンドツーエンドのトレーニング可能なネットワークに組み込んでいる。
シーンテキスト画像合成, 肖像画編集, 室内レンダリングタスクの実験により, 提案したHIC-GANは, 質的, 定量的に優れた合成性能が得られることを示した。
論文 参考訳(メタデータ) (2019-05-12T11:11:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。