論文の概要: Texture-Shape Bias Balancing for Robust Synthetic-to-Real Semantic Segmentation in Automotive NIR Imagery
- arxiv url: http://arxiv.org/abs/2606.15072v1
- Date: Sat, 13 Jun 2026 03:01:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-16 16:21:32.764763
- Title: Texture-Shape Bias Balancing for Robust Synthetic-to-Real Semantic Segmentation in Automotive NIR Imagery
- Title(参考訳): 自動車用NIR画像におけるロバスト合成とリアルセマンティックセマンティックセマンティックセグメンテーションのためのテクスチャ形状バイアスバランス
- Authors: Felix Stillger, Ben Hamscher, Lukas Hahn, Annika Mütze, Tobias Meisen, Kira Maag,
- Abstract要約: 自動車領域におけるNIR画像のセマンティックセグメンテーションのための合成ドメインと実ドメインの適応に関する最初の体系的研究について述べる。
合成画像をリアルなNIRスタイルに変換する生成拡張フレームワークを提案する。
実験により、訓練中の帰納バイアスのバランスが、顕著に堅牢なセマンティックセグメンテーションをもたらすことが示された。
- 参考スコア(独自算出の注目度): 6.537821116235228
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Semantic segmentation is a fundamental component of visual perception in modern automotive systems, enabling pixel-level scene understanding. Near-Infrared imaging (NIR) offers stable detection under difficult illumination conditions, but the development of domain-specific semantic segmentation models remains challenging due to the lack of high-quality annotated data from real-world scenarios. Synthetic datasets offer a scalable alternative, but models trained on synthetic images often suffer performance degradation when transferred to real domains. We present the first systematic study on synthetic to real domain adaptation for semantic segmentation in NIR images in the automotive domain. We propose a generative augmentation framework that transforms synthetic images into realistic NIR-style variants via our introduced target style adaptation (TSA). TSA fine-tunes a latent diffusion model via low-rank adaptation on a small curated set of real NIR images and applies it to synthetic training data using structure-preserving multi-signal conditioning. To reduce texture bias and improve segmentation robustness, we further apply a Voronoi-based style diversification strategy (VSD) that modifies the original textures while preserving scene geometry. Experiments with multiple model architectures on NIR data from vehicle interiors and street scenes show that balancing inductive bias during training leads to noticeably more robust semantic segmentation and effectively reduces the domain gap in our real-world scenarios by up to 63.6% on exterior and 28.4% on interior data. The code is available at GitHub.
- Abstract(参考訳): セマンティックセグメンテーションは、現代の自動車システムにおける視覚知覚の基本的な構成要素であり、ピクセルレベルのシーン理解を可能にする。
近赤外画像(NIR)は、困難な照明条件下で安定した検出を提供するが、実際のシナリオから得られる高品質な注釈データがないため、ドメイン固有のセマンティックセグメンテーションモデルの開発は依然として困難である。
合成データセットはスケーラブルな代替手段を提供するが、合成画像に基づいてトレーニングされたモデルは、実際のドメインに転送されると、しばしばパフォーマンスが劣化する。
自動車領域におけるNIR画像のセマンティックセグメンテーションのための合成ドメインと実ドメインの適応に関する最初の体系的研究について述べる。
提案するターゲット型適応(TSA)により,合成画像をリアルなNIRスタイルの変種に変換する生成拡張フレームワークを提案する。
TSAは、少数の実NIR画像に対して低ランク適応による潜伏拡散モデルを微調整し、構造保存多信号条件付き合成訓練データに適用する。
さらに,テクスチャバイアスを低減し,セグメンテーションの堅牢性を向上させるために,シーン形状を保ちながら元のテクスチャを変更するヴォロノイスタイルの多様化戦略(VSD)を適用した。
車室内やストリートシーンからのNIRデータに対する複数のモデルアーキテクチャによる実験では、トレーニング中の帰納的バイアスのバランスが顕著に堅牢なセマンティックセグメンテーションをもたらし、現実世界のシナリオにおけるドメインギャップを、外装で最大63.6%、内装で最大28.4%削減することが示された。
コードはGitHubで入手できる。
関連論文リスト
- Dual-domain Adaptation Networks for Realistic Image Super-resolution [81.34345637776408]
現実画像超解像(SR)は、現実世界の低解像度(LR)画像を高解像度(HR)画像に変換することに焦点を当てている。
現在の手法は、限られた現実世界のLR-HRデータと競合し、基本的な画像特徴の学習に影響を及ぼす。
我々は、シミュレーションされた画像SRモデルを実世界のデータセットに効率よく適応できる新しいアプローチを提案する。
論文 参考訳(メタデータ) (2025-11-21T12:57:23Z) - Hybrid CNN-ViT Framework for Motion-Blurred Scene Text Restoration [2.0855516369698845]
我々は、畳み込みニューラルネットワーク(CNN)と視覚変換器(ViT)を組み合わせたハイブリッドディープラーニングフレームワークを導入する。
アーキテクチャは構造の詳細を保存するためにCNNベースのエンコーダデコーダを使用し、トランスフォーマーモジュールは自己注意を通じてグローバルな認識を高める。
提案手法は,PSNRでは32.20dB,SSIMでは0.934dB,軽量では2.83万パラメータ,平均推定時間は61msである。
論文 参考訳(メタデータ) (2025-11-08T17:48:58Z) - Cityscape-Adverse: Benchmarking Robustness of Semantic Segmentation with Realistic Scene Modifications via Diffusion-Based Image Editing [1.6316196319061707]
拡散に基づく画像編集を利用した8つの悪条件をシミュレートするベンチマークであるCityscape-Adverseを紹介する。
CNNとトランスフォーマーを用いたセマンティックセグメンテーションモデルの性能評価を行った。
我々は、Cityscape-Adverseでトレーニングされたモデルが、目に見えないドメインに適用した場合、大幅にレジリエンスを向上させることを検証した。
論文 参考訳(メタデータ) (2024-11-01T07:47:37Z) - Is Synthetic Image Useful for Transfer Learning? An Investigation into Data Generation, Volume, and Utilization [62.157627519792946]
ブリッジドトランスファー(ブリッジドトランスファー)と呼ばれる新しいフレームワークを導入する。このフレームワークは、当初、トレーニング済みモデルの微調整に合成画像を使用し、転送性を向上させる。
合成画像と実画像のスタイルアライメントを改善するために,データセットスタイルの逆変換方式を提案する。
提案手法は10の異なるデータセットと5つの異なるモデルで評価され、一貫した改善が示されている。
論文 参考訳(メタデータ) (2024-03-28T22:25:05Z) - DNS SLAM: Dense Neural Semantic-Informed SLAM [92.39687553022605]
DNS SLAMは、ハイブリッド表現を備えた新しいRGB-DセマンティックSLAMアプローチである。
本手法は画像に基づく特徴抽出と多視点幾何制約を統合し,外観の細部を改良する。
実験により, 合成データと実世界のデータ追跡の両面において, 最先端の性能が得られた。
論文 参考訳(メタデータ) (2023-11-30T21:34:44Z) - Physics-Driven Turbulence Image Restoration with Stochastic Refinement [80.79900297089176]
大気乱流による画像歪みは、長距離光学画像システムにおいて重要な問題である。
ディープラーニングモデルが現実世界の乱流条件に適応するために、高速で物理学的なシミュレーションツールが導入された。
本稿では,物理統合復元ネットワーク(PiRN)を提案する。
論文 参考訳(メタデータ) (2023-07-20T05:49:21Z) - Global and Local Texture Randomization for Synthetic-to-Real Semantic
Segmentation [40.556020857447535]
GTR(Global Randomization)とLTR(Local Texture Randomization)という2つの単純なテクスチャランダム化機構を提案する。
GTRは、ソース画像のテクスチャを多様なテクスチャスタイルにランダム化する。
LTRは、ソースイメージを部分的にスタイリングするために、多様なローカル領域を生成する。
論文 参考訳(メタデータ) (2021-08-05T05:14:49Z) - Dynamic Object Removal and Spatio-Temporal RGB-D Inpainting via
Geometry-Aware Adversarial Learning [9.150245363036165]
動的物体はロボットの環境に対する認識に大きな影響を及ぼす。
本研究は,動的物体によって隠蔽された領域における可塑性色,テクスチャ,幾何学を合成することにより,この問題に対処する。
本研究は, 対人訓練を用いて建築を最適化し, オンラインで色と深度構造を幻覚できるような, 微妙な現実的なテクスチャを合成する。
論文 参考訳(メタデータ) (2020-08-12T01:23:21Z) - Transferring and Regularizing Prediction for Semantic Segmentation [115.88957139226966]
本稿では,セマンティックセグメンテーションの本質的特性を利用して,モデル伝達におけるそのような問題を緩和する。
本稿では,モデル転送を教師なし方式で正規化するための制約として固有特性を課す予測伝達の正規化器(RPT)を提案する。
GTA5とSynTHIA(synthetic data)で訓練されたモデルの都市景観データセット(アーバンストリートシーン)への転送に関するRTPの提案を検証するため、大規模な実験を行った。
論文 参考訳(メタデータ) (2020-06-11T16:19:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。