Fugu-MT 論文翻訳(概要): Image Augmentation with Controlled Diffusion for Weakly-Supervised Semantic Segmentation

論文の概要: Image Augmentation with Controlled Diffusion for Weakly-Supervised Semantic Segmentation

arxiv url: http://arxiv.org/abs/2310.09760v1
Date: Sun, 15 Oct 2023 07:19:23 GMT
ステータス: 翻訳完了
システム内更新日: 2023-10-17 18:31:08.023814
Title: Image Augmentation with Controlled Diffusion for Weakly-Supervised Semantic Segmentation
Title（参考訳）: 弱改良セマンティックセグメンテーションにおける拡散制御による画像強調
Authors: Wangyu Wu, Tianhong Dai, Xiaowei Huang, Fei Ma, Jimin Xiao
Abstract要約: 制御拡散による画像拡張(IACD)という新しいアプローチを導入する。 IACDは、制御された拡散を通じて多様な画像を生成することで、ラベル付きデータセットを効果的に強化する。また,拡散モデルのランダム性による潜在的なノイズを軽減するため,高品質な画像選択手法を提案する。
参考スコア（独自算出の注目度）: 25.628382644404066
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Abstract: Weakly-supervised semantic segmentation (WSSS), which aims to train segmentation models solely using image-level labels, has achieved significant attention. Existing methods primarily focus on generating high-quality pseudo labels using available images and their image-level labels. However, the quality of pseudo labels degrades significantly when the size of available dataset is limited. Thus, in this paper, we tackle this problem from a different view by introducing a novel approach called Image Augmentation with Controlled Diffusion (IACD). This framework effectively augments existing labeled datasets by generating diverse images through controlled diffusion, where the available images and image-level labels are served as the controlling information. Moreover, we also propose a high-quality image selection strategy to mitigate the potential noise introduced by the randomness of diffusion models. In the experiments, our proposed IACD approach clearly surpasses existing state-of-the-art methods. This effect is more obvious when the amount of available data is small, demonstrating the effectiveness of our method.
Abstract（参考訳）: 画像レベルラベルのみを使用してセグメンテーションモデルを訓練することを目的としたweakly supervised semantic segmentation (wsss) が注目されている。既存の手法は主に、利用可能な画像とその画像レベルラベルを使用して高品質な擬似ラベルを生成することに焦点を当てている。しかし、利用可能なデータセットのサイズが限られると、擬似ラベルの品質は大幅に低下する。そこで本稿では,制御拡散による画像拡張(iacd)と呼ばれる新しい手法を導入することで,異なる視点からこの問題に取り組む。このフレームワークは、利用可能な画像と画像レベルのラベルが制御情報として提供される制御拡散を通じて多様な画像を生成することにより、既存のラベル付きデータセットを効果的に増強する。また,拡散モデルのランダム性による潜在的なノイズを軽減するため,高品質な画像選択手法を提案する。実験では,提案手法が既存の最先端手法を明らかに越えた。この効果は、利用可能なデータ量が小さくなるとより明確になり、この方法の有効性が示される。

関連論文リスト

Group Diffusion: Enhancing Image Generation by Unlocking Cross-Sample Collaboration [88.94434023253872]
画像間で共有するアテンション機構をアンロックするグループ拡散を提案する。グループのサイズが大きくなれば、より強力なクロスサンプルの注意と、より優れた生成品質が得られる。本研究は, クロスサンプル推論を, 生成モデリングの有効な, 未探索のメカニズムとして明らかにした。
論文参考訳（メタデータ） (2025-12-11T18:59:55Z)
Bézier Meets Diffusion: Robust Generation Across Domains for Medical Image Segmentation [18.618250617122392]
異なる医用画像モダリティにわたる堅牢な学習アルゴリズムのトレーニングは、大きなドメインギャップのために困難である。教師なしドメイン適応(UDA)は、ソースドメインからの注釈付きイメージとターゲットドメインからのラベルなしイメージを使用して、ディープモデルをトレーニングすることでこの問題を軽減する。既存のアプローチは、しばしばGANベースのスタイル転送に依存しているが、これらの手法は、高い可変性を持つ領域におけるクロスドメインマッピングの取得に苦慮している。
論文参考訳（メタデータ） (2025-09-26T15:23:17Z)
Source-Free Domain Adaptive Semantic Segmentation of Remote Sensing Images with Diffusion-Guided Label Enrichment [18.05142463882686]
自己学習はFDAで広く使われており、ターゲットのドメインデータ上でモデルをトレーニングするためには、可能な限り高品質な擬似ラベルを取得する必要がある。 DGLE(Diffusion-Guided Label Enrichment)と呼ばれる新しい擬似ラベル最適化フレームワークを提案する。入手が容易ないくつかの擬似ラベルから始まり、新たに生成されたラベルの品質を確保しながら、それらを完全な擬似ラベルに伝達する。
論文参考訳（メタデータ） (2025-09-23T01:10:01Z)
GS: Generative Segmentation via Label Diffusion [59.380173266566715]
言語駆動のイメージセグメンテーションは、自然言語表現に対応する画像の領域を分割するモデルを必要とする、視覚言語理解の基本的なタスクである。近年の拡散モデルがこの領域に導入されているが、既存のアプローチは画像中心のままである。生成タスクとしてセグメンテーション自体を定式化する新しいフレームワークであるGS(Generative Label)を提案する。実験の結果,GSは既存の差別的・拡散的手法を著しく上回り,言語駆動セグメンテーションのための新たな最先端技術が確立された。
論文参考訳（メタデータ） (2025-08-27T16:28:15Z)
Unsupervised Modality Adaptation with Text-to-Image Diffusion Models for Semantic Segmentation [54.96563068182733]
セグメンテーションタスクのためのテキスト・ツー・イメージ拡散モデル(MADM)を用いたモダリティ適応を提案する。 MADMは、広範囲な画像とテキストのペアで事前訓練されたテキストと画像の拡散モデルを使用して、モデルの相互モダリティ能力を向上する。我々は,MADMが画像から深度,赤外線,イベントのモダリティといった様々なモダリティタスクにまたがって,最先端の適応性能を実現することを示す。
論文参考訳（メタデータ） (2024-10-29T03:49:40Z)
PEPL: Precision-Enhanced Pseudo-Labeling for Fine-Grained Image Classification in Semi-Supervised Learning [3.801446153948012]
半教師付き学習フレームワーク内でのきめ細かい画像分類のためのPEPL(Precision-Enhanced Pseudo-Labeling)手法を提案する。提案手法は,高品質な擬似ラベルを生成することにより,ラベルなしデータの豊富さを活用する。ベンチマークデータセット上での最先端のパフォーマンスを実現し、既存の半教師付き戦略よりも大幅に改善されていることを示す。
論文参考訳（メタデータ） (2024-09-05T02:32:07Z)
HPL-ESS: Hybrid Pseudo-Labeling for Unsupervised Event-based Semantic Segmentation [47.271784693700845]
本稿では,教師なしイベントベースセマンティックセマンティックセグメンテーション(HPL-ESS)のためのハイブリッド擬似ラベルフレームワークを提案する。提案手法は,DSEC-Semanticデータセットにおいて,既存の最先端手法よりも高い性能を示す。
論文参考訳（メタデータ） (2024-03-25T14:02:33Z)
CLIP-Guided Source-Free Object Detection in Aerial Images [17.26407623526735]
高解像度の空中画像は、しばしばかなりのストレージスペースを必要とし、一般にはアクセスできない。そこで本研究では,これらの課題に対処する新しいSFOD法を提案する。自己学習における雑音ラベルを緩和するために,コントラスト言語画像事前学習(CLIP)を用いて擬似ラベルの生成を誘導する。 CLIPのゼロショット分類機能を利用することで、そのスコアを予測された元のバウンディングボックスに集約し、擬似ラベルの洗練されたスコアを得ることができる。
論文参考訳（メタデータ） (2024-01-10T14:03:05Z)
Distilling Self-Supervised Vision Transformers for Weakly-Supervised Few-Shot Classification & Segmentation [58.03255076119459]
視覚変換器(ViT)を利用した弱教師付き小ショット画像分類とセグメンテーションの課題に対処する。提案手法は,自己監督型ViTからトークン表現を抽出し,その相関関係を利用して分類とセグメンテーションの予測を行う。 Pascal-5iとCOCO-20iの実験は、様々な監視設定において大きなパフォーマンス向上を示した。
論文参考訳（メタデータ） (2023-07-07T06:16:43Z)
Self-Guided Diffusion Models [53.825634944114285]
自己誘導拡散モデルのためのフレームワークを提案する。本手法は,様々な画像粒度の誘導信号を提供する。単ラベルおよび複数ラベルの画像データセットに対する実験により、自己ラベル付きガイダンスは誘導なしで拡散モデルより常に優れていることが示された。
論文参考訳（メタデータ） (2022-10-12T17:57:58Z)
Semantic Image Synthesis via Diffusion Models [174.24523061460704]
Denoising Diffusion Probabilistic Models (DDPM) は様々な画像生成タスクにおいて顕著な成功を収めた。セマンティック画像合成に関する最近の研究は、主に事実上のGANベースのアプローチに従っている。意味画像合成のためのDDPMに基づく新しいフレームワークを提案する。
論文参考訳（メタデータ） (2022-06-30T18:31:51Z)
Dual-Perspective Semantic-Aware Representation Blending for Multi-Label Image Recognition with Partial Labels [70.36722026729859]
本稿では,多粒度カテゴリ固有の意味表現を異なる画像にブレンドした,二重パースペクティブな意味認識表現ブレンディング(DSRB)を提案する。提案したDSは、すべての比率ラベル設定において、最先端のアルゴリズムを一貫して上回っている。
論文参考訳（メタデータ） (2022-05-26T00:33:44Z)
Heterogeneous Semantic Transfer for Multi-label Recognition with Partial Labels [70.45813147115126]
部分ラベル付きマルチラベル画像認識(MLR-PL)は、アノテーションのコストを大幅に削減し、大規模なMLRを促進する。それぞれの画像と異なる画像の間に強い意味的相関が存在することがわかった。これらの相関関係は、未知のラベルを取得するために、既知のラベルが持つ知識を転送するのに役立ちます。
論文参考訳（メタデータ） (2022-05-23T08:37:38Z)
Inferring Prototypes for Multi-Label Few-Shot Image Classification with Word Vector Guided Attention [45.6809084493491]
ML-FSIC (Multi-label few-shot Image Classification) は、画像に記述ラベルを割り当てるタスクである。本稿では,ラベルの意味に関する事前知識の形式として,単語埋め込みを提案する。我々のモデルは、モデルパラメータを微調整することなく、未確認ラベルのプロトタイプを推測することができる。
論文参考訳（メタデータ） (2021-12-02T07:59:11Z)
Semi-weakly Supervised Contrastive Representation Learning for Retinal Fundus Images [0.2538209532048867]
本稿では,半弱化アノテーションを用いた表現学習のための,半弱化教師付きコントラスト学習フレームワークを提案する。 SWCLの移動学習性能を7つの公立網膜眼底データセットで実証的に検証した。
論文参考訳（メタデータ） (2021-08-04T15:50:09Z)
Pseudo Pixel-level Labeling for Images with Evolving Content [5.573543601558405]
画像の手動アノテーションの労力を削減するために,擬似ピクセルレベルのラベル生成手法を提案する。 VGGとResNetのバックボーンを用いた2つのセマンティックセグメンテーションモデルを、擬似ラベリング法と最先端手法を用いてラベル付けした画像上で学習する。以上の結果から, トレーニングプロセスにおいて, 最先端手法を用いて生成したデータの代わりに擬似ラベルを用いることで, VGGおよびResNetに基づくセマンティックセマンティックセグメンテーションモデルの平均IoUと周波数重み付きIoUを3.36%, 2.58%, 10倍改善することがわかった。
論文参考訳（メタデータ） (2021-05-20T18:14:19Z)
Semi-Supervised Domain Adaptation with Prototypical Alignment and Consistency Learning [86.6929930921905]
本稿では,いくつかの対象サンプルがラベル付けされていれば,ドメインシフトに対処するのにどの程度役立つか検討する。ランドマークの可能性を最大限に追求するために、ランドマークから各クラスのターゲットプロトタイプを計算するプロトタイプアライメント(PA)モジュールを組み込んでいます。具体的には,ラベル付き画像に深刻な摂動を生じさせ,PAを非自明にし,モデル一般化性を促進する。
論文参考訳（メタデータ） (2021-04-19T08:46:08Z)
Knowledge-Guided Multi-Label Few-Shot Learning for General Image Recognition [75.44233392355711]
KGGRフレームワークは、ディープニューラルネットワークと統計ラベル相関の事前知識を利用する。まず、統計ラベルの共起に基づいて異なるラベルを相関させる構造化知識グラフを構築する。次に、ラベルセマンティクスを導入し、学習セマンティクス固有の特徴をガイドする。グラフノードの相互作用を探索するためにグラフ伝搬ネットワークを利用する。
論文参考訳（メタデータ） (2020-09-20T15:05:29Z)
SSKD: Self-Supervised Knowledge Distillation for Cross Domain Adaptive Person Re-Identification [25.96221714337815]
ドメイン適応型人物再識別(re-ID)は、ソースドメインとターゲットドメインの間に大きな違いがあるため、難しい課題である。既存の手法は主にクラスタリングアルゴリズムによって未ラベルのターゲット画像の擬似ラベルを生成する。本稿では,識別学習とソフトラベル学習の2つのモジュールを含む自己監督的知識蒸留(SSKD)手法を提案する。
論文参考訳（メタデータ） (2020-09-13T10:12:02Z)
Instance-Aware Graph Convolutional Network for Multi-Label Classification [55.131166957803345]
グラフ畳み込みニューラルネットワーク(GCN)は、マルチラベル画像認識タスクを効果的に強化した。マルチラベル分類のための事例対応グラフ畳み込みニューラルネットワーク(IA-GCN)フレームワークを提案する。
論文参考訳（メタデータ） (2020-08-19T12:49:28Z)
Data-driven Meta-set Based Fine-Grained Visual Classification [61.083706396575295]
本稿では, ノイズの多いWeb画像に対して, 微粒化認識のためのデータ駆動型メタセットベースアプローチを提案する。具体的には、少量のクリーンなメタセットでガイドされ、メタラーニング方式で選択ネットを訓練し、分布内および分布外ノイズ画像の識別を行う。
論文参考訳（メタデータ） (2020-08-06T03:04:16Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。

指定された論文の情報です。
本サイトの運営者は本サイト（すべての情報・翻訳含む）の品質を保証せず、本サイト（すべての情報・翻訳含む）を使用して発生したあらゆる結果について一切の責任を負いません。