論文の概要: DIFFCZSL: Compositional Zero-Shot Learning Regularized by Diffusion Representations
- arxiv url: http://arxiv.org/abs/2608.19871v1
- Date: Thu, 20 Aug 2026 10:30:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-21 20:28:51.530631
- Title: DIFFCZSL: Compositional Zero-Shot Learning Regularized by Diffusion Representations
- Title(参考訳): DIFFCZSL:拡散表現で正規化された合成ゼロショット学習
- Abstract要約: 合成ゼロショット学習(CZSL)は、見知らぬ合成から学習した原始概念の知識を活用することで、目に見えない合成を認識することを目的としている。
本稿では,CLIPをベースとしたCZSLパイプラインに,事前学習した拡散モデルから生成前駆体を注入する拡散拡張フレームワークであるDIFFCZSLを提案する。
- 参考スコア(独自算出の注目度): 9.55658957185471
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Compositional Zero-Shot Learning (CZSL) aims to recognize unseen attribute-object compositions by leveraging knowledge of primitive concepts learned from seen compositions. Although recent works achieve impressive performance in CZSL by leveraging large vision-language models, they primarily rely on discriminative representations that may not explicitly preserve the structured relationships between primitive concepts and their compositions. Motivated by the recent success of diffusion-based classifiers and their competitive performance relative to discriminative models, we investigate whether intermediate diffusion representations can provide complementary cues for CZSL. To this end, we propose DIFFCZSL, a diffusion-augmented framework that injects generative priors from pre-trained diffusion models into CLIP-based CZSL pipelines. We extract intermediate diffusion representations and project them into the CLIP embedding space to provide auxiliary supervision on both image and text modalities. Through contrastive alignment between CLIP embeddings and diffusion features during training, our method encourages the embedding geometry toward richer composition-aware semantics, while introducing no additional cost at inference time. Extensive experiments on three public CZSL benchmarks demonstrate consistent improvements over strong CLIP-based baselines under both closed-world and open-world settings. Our results highlight the complementary strengths of generative diffusion representations and discriminative vision-language models for compositional generalization.
- Abstract(参考訳): 合成ゼロショット学習(CZSL)は,未知の属性オブジェクトの合成を認識することを目的として,合成から学習した原始概念の知識を活用する。
最近の研究は、大きな視覚言語モデルを利用することで、CZSLにおいて印象的な性能を達成するが、それらは主に、原始概念とそれらの構成の間の構造的関係を明示的に保存しない差別的表現に依存している。
近年の拡散型分類器の成功と差別モデルに対する競合性能により、中間拡散表現がCZSLの相補的手がかりとなるかどうかを考察する。
そこで本研究では,CLIPをベースとしたCZSLパイプラインに,事前学習した拡散モデルから生成前駆体を注入する拡散拡張フレームワークであるDIFFCZSLを提案する。
中間拡散表現を抽出し、CLIP埋め込み空間に投影し、画像とテキストのモダリティを補助的に監視する。
トレーニング中のCLIP埋め込みと拡散特徴の対比により,よりリッチな構成認識セマンティクスへの埋め込みが促進され,推論時に追加コストは発生しない。
3つの公開CZSLベンチマークに対する大規模な実験では、クローズドワールドとオープンワールドの両方の設定下で、強力なCLIPベースのベースラインよりも一貫した改善が示されている。
本結果は,合成一般化のための生成拡散表現と識別的視覚言語モデルの相補的強みを強調した。
関連論文リスト
- Language-Assisted Image Clustering Guided by Discriminative Relational Signals and Adaptive Semantic Centers [65.70472330370735]
本稿では,2つの補完的なコンポーネントを持つLanguage-Assisted Image Clustering (LAIC) フレームワークを提案する。
我々は、クラスタリングのためのより差別的な自己スーパービジョン信号を生成するために、言語間関係を利用する。
カテゴリワイドな連続的なセマンティックセンタを即時学習により学習し、最終的なクラスタリングの割り当てを生成する。
論文 参考訳(メタデータ) (2026-03-25T13:08:14Z) - Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception [71.26728044621458]
DeCLIPは、CLIPを強化する新しいフレームワークで、自己認識モジュールを分離して、それぞれコンテンツ’と“コンテキスト’の機能を取得する。
2D検出とセグメンテーション、3Dインスタンスのセグメンテーション、ビデオインスタンスのセグメンテーション、6Dオブジェクトのポーズ推定など、幅広いタスクにわたる最先端のパフォーマンスを一貫して達成する。
論文 参考訳(メタデータ) (2025-08-15T06:43:51Z) - Learning Clustering-based Prototypes for Compositional Zero-shot Learning [56.57299428499455]
ClusProは、コンポジションゼロショット学習のための堅牢なクラスタリングベースのプロトタイプマイニングフレームワークである。
それは、多様化されたプロトタイプの集合を通じて、プリミティブの概念的境界を定義する。
ClusProは、学習可能なパラメータを追加することなく、非パラメトリックな方法でプロトタイプクラスタリングを効率的に実行する。
論文 参考訳(メタデータ) (2025-02-10T14:20:01Z) - Learning Visual Proxy for Compositional Zero-Shot Learning [18.38505448611429]
本稿では,モダリティギャップを減らし,構成一般化を強化する手法であるVisual Proxy Learningを紹介する。
また,テキストイメージときめ細かい視覚空間の相互制約を課すクロスモーダル・ジョイント・ラーニングを提案する。
実験では、クローズドワールドシナリオにおける最先端のパフォーマンスと、オープンワールド設定における競争結果が示されている。
論文 参考訳(メタデータ) (2025-01-23T17:30:27Z) - ResCLIP: Residual Attention for Training-free Dense Vision-language Inference [27.551367463011008]
CLIPの非最終層における自己注意の相互相関も局在特性を示す。
本稿では, 中間層からの相互相関自己アテンションを利用して, 最終ブロックの注意を再認識するResidual Cross-correlation Self-attention (RCS) モジュールを提案する。
RCSモジュールは空間情報を効果的に再構成し、高密度視覚言語推論のためのCLIP内の局在電位を解放する。
論文 参考訳(メタデータ) (2024-11-24T14:14:14Z) - High-Performance Few-Shot Segmentation with Foundation Models: An Empirical Study [64.06777376676513]
基礎モデルに基づく数ショットセグメンテーション(FSS)フレームワークを開発した。
具体的には、基礎モデルから暗黙的な知識を抽出し、粗い対応を構築するための簡単なアプローチを提案する。
2つの広く使われているデータセットの実験は、我々のアプローチの有効性を実証している。
論文 参考訳(メタデータ) (2024-09-10T08:04:11Z) - ProxyCLIP: Proxy Attention Improves CLIP for Open-Vocabulary Segmentation [32.852004564832455]
オープン語彙セマンティックセグメンテーションは、視覚表現とセマンティックラベルを統合するモデルを必要とする。
本稿では,CLIP(Contrastive Language- Image Pre-Training)とVFM(Vision Foundation Models)の強みを調和させるフレームワークであるProxyCLIPを紹介する。
トレーニングなしのアプローチとして、ProxyCLIP は平均的な平均接点(mIoU)を40.3から44.4までの8つのベンチマークで大幅に改善する。
論文 参考訳(メタデータ) (2024-08-09T06:17:00Z) - Prompting Language-Informed Distribution for Compositional Zero-Shot Learning [73.49852821602057]
合成ゼロショット学習(CZSL)タスクは、目に見えない合成視覚概念を認識することを目的としている。
本稿では,タスクに対して言語インフォームド分布(PLID)を指示するモデルを提案する。
MIT-States、UT-Zappos、C-GQAデータセットの実験結果は、PLIDの先行技術よりも優れた性能を示している。
論文 参考訳(メタデータ) (2023-05-23T18:00:22Z) - ProCC: Progressive Cross-primitive Compatibility for Open-World
Compositional Zero-Shot Learning [29.591615811894265]
Open-World Composal Zero-shot Learning (OW-CZSL) は、コンポジション空間に先立って、画像中の状態とオブジェクトプリミティブの新規なコンポジションを認識することを目的としている。
本稿では,OW-CZSLタスクの学習過程を模倣する,Progressive Cross-primitive Compatibility (ProCC) と呼ばれる新しい手法を提案する。
論文 参考訳(メタデータ) (2022-11-19T10:09:46Z) - Using Representation Expressiveness and Learnability to Evaluate
Self-Supervised Learning Methods [61.49061000562676]
本稿では,学習可能性を評価するためにCluster Learnability (CL)を導入する。
CLは、K-meansで表現をクラスタリングすることによって得られたラベルを予測するために訓練されたKNNのパフォーマンスで測定される。
CLは、他の競合する評価手法よりも分布内モデルの性能と相関することがわかった。
論文 参考訳(メタデータ) (2022-06-02T19:05:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。