論文の概要: Deep Dreams Are Made of This: Visualizing Monosemantic Features in Diffusion Models
- arxiv url: http://arxiv.org/abs/2605.08218v1
- Date: Wed, 06 May 2026 13:21:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:49.471163
- Title: Deep Dreams Are Made of This: Visualizing Monosemantic Features in Diffusion Models
- Title(参考訳): モノセマンティックな特徴を拡散モデルで可視化するDeep Dreams
- Authors: Adam Szokalski, Mateusz Modrzejewski,
- Abstract要約: 本稿では,最適化による特徴可視化を潜時拡散モデルに拡張する機械的解釈可能性手法である潜時可視化法(LVO)を提案する。
LVOはスパースオートエンコーダ(SAE)を用いて、多意味層表現をモノセマンティックな特徴に分解する。
- 参考スコア(独自算出の注目度): 0.12277343096128711
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: This paper proposes latent visualization by optimization (LVO), a mechanistic interpretability technique that extends feature visualization by optimization - originally developed for convolutional neural networks - to latent diffusion models. LVO employs sparse autoencoders (SAEs) to disentangle polysemantic layer representations into monosemantic features. Key contributions include latent-space optimization, time-step activity analysis, schedule-matched noise injection, prior initialization through feature steering, and suitable regularization strategies. We demonstrate the method on Stable Diffusion 1.5 fine-tuned on the Style50 dataset, showing that SAE features produce clear visualizations of recognizable concepts - including diagonal compositions, human figures, roses, cables, and waterfall foam - that correlate with dataset examples, while the baseline without disentanglement produces less coherent results. We further show that regularization techniques from pixel-space feature visualization transfer to the latent domain, though they require different configurations for the raw-layer and SAE variants. Compared to dataset examples and steering, LVO provides complementary insights by directly revealing what activates a feature rather than its downstream effects.
- Abstract(参考訳): 本稿では、畳み込みニューラルネットワーク用に開発された最適化による特徴可視化を、潜時拡散モデルに拡張する機械論的解釈可能性手法である潜時可視化(LVO)を提案する。
LVOはスパースオートエンコーダ(SAE)を用いて、多意味層表現をモノセマンティックな特徴に分解する。
主な貢献は、遅延空間最適化、時間ステップアクティビティ分析、スケジュール整合ノイズ注入、機能ステアリングによる事前初期化、適切な正規化戦略である。
本手法はStyle50データセット上での安定拡散1.5の微調整を行い,SAE特徴が対角線,人像,バラ,ケーブル,滝の泡など,認識可能な概念の明瞭な可視化を生成することを示す。
さらに,画素空間の特徴可視化から潜在領域への正規化技術が,原層およびSAEの変種に対して異なる構成を必要とすることを示した。
データセットの例やステアリングと比較すると、LVOは、下流効果ではなく、機能を活性化する機能を直接明らかにすることで、補完的な洞察を提供する。
関連論文リスト
- V-Co: A Closer Look at Visual Representation Alignment via Co-Denoising [65.5867130156805]
統合JTフレームワークにおける視覚的コデノゲーションの体系的研究であるV-Coについて述べる。
本研究は,視覚的コデノジングを効果的に行うための4つの重要な要素を明らかにする。
V-Coは、基礎となる画素空間拡散ベースラインと強い前の画素拡散法より優れている。
論文 参考訳(メタデータ) (2026-03-17T17:01:54Z) - CASL: Concept-Aligned Sparse Latents for Interpreting Diffusion Models [45.90361318326864]
拡散モデルの内部的な活性化は、リッチな意味情報を符号化するが、そのような表現を解釈することは依然として困難である。
拡散モデルのスパース潜在次元を意味論的概念と整合させる教師付きフレームワークであるCASL(Concept-Aligned Sparse Latents)を紹介する。
編集方法と異なり、CASL-Steerは因果プローブとしてのみ使用され、概念に整合した潜伏者が生成コンテンツにどのように影響するかを明らかにする。
論文 参考訳(メタデータ) (2026-01-21T20:14:17Z) - UniDiff: Parameter-Efficient Adaptation of Diffusion Models for Land Cover Classification with Multi-Modal Remotely Sensed Imagery and Sparse Annotations [3.588053519843616]
本稿では,1つのイメージネット予測拡散モデルを用いて,対象領域データのみを用いて複数の知覚モダリティに適応するパラメータ効率のフレームワークを提案する。
UniDiffは、FiLMベースのタイムステップ・モダリティ条件付け、パラメータの約5%のパラメータ効率適応、および擬似RGBアンカーを組み合わせることで、事前訓練された表現を保存し、破滅的な忘れを防止する。
論文 参考訳(メタデータ) (2025-11-29T00:57:53Z) - Latent Diffusion Model without Variational Autoencoder [78.34722551463223]
SVGは視覚生成のための変分オートエンコーダを持たない新しい潜伏拡散モデルである。
凍結したDINO機能を利用して、明確な意味的識別性を持つ特徴空間を構築する。
迅速な拡散訓練を可能にし、数ステップのサンプリングをサポートし、生成品質を向上させる。
論文 参考訳(メタデータ) (2025-10-17T04:17:44Z) - Exploring Representation-Aligned Latent Space for Better Generation [86.45670422239317]
生成性能を改善するために,セマンティックな事前情報を統合するReaLSを導入する。
本研究では、ReaLSでトレーニングされたDETとSiTが、FID測定値の15%改善を実現することを示す。
拡張されたセマンティック潜在空間は、セグメンテーションや深さ推定のようなより知覚的な下流タスクを可能にする。
論文 参考訳(メタデータ) (2025-02-01T07:42:12Z) - How to Use Diffusion Priors under Sparse Views? [29.738350228085928]
Inline Prior Guided Score Matching is proposed to provide visual supervision over sparse view in 3D reconstruction。
提案手法は,最先端の復元品質を実現する。
論文 参考訳(メタデータ) (2024-12-03T07:31:54Z) - Harnessing Diffusion Models for Visual Perception with Meta Prompts [68.78938846041767]
本稿では,視覚知覚タスクの拡散モデルを用いた簡易かつ効果的な手法を提案する。
学習可能な埋め込み(メタプロンプト)を事前学習した拡散モデルに導入し、知覚の適切な特徴を抽出する。
提案手法は,NYU 深度 V2 と KITTI の深度推定タスク,および CityScapes のセマンティックセグメンテーションタスクにおいて,新しい性能記録を実現する。
論文 参考訳(メタデータ) (2023-12-22T14:40:55Z) - SatDM: Synthesizing Realistic Satellite Image with Semantic Layout
Conditioning using Diffusion Models [0.0]
Denoising Diffusion Probabilistic Models (DDPM) は意味的レイアウトから現実的なイメージを合成する上で大きな可能性を証明している。
本稿では,セマンティックマップを用いて高品質で多様な衛星画像を生成する条件付きDDPMモデルを提案する。
提案モデルの有効性は,本研究の文脈内で導入した詳細なラベル付きデータセットを用いて検証する。
論文 参考訳(メタデータ) (2023-09-28T19:39:13Z) - Closed-Form Factorization of Latent Semantics in GANs [65.42778970898534]
画像合成のために訓練されたGAN(Generative Adversarial Networks)の潜在空間に、解釈可能な次元の豊富なセットが出現することが示されている。
本研究では,GANが学習した内部表現について検討し,その基礎となる変動要因を教師なしで明らかにする。
本稿では,事前学習した重みを直接分解することで,潜在意味発見のためのクローズドフォーム因数分解アルゴリズムを提案する。
論文 参考訳(メタデータ) (2020-07-13T18:05:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。