論文の概要: Residualized Temporal Sparse Autoencoders for Interpreting Diffusion Models
- arxiv url: http://arxiv.org/abs/2605.27813v1
- Date: Wed, 27 May 2026 01:08:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-28 17:38:55.663803
- Title: Residualized Temporal Sparse Autoencoders for Interpreting Diffusion Models
- Title(参考訳): 拡散モデル解釈のための残留化時間空間オートエンコーダ
- Authors: Calvin Yeung, Prathyush Poduval, Ali Zakeri, Zhuowen Zou, Mohsen Imani,
- Abstract要約: テキスト・ツー・イメージ拡散モデルは反復的認知過程を通じて画像を生成するため、内部の神経層は単一の静的表現ではなく、活性化の軌跡を生成する。
本研究では,拡散活性化軌道に対する残留化時間SAEを紹介する。
SAEは時間的に構造された拡散活性化を研究するのに有用な枠組みであることを示す。
- 参考スコア(独自算出の注目度): 10.931032321647287
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Text-to-image diffusion models generate images through an iterative denoising process, so internal neural layers produce trajectories of activations rather than single static representations. Sparse autoencoders (SAEs) have recently been used to decompose diffusion activations into interpretable feature directions, but most approaches analyze activations at individual timesteps or condition on time rather than learning directly from full activation trajectories. In this work, we introduce residualized temporal SAEs for diffusion activation trajectories. We collect activations across denoising time, fit linear predictors between neighboring timesteps, and represent each trajectory using an initial activation together with residual components not explained by these linear dynamics. Training an SAE on this residualized representation encourages sparse latents to capture structure beyond what is linearly predictable. The residualized decoder directions can be mapped back into activation space, allowing each latent to be analyzed as a feature trajectory over denoising time. Through reconstruction and ablation studies, spatiotemporal feature analysis, and qualitative steering experiments on Stable Diffusion~1.5, we show that residualized temporal SAEs provide a useful framework for studying temporally structured diffusion activations.
- Abstract(参考訳): テキスト・ツー・イメージ拡散モデルは反復的認知過程を通じて画像を生成するため、内部のニューラルネットワーク層は単一の静的表現ではなく、活性化の軌跡を生成する。
スパースオートエンコーダ(SAE)は、近年、拡散活性化を解釈可能な特徴方向へ分解するために使われてきたが、ほとんどのアプローチでは、フルアクティベーション軌跡から直接学習するのではなく、個々の時間経過や状態におけるアクティベーションを分析する。
本研究では,拡散活性化軌道に対する残留化時間SAEを紹介する。
これらの線形力学では説明されない残留成分とともに初期活性化を用いて各軌道を表現した。
この残留表現に対するSAEの訓練は、疎い潜伏剤が線形に予測可能なものを超えて構造を捉えることを奨励する。
残余化デコーダの方向を活性化空間にマッピングすることで、各潜時を騒音時間とともに特徴軌跡として解析することができる。
安定拡散~1.5における再構成・アブレーション研究、時空間的特徴分析、定性的操舵実験を通じて、残留時間的SAEが時間的に構造化された拡散活性化を研究する上で有用な枠組みであることを示す。
関連論文リスト
- Watch Your Step: Information Injection in Diffusion Models via Shadow Timestep Embedding [6.490330531143652]
本稿では,拡散モデルに悪質な情報注入を行うための時間空間の未利用を調査する新しいメカニズムであるシャドータイムステップ埋め込み(STE)を紹介する。
特に、タイムステップ埋め込み空間でズームインすると、異なるタイムステップが、サイドチャネル情報をエンコードできる異なる表現能力を示すことが分かる。
本研究は, 時間次元の理解により, 拡散モデルの時間経過を専用情報を運ぶための強力な側流として明らかにし, 対向生成モデルのための新たな方向を動機づけるものである。
論文 参考訳(メタデータ) (2026-05-01T03:26:34Z) - Characterizing Motion Encoding in Video Diffusion Timesteps [50.13907856401258]
本研究では,映像拡散時間ステップにおける動きのエンコードについて,外観編集と動作保存のトレードオフによって検討する。
動作優位の早期体制と,その後に出現優位の体制を同定し,時間空間における動作優位の境界を導出する。
論文 参考訳(メタデータ) (2025-12-18T21:20:54Z) - Unleashing Temporal Capacity of Spiking Neural Networks through Spatiotemporal Separation [67.69345363409835]
スパイキングニューラルネットワーク(SNN)は、時間的処理に自然に適していると考えられており、膜電位の伝播は、コア時間的モデリングメカニズムとして広く見なされている。
我々は, 膜伝播を段階的に段階的に除去する非ステートフル(NS)モデルの設計を行った。
論文 参考訳(メタデータ) (2025-12-05T07:05:53Z) - TARDis: Time Attenuated Representation Disentanglement for Incomplete Multi-Modal Tumor Segmentation and Classification [10.329406702659123]
造影CT(Contrat-enhanced Computed Tomography)における腫瘍の分画と診断は,造影剤の生理的動態に大きく依存している。
既存のディープラーニングアプローチは、欠落した相を欠落した独立したチャネルとして扱い、血行動態の本質的な時間的連続性を無視している。
本稿では,連続時間短縮曲線の欠落点として欠落点を再定義する新しい物理認識フレームワークであるTime Attenuated Representation Disentanglement (TARDis)を提案する。
論文 参考訳(メタデータ) (2025-12-04T08:44:50Z) - Revisiting Direct Encoding: Learnable Temporal Dynamics for Static Image Spiking Neural Networks [0.0]
時間的ダイナミクスを欠いた静的画像の処理は、ニューラルネットワーク(SNN)をスパイクする基本的な課題である
直接訓練されたSNNでは、静的な入力は通常、時間ステップにわたって繰り返され、時間次元が表現のような速度に崩壊し、意味のある時間的モデリングを防ぐ。
この研究は、直接符号化とレートベース符号化の報告された性能ギャップを再考し、主に、符号化スキーム自体よりも、畳み込み学習性(convolutional learningability)とシュロゲート勾配の定式化(surrogate gradient formulations)に由来することを示す。
論文 参考訳(メタデータ) (2025-12-01T13:55:00Z) - StPR: Spatiotemporal Preservation and Routing for Exemplar-Free Video Class-Incremental Learning [79.44594332189018]
CIL(Class-Incremental Learning)は、以前取得した知識を使わずに、時間とともに新しいアクションカテゴリを継続的に学習するモデルの開発を目指している。
既存のアプローチでは、メモリとプライバシに関する懸念を忘れたり、あるいは時間的モデリングを無視する静的なイメージベースのメソッドを適用したりする。
本稿では,情報を明示的に切り離して保存する,統一的で非定型なVCILフレームワークを提案する。
論文 参考訳(メタデータ) (2025-05-20T06:46:51Z) - Dynamical Diffusion: Learning Temporal Dynamics with Diffusion Models [71.63194926457119]
動的拡散(DyDiff, Dynamical Diffusion)は, 時間的に意識された前と逆のプロセスを含む理論的に健全なフレームワークである。
科学的時間的予測、ビデオ予測、時系列予測に関する実験は、動的拡散が時間的予測タスクのパフォーマンスを一貫して改善することを示した。
論文 参考訳(メタデータ) (2025-03-02T16:10:32Z) - Learning Delays Through Gradients and Structure: Emergence of Spatiotemporal Patterns in Spiking Neural Networks [0.06752396542927405]
学習可能なシナプス遅延を2つのアプローチで組み込んだスパイキングニューラルネットワーク(SNN)モデルを提案する。
後者のアプローチでは、ネットワークは接続を選択してプーンし、スパース接続設定の遅延を最適化する。
本研究では,時間的データ処理のための効率的なSNNモデルを構築するために,遅延学習と動的プルーニングを組み合わせる可能性を示す。
論文 参考訳(メタデータ) (2024-07-07T11:55:48Z) - A Prospective Study on Sequence-Driven Temporal Sampling and Ego-Motion
Compensation for Action Recognition in the EPIC-Kitchens Dataset [68.8204255655161]
行動認識はコンピュータビジョンにおける最上位の研究分野の一つである。
エゴモーション記録シーケンスは重要な関連性を持つようになった。
提案手法は,このエゴモーションやカメラの動きを推定して対処することを目的としている。
論文 参考訳(メタデータ) (2020-08-26T14:44:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。