論文の概要: From SRA to Self-Flow: Data Augmentation or Self-Supervision?
- arxiv url: http://arxiv.org/abs/2607.02508v1
- Date: Thu, 02 Jul 2026 17:59:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.964206
- Title: From SRA to Self-Flow: Data Augmentation or Self-Supervision?
- Title(参考訳): SRAからセルフフローへ: データ拡張かセルフスーパービジョンか?
- Abstract要約: 本研究では,SRA から Self-Flow への改良の背景となるメカニズムについて検討する。
本稿では,異なる雑音レベルに割り当てられたトークン間での注意を遮りながら,自己流と同じ2段階の入力を保持する注意分離手法を提案する。
注意分離自体が、一つの画像を複数の効果的な訓練部品に分割することで、増強効果をもたらすことを示す。
- 参考スコア(独自算出の注目度): 41.51038422088232
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Representation alignment has become an effective way to accelerate diffusion transformer training and improve generation quality. Recent self-alignment methods, such as SRA and Self-Flow, further remove the dependency on external pretrained encoders by constructing alignment within the diffusion model itself. However, the mechanism behind the improvement from SRA to Self-Flow, dual-time scheduling, remains under-examined: Self-Flow attributes its gain to interactions between tokens at different noise levels, where cleaner tokens help infer noisier ones. In this work, we revisit this explanation and ask whether the gain instead comes from data augmentation along the noise dimension. To disentangle these factors, we introduce Attention Separation, which preserves the same dual-timestep input as Self-Flow while blocking attention between tokens assigned to different noise levels. Surprisingly, removing such interaction does not degrade performance and can even improve it, suggesting that the improvement from SRA to Self-Flow mainly comes from data augmentation. Furthermore,We show that Attention Separation itself provides an augmentation effect by splitting a single image into multiple effective training parts to expand the training data. Based on these observations, we combine self-representation alignment with dual-timestep and attention-separation augmentation, and demonstrate the effectiveness of this design on ImageNet.
- Abstract(参考訳): 表現アライメントは拡散変圧器訓練の高速化と生成品質の向上に有効な方法となっている。
SRAやSelf-Flowといった最近の自己アライメント手法では、拡散モデル自体内でアライメントを構築することで、外部の事前学習エンコーダへの依存性をさらに排除している。
しかし、SRAから2時間スケジューリングであるSelf-Flowへの改善の背景にあるメカニズムは、未検討のままである。 Self-Flowは、ノイズレベルの異なるトークン間の相互作用によって、よりクリーンなトークンがノイズの多いトークンを推測するのに役立ちます。
本稿では、この説明を再検討し、その代わりにノイズ次元に沿ったデータ拡張による利得を問う。
これらの要因を解消するために,異なるノイズレベルに割り当てられたトークン間での注意を遮りながら,Self-Flowと同じ2段階の入力を保持するアテンション分離を導入する。
驚いたことに、このようなインタラクションを削除してもパフォーマンスは低下せず、さらに改善できる。SRAからSelf-Flowへの改善は主にデータ拡張によるものだ、と氏は示唆する。
さらに、注意分離自体が、トレーニングデータを拡張するために、1つのイメージを複数の効果的なトレーニング部品に分割することで、強化効果を提供することを示す。
これらの観測に基づいて、自己表現アライメントと二重時間ステップと注意分離アライメントを組み合わせることで、イメージネット上でこの設計の有効性を実証する。
関連論文リスト
- Masked Autoencoders as Universal Speech Enhancer [5.670678893351032]
マスク付きオートエンコーダをベースとしたユニバーサル音声エンハンサーは、自己教師方式で訓練される。
提案手法は,ドメイン内およびドメイン外両方の評価データセットに対して,最先端の性能を実現する。
論文 参考訳(メタデータ) (2026-02-02T18:13:59Z) - VAE-REPA: Variational Autoencoder Representation Alignment for Efficient Diffusion Training [53.09658039757408]
本稿では,効率的な拡散訓練のための軽量な固有ガイダンスフレームワークである textbfnamex を提案する。
nameは、拡散トランスフォーマーの中間潜時特徴を、軽量なプロジェクション層を介してVAE特徴と整列し、特徴アライメントロスによって教師される。
実験により、バニラ拡散変圧器と比較して、名称が生成品質とトレーニング収束速度の両方を改善することが示された。
論文 参考訳(メタデータ) (2026-01-25T13:22:38Z) - Scaled and Inter-token Relation Enhanced Transformer for Sample-restricted Residential NILM [0.0]
本稿では,2つの革新点を持つトランスフォーマーアーキテクチャを提案する。
提案手法をREDDデータセット上で検証し, 各種アプライアンスに対してF1スコアを10~15%向上させる結果を得た。
論文 参考訳(メタデータ) (2024-10-12T18:58:45Z) - Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think [72.48325960659822]
生成のための大規模拡散モデルの訓練における主要なボトルネックは、これらの表現を効果的に学習することにある。
本稿では,RePresentation Alignment (REPA) と呼ばれる単純な正規化を導入し,ノイズの多い入力隠れ状態の投影を,外部の事前学習された視覚エンコーダから得られるクリーンな画像表現と整合させる手法を提案する。
我々の単純な戦略は、一般的な拡散やDiTsやSiTsといったフローベースのトランスフォーマーに適用した場合、トレーニング効率と生成品質の両方に大きな改善をもたらす。
論文 参考訳(メタデータ) (2024-10-09T14:34:53Z) - TimeDART: A Diffusion Autoregressive Transformer for Self-Supervised Time Series Representation [6.047856576139978]
我々は,新しい自己教師型時系列事前学習フレームワークである textbfTimeDART を提案する。
TimeDARTは2つの強力な生成パラダイムを統合し、より伝達可能な表現を学ぶ。
時系列予測と分類のための公開データセットに関する広範な実験を行う。
論文 参考訳(メタデータ) (2024-10-08T06:08:33Z) - Efficient Diffusion Transformer with Step-wise Dynamic Attention Mediators [83.48423407316713]
本稿では,クエリとキーを別々に扱うために,追加の仲介者トークンを組み込んだ新しい拡散トランスフォーマーフレームワークを提案する。
本モデルでは, 正確な非曖昧な段階を呈し, 詳細に富んだ段階へと徐々に遷移する。
本手法は,最近のSiTと統合した場合に,最先端のFIDスコア2.01を達成する。
論文 参考訳(メタデータ) (2024-08-11T07:01:39Z) - AiATrack: Attention in Attention for Transformer Visual Tracking [89.94386868729332]
トランスフォーマートラッカーは近年,注目機構が重要な役割を担っている,目覚ましい進歩を遂げている。
我々は,すべての相関ベクトル間のコンセンサスを求めることにより,適切な相関性を高め,誤相関を抑制する注意モジュール(AiA)を提案する。
我々のAiAモジュールは自己認識ブロックとクロスアテンションブロックの両方に容易に適用でき、視覚追跡のための特徴集約と情報伝達を容易にする。
論文 参考訳(メタデータ) (2022-07-20T00:44:03Z) - Attentive WaveBlock: Complementarity-enhanced Mutual Networks for
Unsupervised Domain Adaptation in Person Re-identification and Beyond [97.25179345878443]
本稿では,新しい軽量モジュールであるAttentive WaveBlock (AWB)を提案する。
AWBは相互学習の二重ネットワークに統合され、相互学習の相補性を高め、擬似ラベルのノイズをさらに抑えることができる。
実験により, 提案手法は, 複数のUDA人物再識別タスクを大幅に改善し, 最先端の性能を達成できることが実証された。
論文 参考訳(メタデータ) (2020-06-11T15:40:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。