論文の概要: Denoising Diffusion Generative Models Secretly Calculate Attentions
- arxiv url: http://arxiv.org/abs/2609.00885v1
- Date: Tue, 01 Sep 2026 08:17:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.461218
- Title: Denoising Diffusion Generative Models Secretly Calculate Attentions
- Title(参考訳): 拡散生成モデルに注意を秘かに計算する
- Authors: Farzan Haddadi, Leila Monfared, Ebrahim Rezaii, Mohammadreza Malek-Mohammadi, Pejman Zakalvand, Narges Mokhtari,
- Abstract要約: 拡散モデルは本質的に,変圧器と非常によく似たアテンション機構を用いていることを示す。
また、オートエンコーダとアテンションベースモデルの基本機能原理に類似性を示す。
例えば、拡散フレームワークを再構成することで、長いトレーニングプロセスと計算集約的な画像生成を減らすことができる。
- 参考スコア(独自算出の注目度): 1.016315800665405
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Denoising diffusion models are the dominant architecture for image generation, whereas most natural language generation and modeling are primarily handled by well-known transformer architectures employing attention mechanism. Here, we show that diffusion models also inherently use an attention mechanism very similar to that of transformers. Therefore, attention emerges as a universal machine learning principle, based on a general training objective. We also show similarities in basic functional principle of auto-encoders and attention-based models. These equivalences allows us to interchange these designs based on practical requirements. As an example, we can reformulate the diffusion framework to reduce the lengthy training process and computation-intensive image generation. Using this approach, a simplified algorithm is proposed for image generation which is based on attention mechanism. Results show that the attention-based implementation achieves comparable performance with significantly less effort and computational resources.
- Abstract(参考訳): 拡散モデルが画像生成の主要なアーキテクチャであるのに対し、ほとんどの自然言語生成とモデリングは注意機構を用いたよく知られたトランスフォーマーアーキテクチャによって処理される。
ここでは、拡散モデルが本質的に変換器と非常によく似た注意機構を持つことを示す。
したがって、一般的な学習目標に基づいて、普遍的な機械学習原則として注意が浮かび上がる。
また、オートエンコーダとアテンションベースモデルの基本機能原理に類似性を示す。
これらの等価性は、実用的な要求に基づいてこれらの設計を交換することを可能にする。
例えば、拡散フレームワークを再構成することで、長いトレーニングプロセスと計算集約的な画像生成を減らすことができる。
このアプローチを用いて,注意機構に基づく画像生成のための簡易なアルゴリズムを提案する。
その結果、注意に基づく実装は、労力と計算資源を大幅に減らして、同等のパフォーマンスを実現することがわかった。
関連論文リスト
- Beyond Self-Attention: Sub-Quadratic Vision Transformers for Fast Image Captioning [2.33474141211381]
提案モデルは,ビジョントランスアーキテクチャの再構築による計算効率の向上に重点を置いている。
このモデルはFlickr 30Kデータセットで評価され、既存の作品に対する競争力と大幅な改善が示されている。
論文 参考訳(メタデータ) (2026-06-07T16:57:24Z) - Foundations and Models in Modern Computer Vision: Key Building Blocks in Landmark Architectures [34.542592986038265]
本報告では,コンピュータビジョンにおけるキーデザインパターンの進化を,影響力のある6つの論文から分析する。
本稿では,残差接続を導入したResNetについて概説する。
画像パッチのシーケンスにトランスフォーマーアーキテクチャを適用し,新たなパラダイムを確立したビジョントランスフォーマー(ViT)について検討する。
論文 参考訳(メタデータ) (2025-07-31T09:08:11Z) - Can We Achieve Efficient Diffusion without Self-Attention? Distilling Self-Attention into Convolutions [94.21989689001848]
従来の自己アテンションモジュールをピラミッド畳み込みブロック((Delta)ConvBlocks)に置き換えるための(Delta)ConvFusionを提案する。
ローカライズされた畳み込み操作に注意パターンを蒸留し、他のコンポーネントを凍結させながら、(Delta)ConvFusionは、トランスフォーマーベースの処理に匹敵する性能を達成し、計算コストを6929$times$、LinFusionを5.42$times$の効率で上回る。
論文 参考訳(メタデータ) (2025-04-30T03:57:28Z) - HRR: Hierarchical Retrospection Refinement for Generated Image Detection [16.958383381415445]
階層的レトロスペクティブ再定義(HRR)と呼ばれる拡散モデルに基づく生成画像検出フレームワークを提案する。
HRRフレームワークは、生成した画像検出タスクにおいて、最先端のメソッドよりも優れたパフォーマンスを継続的に提供する。
論文 参考訳(メタデータ) (2025-02-25T05:13:44Z) - Oscillation Inversion: Understand the structure of Large Flow Model through the Lens of Inversion Method [60.88467353578118]
実世界のイメージを逆転させる固定点インスパイアされた反復的アプローチは収束を達成せず、異なるクラスタ間で振動することを示す。
本稿では,画像強調,ストロークベースのリカラー化,および視覚的プロンプト誘導画像編集を容易にする,シンプルで高速な分布転送手法を提案する。
論文 参考訳(メタデータ) (2024-11-17T17:45:37Z) - A Primal-Dual Framework for Transformers and Neural Networks [52.814467832108875]
自己注意は、シーケンスモデリングタスクにおけるトランスフォーマーの顕著な成功の鍵である。
自己アテンションは、支持ベクトル回帰問題から導かれる支持ベクトル展開に対応することを示す。
Batch Normalized Attention (Attention-BN) と Scaled Head (Attention-SH) の2つの新しい注意点を提案する。
論文 参考訳(メタデータ) (2024-06-19T19:11:22Z) - Active Generation for Image Classification [45.93535669217115]
本稿では,モデルのニーズと特徴に着目し,画像生成の効率性に対処することを提案する。
能動学習の中心的傾向として,ActGenという手法が,画像生成のトレーニング・アウェア・アプローチを取り入れている。
論文 参考訳(メタデータ) (2024-03-11T08:45:31Z) - Denoising Autoregressive Representation Learning [13.185567468951628]
DARLはデコーダのみのトランスフォーマーを用いて,画像パッチの自動回帰予測を行う。
提案手法では, 適応型ノイズスケジュールを用いて学習表現を改良し, より大規模なモデルでより長い訓練を行えることを示す。
論文 参考訳(メタデータ) (2024-03-08T10:19:00Z) - Diffusion Models Without Attention [110.5623058129782]
Diffusion State Space Model (DiffuSSM) は、よりスケーラブルな状態空間モデルバックボーンで注目メカニズムを置き換えるアーキテクチャである。
拡散訓練におけるFLOP効率の高いアーキテクチャへの注力は、大きな前進となる。
論文 参考訳(メタデータ) (2023-11-30T05:15:35Z) - Counterfactual Generative Networks [59.080843365828756]
画像生成過程を直接監督せずに訓練する独立した因果機構に分解することを提案する。
適切な誘導バイアスを活用することによって、これらのメカニズムは物体の形状、物体の質感、背景を解き放つ。
その結果, 偽画像は, 元の分類タスクにおける性能の低下を伴い, 分散性が向上することが示された。
論文 参考訳(メタデータ) (2021-01-15T10:23:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。