論文の概要: Amortized Moment Matching for Visual Generation
- arxiv url: http://arxiv.org/abs/2607.26860v1
- Date: Wed, 29 Jul 2026 12:44:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.670759
- Title: Amortized Moment Matching for Visual Generation
- Title(参考訳): 視覚生成のためのモーメントマッチング
- Abstract要約: 本稿では,ニューラルネットワークを用いてデータモーメントを分布学習信号として学習するアモータイズモーメントマッチングを提案する。
Amortized Fréchet Distance (AMFD) の損失をインスタンス化する。
- 参考スコア(独自算出の注目度): 27.680148307313186
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We propose amortized moment matching, utilizing neural networks to learn data moments as distributional training signals. By casting diffusion denoisers through polynomial projections, we establish a general framework for moment amortization, revealing that an $n$-th degree projection explicitly identifies data moments up to order $n+1$. Derived from the tractable affine case, we instantiate the Amortized Fréchet Distance (AMFD) loss. Unlike FD-loss which relies on explicit marginal moment calculations, AMFD is able to dynamically learn conditional moments via an alternating, matrix-free optimization pipeline that effortlessly scales to high-dimensional data. When operating on global representation features, AMFD serves as a powerful post-training objective; empirically, its neural formulation yields more robust training dynamics than exact statistical matching, substantially surpassing the FD baseline on the FDr$^6$ metric and achieving superior one-step generation on ImageNet. Furthermore, it unlocks direct exploration within native generative spaces, suggesting that the first two moments can identify target distributions only in spaces with strong semantics. Finally, when scaled to text-to-image generation, the condition-aware nature of AMFD unlocks massive gains in instruction-following capabilities, enabling our one-step models to outperform their multi-step FLUX.2 [klein] 4B teachers on the GenEval benchmark while achieving on-par performance on PickScore. Code and checkpoints are available at https://github.com/poppuppy/amfd.
- Abstract(参考訳): 本稿では,ニューラルネットワークを用いてデータモーメントを分布学習信号として学習するアモータイズモーメントマッチングを提案する。
多項式射影を通して拡散デノイザをキャストすることにより、モーメントの補正のための一般的な枠組みを確立し、$n$-次射影が$n+1$までデータモーメントを明示的に特定することを明らかにする。
難治性アフィン症例よりAmortized Fréchet Distance (AMFD) を施行した。
明示的な限界モーメント計算に依存するFD-lossとは異なり、AMFDは高次元データに熱心にスケールする交互で行列のない最適化パイプラインを通じて条件モーメントを動的に学習することができる。
実験的には、そのニューラルネットワークの定式化は正確な統計的マッチングよりも堅牢なトレーニングダイナミクスをもたらし、FDr$^6$メトリックのFDベースラインを大幅に上回り、ImageNet上で優れたワンステップ生成を実現している。
さらに、ネイティブな生成空間内での直接探索を解き、最初の2つのモーメントは、強い意味論を持つ空間においてのみターゲット分布を識別できることを示唆している。
最後に、テキスト・ツー・イメージ生成にスケールすると、AMFDの条件認識特性により命令追従能力は大幅に向上し、PickScore上でのオンパーパフォーマンスを達成しつつ、GenEvalベンチマークで1ステップのFLUX.2[klein]4Bの教師より優れている。
コードとチェックポイントはhttps://github.com/poppuppy/amfd.comで入手できる。
関連論文リスト
- From Unfamiliar to Familiar: Detecting Pre-training Data via Gradient Deviations in Large Language Models [24.38939297043815]
既存の手法は主に微調整前後の確率に基づく統計的特徴や信号に焦点を当てている。
対象サンプルの勾配偏差スコアを探索することにより,事前学習データを識別するGDSを提案する。
GDSは、強いベースライン上でのクロスデータセット転送性を大幅に改善し、最先端の性能を実現している。
論文 参考訳(メタデータ) (2026-03-05T05:21:51Z) - Fast and Scalable Analytical Diffusion [43.4234198410875]
解析的拡散モデルは、デノナイジングスコアを経験的ベイズ平均として定式化することにより、生成モデルへの数学的に透過的な経路を提供する。
標準定式化では、すべてのタイムステップでフルデータセットのスキャンを必要とし、データセットサイズと線形にスケーリングする。
我々は,データセットサイズから推論を分離するトレーニングフリーフレームワークであるDynamic Time-Aware Golden Subset Diffusion (GoldDiff)を提案する。
論文 参考訳(メタデータ) (2026-02-18T14:41:09Z) - Self-Supervised Learning via Flow-Guided Neural Operator on Time-Series Data [57.85958428020496]
Flow-Guided Neural Operator (FGNO)は、演算子学習とフローマッチングを組み合わせた新しいフレームワークである。
FGNOは、短時間フーリエ変換を用いて関数空間のマッピングを学習し、異なる時間分解能を統一する。
推論中にノイズのある入力を使用する以前の生成SSL法とは異なり、ノイズのある表現を学習しながら、クリーンな入力を用いて表現抽出を行う。
論文 参考訳(メタデータ) (2026-02-12T18:54:57Z) - FAIL: Flow Matching Adversarial Imitation Learning for Image Generation [52.643484089126844]
フローマッチングモデルのポストトレーニング-高品質な目標値による出力分布の調整-数学的にはImitation Learningと等価である。
本研究では,明示的な報酬やペア比較を伴わずに,対人訓練による政策-専門的差異を最小限に抑えるフローマッチング・アドリアラーニング(FAIL)を提案する。
論文 参考訳(メタデータ) (2026-02-12T16:36:33Z) - ESPADA: Execution Speedup via Semantics Aware Demonstration Data Downsampling for Imitation Learning [18.435889278351297]
ESPADAは3Dグリップ・オブジェクト関係を持つVLM-LLMパイプラインを使用して、デモをセグメント化するセマンティックなフレームワークである。
1つの注釈付きエピソードからフルデータセットにスケールするために、ESPADAはDynamic Time Warpingを通じてセグメントラベルを伝搬する。
ESPADAは成功率を維持しながら約2倍のスピードアップを実現し、人間のデモと効率的なロボット制御のギャップを狭める。
論文 参考訳(メタデータ) (2025-12-08T10:08:33Z) - Private Training & Data Generation by Clustering Embeddings [74.00687214400021]
差分プライバシー(DP)は、個々のデータを保護するための堅牢なフレームワークを提供する。
本稿では,DP合成画像埋め込み生成のための新しい原理的手法を提案する。
経験的に、合成的に生成された埋め込みに基づいて訓練された単純な2層ニューラルネットワークは、最先端(SOTA)分類の精度を達成する。
論文 参考訳(メタデータ) (2025-06-20T00:17:14Z) - SuperFlow++: Enhanced Spatiotemporal Consistency for Cross-Modal Data Pretraining [62.433137130087445]
SuperFlow++は、連続するカメラペアを使用して事前トレーニングと下流タスクを統合する新しいフレームワークである。
SuperFlow++は様々なタスクや運転条件で最先端のメソッドよりも優れています。
強力な一般化性と計算効率により、SuperFlow++は、自動運転におけるデータ効率の高いLiDARベースの認識のための新しいベンチマークを確立する。
論文 参考訳(メタデータ) (2025-03-25T17:59:57Z) - USDRL: Unified Skeleton-Based Dense Representation Learning with Multi-Grained Feature Decorrelation [24.90512145836643]
本稿では,特徴デコレーションに基づく統一骨格に基づくDense Representation Learningフレームワークを提案する。
我々のアプローチは現在のSOTA(State-of-the-art)アプローチよりも大幅に優れています。
論文 参考訳(メタデータ) (2024-12-12T12:20:27Z) - Assessing Neural Network Representations During Training Using
Noise-Resilient Diffusion Spectral Entropy [55.014926694758195]
ニューラルネットワークにおけるエントロピーと相互情報は、学習プロセスに関する豊富な情報を提供する。
データ幾何を利用して基礎となる多様体にアクセスし、これらの情報理論測度を確実に計算する。
本研究は,高次元シミュレーションデータにおける固有次元と関係強度の耐雑音性の測定結果である。
論文 参考訳(メタデータ) (2023-12-04T01:32:42Z) - Value function estimation using conditional diffusion models for control [62.27184818047923]
拡散値関数(DVF)と呼ばれる単純なアルゴリズムを提案する。
拡散モデルを用いて環境-ロボット相互作用の連成多段階モデルを学ぶ。
本稿では,DVFを用いて複数のコントローラの状態を効率よく把握する方法を示す。
論文 参考訳(メタデータ) (2023-06-09T18:40:55Z) - Large Scale Time-Series Representation Learning via Simultaneous Low and
High Frequency Feature Bootstrapping [7.0064929761691745]
本稿では,非コントラスト型自己教師型学習手法を提案する。
提案手法は生の時系列データを入力として、モデルの2つのブランチに対して2つの異なる拡張ビューを生成する。
モデルの堅牢性を実証するために,5つの実世界の時系列データセットに関する広範な実験とアブレーション研究を行った。
論文 参考訳(メタデータ) (2022-04-24T14:39:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。