論文の概要: Explorative Modeling: Unlocking a Third Pretraining Axis and End-to-End Generation
- arxiv url: http://arxiv.org/abs/2607.27372v1
- Date: Wed, 29 Jul 2026 18:25:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.305581
- Title: Explorative Modeling: Unlocking a Third Pretraining Axis and End-to-End Generation
- Title(参考訳): 探索的モデリング:第3の事前学習軸とエンド・ツー・エンド・ジェネレーションの解錠
- Abstract要約: トレーニングループを規定する新しいパラダイムであるExplorative Modelingを導入し、モデル世代とデータ間のK候補マッチングを探索し、最高のトレーニングを行う。
まず、探索の増加は、既存の生成モデルのためのパラメータとデータを超えた第3の事前学習軸を追加する。
第2に、XMは16-256倍の推論ステップで制御タスク上の拡散と一致する、エンドツーエンドの再構成生成モデリングを可能にする。
- 参考スコア(独自算出の注目度): 89.51408170909548
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The deep learning revolution, kicked off by AlexNet, taught us that end-to-end training beats decomposing a problem into hand-designed stages. Generative modeling, however, has remained the exception-despite generative models being remarkably capable, they are still not trained end-to-end. This is because, at its core, generative modeling is about handling distributions with many modes, and existing scalable approaches handle this the same way, by factoring the generation procedure, which prevents end-to-end generation. In this work, we introduce Explorative Modeling, a new paradigm that instead factors the training loop, exploring K candidate matches between model generations and data, and training on the best, so predictions commit to modes rather than blurring them. We find Explorative Models (XMs) useful in two settings. First, increasing exploration adds a third pretraining axis beyond parameters and data for existing generative models-where scaling exploration monotonically improves performance across both continuous and discrete domains (images, video, and language). Notably, gains from exploration increase with scale, climbing from 7% to 36% as data scales and from 13% to 23% as models grow, with efficiency gains more than doubling at 3x the compute. Concretely, exploration improves FLOP efficiency by 4.1x, sample efficiency by 6.2x, parameter efficiency by 47%, lifts the strongest of image-generation recipes to a near-state-of-the-art 1.43 FID on ImageNet without guidance, enables scaling how end-to-end existing models are, and unlocks scaling generalization. Second, XMs enable end-to-end reconstructive generative modeling, matching diffusion on control tasks with 16-256x fewer inference steps. Together, these results establish XMs as both a new pretraining axis for existing generative models and a standalone end-to-end generative modeling paradigm.
- Abstract(参考訳): AlexNetが立ち上げたディープラーニング革命は、エンドツーエンドのトレーニングが、問題を手作業で設計したステージに分解する、ということを教えてくれました。
しかし、生成モデルは非常に能力があるにもかかわらず、生成モデリングは例外に留まっている。
これは、生成モデリングの中核にあるのは、多くのモードで分散を処理することです。
本研究では,学習ループを判断し,モデル生成とデータ間のK候補マッチングを探索し,最適なトレーニングを行う新しいパラダイムである探索的モデリングを導入する。
探索モデル(XM)は2つの設定で有用である。
まず、探索の増加は、既存の生成モデルのためのパラメータとデータを超えた第3の事前学習軸を追加します。
特に、スケールによる探索によるゲインの増加、データスケールによる7%から36%、モデルの成長に伴って13%から23%に上昇し、効率は計算の3倍に倍増する。
具体的には、調査はFLOP効率を4.1倍改善し、サンプル効率を6.2倍、パラメータ効率を47%向上し、画像生成の最も強力なレシピをImageNet上のほぼ最先端の1.43 FIDに引き上げ、エンドツーエンドの既存モデルがどのようにあるかのスケーリングを可能にし、拡張の一般化を解放する。
第2に、XMは16-256倍の推論ステップで制御タスク上の拡散と一致する、エンドツーエンドの再構成生成モデリングを可能にする。
これらの結果は、既存の生成モデルのための新しい事前学習軸として、またスタンドアロンの生成モデルパラダイムとして、XMを確立している。
関連論文リスト
- Solve the Loop: Attractor Models for Language and Reasoning [4.8720589853137435]
Looped Transformerは、純粋にフィードフォワード計算に代わる有望な代替手段を提供する。
本稿では、まず、バックボーンモジュールが出力の埋め込みを提案し、次にアトラクターモジュールが固定点を解くことでそれらを洗練するAttractor Modelsを紹介する。
本研究では,Attractor Modelsが,大規模言語モデル事前学習と推論という2つのレシエーションにおいて,既存モデルよりも優れていることを示す。
論文 参考訳(メタデータ) (2026-05-12T17:51:26Z) - Coupling Models for One-Step Discrete Generation [50.37847093567075]
カップリングモデル(英: Coupling Models)は、離散列とガウス列の間の直接結合を学習する一段階の離散生成モデルである。
単純なデータ間結合と手動で特定したデータ間結合による複雑な連続フローを回避する。
LM1Bテキスト生成パープレキシティを最低パープレキシティ動作ポイントで33%削減する。
論文 参考訳(メタデータ) (2026-05-08T03:40:39Z) - Disentangled Robot Learning via Separate Forward and Inverse Dynamics Pretraining [28.30092786035367]
DeFIはビジュアルフォワードと逆ダイナミクスを分離し、各データソースを利用するための新しいフレームワークである。
今後の予測のために,多種多様な人・ロボットビデオで事前訓練された一般フォワード・ダイナミクス・モデル(GFDM)と,ラベルなしビデオ遷移から潜伏行動を予測するための自己教師付き学習によって訓練された一般逆ダイナミクス・モデル(GIDM)を紹介する。
CALVIN ABC-D と SimplerEnv の実験では、DeFI は CALVIN の平均タスク長 4.51 に達し、SimplerEnv-Frac は 51.2% 成功した。
論文 参考訳(メタデータ) (2026-03-27T17:20:10Z) - Seed2Scale: A Self-Evolving Data Engine for Embodied AI via Small to Large Model Synergy and Multimodal Evaluation [18.80050956469094]
Seed2Scaleは、データボトルネックを克服する自己進化型データエンジンである。
軽量のVision-Language-ActionモデルであるSuperTinyを専用のコレクタとして採用している。
訓練済みのビジョンランゲージモデルがVeriferとして統合され、自律的に成功/失敗判定を行う。
論文 参考訳(メタデータ) (2026-03-09T11:30:45Z) - ArtiFixer: Enhancing and Extending 3D Reconstruction with Auto-Regressive Diffusion Models [27.324967736816337]
3Dガウススプラッティングのようなシーンごとの最適化手法は、最先端の斬新なビュー合成の質を提供するが、観測されていない領域への外挿は不十分である。
2つの重要な洞察を利用する2段階のパイプラインを提案する。
まず、新しい不透明混合戦略を用いて、強力な双方向生成モデルを訓練する。
第二に、これを因果自己回帰モデルに蒸留し、1回のパスで数百フレームを生成する。
論文 参考訳(メタデータ) (2026-02-28T06:22:40Z) - Adversarial Flow Models [26.917627135225118]
本稿では,逆流モデルとフローモデルを統一する生成モデルのクラスである逆流モデルを提案する。
本手法は, ネイティブなワンステップ生成やマルチステップ生成をサポートし, 対角目標を用いて学習する。
56層モデルと112層モデルにおいて,中間的監督を伴わない深度反復によるエンドツーエンドトレーニングの可能性を示す。
論文 参考訳(メタデータ) (2025-11-27T14:04:08Z) - One-Step Diffusion Distillation through Score Implicit Matching [74.91234358410281]
本稿では,Score Implicit Matching (SIM) を用いて,事前学習した拡散モデルを単一ステップジェネレータモデルに蒸留する手法を提案する。
SIMはワンステップジェネレータに対して強い経験的性能を示す。
リードトランスに基づく拡散モデルにSIMを適用することにより,テキスト・ツー・イメージ生成のための単一ステップ生成器を蒸留する。
論文 参考訳(メタデータ) (2024-10-22T08:17:20Z) - Self-Play Fine-Tuning of Diffusion Models for Text-to-Image Generation [59.184980778643464]
ファインチューニング拡散モデル : 生成人工知能(GenAI)の最前線
本稿では,拡散モデル(SPIN-Diffusion)のための自己演奏ファインチューニングという革新的な手法を紹介する。
提案手法は従来の教師付き微調整とRL戦略の代替として,モデル性能とアライメントの両方を大幅に改善する。
論文 参考訳(メタデータ) (2024-02-15T18:59:18Z) - A-SDM: Accelerating Stable Diffusion through Redundancy Removal and
Performance Optimization [54.113083217869516]
本研究ではまず,ネットワークの計算冗長性について検討する。
次に、モデルの冗長性ブロックをプルークし、ネットワーク性能を維持する。
第3に,計算集約型注意部を高速化するグローバル地域対話型注意(GRI)を提案する。
論文 参考訳(メタデータ) (2023-12-24T15:37:47Z) - Consistency Models [89.68380014789861]
ノイズを直接データにマッピングすることで,高品質なサンプルを生成する新しいモデル群を提案する。
設計によって高速なワンステップ生成をサポートしながら、マルチステップサンプリングによって、サンプル品質の計算を交換することができる。
イメージインペイント、カラー化、超高解像度といったゼロショットデータ編集も、明示的なトレーニングを必要とせずサポートしている。
論文 参考訳(メタデータ) (2023-03-02T18:30:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。