論文の概要: Flash-BoN: Instant Drafts for Inference-Time Scaling in Diffusion Models
- arxiv url: http://arxiv.org/abs/2607.04461v1
- Date: Sun, 05 Jul 2026 19:02:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.942726
- Title: Flash-BoN: Instant Drafts for Inference-Time Scaling in Diffusion Models
- Title(参考訳): Flash-BoN:拡散モデルにおける推論時間スケーリングのためのインスタントドラフト
- Authors: Ruchit Rawal, Reza Shirkavand, Sayak Paul, Yuxin Wen, Heng Huang, Yizheng Chen, Tom Goldstein, Gowthami Somepalli,
- Abstract要約: テキストから画像への推論時間のスケーリングは、単純なBest-of-N$サンプリングからガイド付き検索方法まで進歩している。
これらのアプローチは、いつ、どの程度の頻度でデノベーションを行うかに焦点が当てられているが、生成自体のコストを固定として扱うのがほとんどである。
ウォールクロック評価では、単純なBoNが既にいくつかのガイド付き検索手法に適合または優れていたことを示す。
- 参考スコア(独自算出の注目度): 91.19049123903137
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Inference-time scaling for text-to-image generation has progressed from simple Best-of-$N$ (BoN) sampling to guided search methods that verify and steer candidate trajectories at intermediate denoising steps. These approaches focus on when and how often to verify during denoising but largely treat the cost of generation itself as fixed. Moreover, the standard practice of comparing methods by number of function evaluations (NFEs) counts only denoising forward passes and ignores verifier overhead, which can distort efficiency rankings. We show that under wall-clock evaluation, simple BoN already matches or outperforms several guided search techniques, suggesting that compute is better spent on broader exploration than on repeated intermediate verification. This motivates Flash-BoN, which generates a large pool of inexpensive draft candidates by combining three complementary acceleration knobs: timestep truncation, layer skipping, and activation proxies into a single configuration optimized once per model. An efficient multi-stage verification procedure then identifies the most promising draft, which is refined at full quality. Across three benchmarks and three model scales, Flash-BoN consistently outperforms all baselines under fixed wall-clock budgets, with gains that grow at larger model scales (+8% AUC). We further show that our strategy combines well and improves existing orthogonal techniques such as reflection-based prompt optimization (+16% AUC). The gains correlate with increased candidate diversity, which also enables draft-guided selection to accelerate RL post-training convergence.
- Abstract(参考訳): テキスト・画像生成のための推論時間スケーリングは、単純なBest-of-N$(BoN)サンプリングから、中間認知段階における候補軌道の検証とステアリングを行うガイド付き検索方法まで進歩している。
これらのアプローチは、いつ、どの程度の頻度でデノベーションを行うかに焦点が当てられているが、生成自体のコストを固定として扱うのがほとんどである。
さらに,関数評価(NFE)数によるメソッド比較の標準手法では,前方通過のみをカウントし,検証のオーバーヘッドを無視して効率ランキングを歪ませることができる。
ウォールクロック評価では、単純なBoNはすでにいくつかのガイド付き検索手法に適合または優れており、計算は反復的な中間検証よりも広い探索に費やされていることが示唆されている。
これによりFlash-BoNは,3つの補完的なアクセラレーションノブ – タイムステップトランケーション,レイヤスキップ,アクティベーションプロキシを,モデル毎に1回最適化された単一構成に組み合わせることで,安価なドラフト候補を大量に生成する。
効率的な多段階検証手順は、最も有望なドラフトを特定し、それが完全な品質で洗練される。
3つのベンチマークと3つのモデルスケールにまたがって、Flash-BoNは、固定されたウォールタイム予算の下で、すべてのベースラインを一貫して上回り、より大きなモデルスケール (+8% AUC) で成長する。
さらに、我々の戦略がうまく組み合わさり、リフレクションベースのプロンプト最適化(+16% AUC)のような既存の直交手法を改善していることを示す。
利得は候補の多様性の増加と相関し、ドラフト誘導選択によりRL後の収束を加速することができる。
関連論文リスト
- TwiSTAR:Think Fast, Think Slow, Then Act,Generative Recommendation with Adaptive Reasoning [3.2829140652979647]
セマンティックID(SID)を用いたジェネレーティブレコメンデーション(ジェネレーティブレコメンデーション)が,有望なパラダイムとして浮上している。
既存の手法では、すべてのユーザ履歴に一様に、高速なダイレクトジェネレーションまたは遅いチェーン・オブ・シークレット推論の固定推論戦略を適用している。
本稿では,ユーザシーケンス毎に推論作業を適応的に割り当てることを学ぶフレームワークであるThink Fast,Think Slow, Then Actを提案する。
論文 参考訳(メタデータ) (2026-05-12T05:35:00Z) - FASTER: Value-Guided Sampling for Fast RL [103.55398181003262]
FASTERは、計算コストを伴わずに拡散ベースのポリシーのサンプリングベースのテストタイムスケーリングの利点を得る方法である。
FASTERは、トレーニングと推論の計算要求を大幅に削減しながら、同じパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-04-21T17:52:17Z) - $S^3$: Stratified Scaling Search for Test-Time in Diffusion Language Models [10.157422365382933]
テスト時間スケーリングは、より多くの推論計算が与えられたとき、固定拡散言語モデル(DLM)がより良い出力を生成できるかどうかを調べる。
S3$ (Stratified Scaling Search) は,デノナイズ処理中に計算を再配置することで生成を改善するバリデーション誘導探索法である。
LLaDA-8B-Instruct on MATH-500, GSM8K, ARC-Challenge, TruthfulQA による実験では、S3$ はベンチマーク全体のパフォーマンスを一貫して改善している。
論文 参考訳(メタデータ) (2026-04-07T00:51:06Z) - Prism: Efficient Test-Time Scaling via Hierarchical Search and Self-Verification for Discrete Diffusion Language Models [96.0074341403456]
LLM推論を改善するための実用的な方法として、推論時計算が再導入されている。
テスト時間スケーリング(TTS)アルゴリズムの多くは、自動回帰デコーディングに依存している。
そこで我々は,dLLM のための効率的な TTS フレームワーク Prism を提案する。
論文 参考訳(メタデータ) (2026-02-02T09:14:51Z) - PMPO: Probabilistic Metric Prompt Optimization for Small and Large Language Models [1.6816171955882597]
PMPOはマスキングに基づく分析を通じて低品質のプロンプトセグメントを特定し、反復的にそれらを書き換えて改良された変種を提案する。
単一のフォワードパスにおける損失を最小限に抑え、出力のサンプリングを排除し、選択のための人または判断に基づくスコアをなくし、変種の中から選択する。
PMPOは、BBHで最高平均精度を達成し、GSM8KとAQUA RATに強く依存し、AlpacaEval 2.0の勝利率を19ポイント以上上げる。
論文 参考訳(メタデータ) (2025-05-22T06:59:10Z) - Fast T2T: Optimization Consistency Speeds Up Diffusion-Based Training-to-Testing Solving for Combinatorial Optimization [83.65278205301576]
雑音レベルから与えられたインスタンスの最適解への直接写像を学習し、最小限のショットで高品質な生成を容易にすることを提案する。
これは、サンプル間の差を最小限に抑える最適化一貫性トレーニングプロトコルによって達成される。
The Traveling Salesman Problem (TSP) と Maximal Independent Set (MIS) は、ソリューションの品質と効率の両方に関して、Fast T2Tの優位性を実証している。
論文 参考訳(メタデータ) (2025-02-05T07:13:43Z) - Faster WIND: Accelerating Iterative Best-of-$N$ Distillation for LLM Alignment [81.84950252537618]
本稿では,反復的BONDと自己プレイアライメントの統一的なゲーム理論接続を明らかにする。
WINレート支配(WIN rate Dominance, WIND)という新しいフレームワークを構築し, 正規化利率支配最適化のためのアルゴリズムを多数提案する。
論文 参考訳(メタデータ) (2024-10-28T04:47:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。