論文の概要: LatticeSMC: Where to Spend Inference-Time Compute in Chunked Sequence Generators
- arxiv url: http://arxiv.org/abs/2610.02774v1
- Date: Fri, 02 Oct 2026 03:59:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.203161
- Title: LatticeSMC: Where to Spend Inference-Time Compute in Chunked Sequence Generators
- Title(参考訳): LatticeSMC: チャンクシーケンスジェネレータにおける推論時間計算のスプレッド場所
- Abstract要約: 音楽、モーション、ビデオ用のロングフォームジェネレータは、各チャンクを反復分解によって生成し、報酬を全シーケンス上で定義する。
予算整合型チャンクステアリングを導入し, チャンク指数の2次元格子上にファインマン・カックモデルから導出したサンプリング器であるLatticeSMCを提案する。
- 参考スコア(独自算出の注目度): 13.25040795516169
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Long-form generators for music, motion and video produce sequences chunk by chunk, with each chunk generated by iterative denoising while rewards are defined over the full sequence. Existing inference-time steering methods typically act on one axis at a time: best-of-N at the end, Feynman-Kac steering across denoising steps, or streaming pruning across chunks, and are often compared under unmatched compute or different return rules. We introduce budget-matched chunked steering and propose LatticeSMC, a sampler derived from a Feynman-Kac model on the two-dimensional lattice of chunk index and denoising step. Two telescoping results make its design exact: for chunk-additive rewards, the two axes induce identical weights, so resampling should occur where lookahead is cheapest; for terminal rewards, any prefix score defines an exact intermediate potential, making prefix-evaluable rewards twists with no estimation or extra denoiser calls. LatticeSMC resamples on these potentials at chunk boundaries and, when scoring is free, within chunks, returning either a weighted draw or the best particle. Under matched compute, on music-to-dance diffusion and 40-second text-to-music generation, it raises beat alignment from 0.234 to 0.441 (best-of-N: 0.354) and prompt adherence from 0.470 to 0.560 at 32 particles, while preserving held-out quality. It also retains its advantage on long-range rewards and is preferred by human raters in 60-77 percent of pairwise comparisons. Finally, we show that commitment strength should follow the information in the current potential, while the value of lookahead is predicted by the within-set predictability of future reward.
- Abstract(参考訳): 音楽、モーション、ビデオ用のロングフォームジェネレータは、各チャンクを反復分解によって生成し、報酬を全シーケンス上で定義する。
既存の推論時ステアリング手法は、1つの軸に1つずつ作用する: 末尾のベスト・オブ・N、ファインマン・カック(Feynman-Kac) ステアリング(Feynman-Kac) は、デノイングステップをまたいだり、チャンクを流れるストリーミングプルーニング(stream pruning)し、未整合の計算ルールや異なる戻りルールの下で比較されることが多い。
予算整合型チャンクステアリングを導入し, チャンク指数の2次元格子上にFeynman-Kacモデルから導出したサンプルラであるLatticeSMCを提案する。
2つのテレスコープの結果は、その設計を正確にしている: チャンク付加報酬の場合、2つの軸は同じ重量を誘導するため、リサンプリングはルックアヘッドが最も安い場所で発生すべきである; 終端報酬の場合、どんなプレフィックススコアも正確な中間電位を定義し、プレフィックス評価可能な報酬は、推定や余分なデノイザーコールなしでねじれさせる。
LatticeSMCは、これらのポテンシャルをチャンク境界で再サンプリングし、スコアが自由であればチャンク内で、重み付きドローまたは最良の粒子を返す。
一致した計算、音楽間の拡散と40秒のテキスト・ツー・ミュージック・ジェネレーションにより、拍動アライメントは0.234から0.441(ベスト・オブ・N:0.354)に上昇し、32粒子で0.470から0.560まで上昇する。
また、長距離の報酬にも優位性を持ち、対比較の60~77%でヒトのレイカーに好まれる。
最後に、現在のポテンシャルの情報にコミットメントの強さが従うことを示し、その一方で将来の報酬の内面的な予測可能性によってルックアヘッドの価値が予測される。
関連論文リスト
- Correlation-Guided Encoder Selection for Multi-Encoder Large Audio-Language Models [52.59216139491759]
CUES (Correlation-gUided Selection) は、単エンコーダ評価のみから選択中の融合訓練なしで設定された候補をスコアする。
広いトラックAスイートでは、CUESはクロスファミリートリオ(Whisper-medium、mHuBERT-147、Dasheng-base)を選択する。
TrackBテキスト生成では、フォーカスされた音声のみのペア(mHuBERT-147とWavLM-base-plus)で再アンカーする。
論文 参考訳(メタデータ) (2026-09-16T02:41:41Z) - Off-Manifold Refinement: Guiding Video Generators with a Frozen World Model [2.4870727053423236]
Off-Manifold Refinement (OMR)は、単一のサンプリング軌道に直接ワールドモデルフィードバックを注入する推論時間法である。
固定された400-prompt VideoPhy-2の詳細部分集合では、OMRはSemantic-Adherence-and-Physical-Commonsenseを47.0%から52.0%に引き上げる。
論文 参考訳(メタデータ) (2026-08-30T17:00:09Z) - Training-Free Hidden-State Refinement for Flow-Matching Image Generators [13.43479682921888]
着信毎に選択したトランスフォーマー層を繰り返し適用する学習自由ループフレームワークを提案する。
2つのスケール-RAEモデルスケールで、ループ変種は、競合する品質-効率のトレードオフを伴う一次および補助的な品質指標を改善する。
論文 参考訳(メタデータ) (2026-08-29T09:17:02Z) - TurboT2VA: Fast Large-Scale Text-to-Video-Audio Generation via Score-Regularized Consistency Distillation [105.14745366152725]
TurboT2VAは、ジョイントテキスト・ツー・ビデオ・オーディオ生成のための蒸留および推論フレームワークである。
LTX-2では、4段階の蒸留により512$times$768の標準評価解像度でジェネレータのレイテンシを50.52sから2.51sに短縮する。
完全なスタックは、ジェネレータのレイテンシを318.74sから1つのNVIDIA H20で5.83sに短縮し、54.67$times$ジェネレータのみのスピードアップを達成した。
論文 参考訳(メタデータ) (2026-08-25T15:09:02Z) - Mean-to-Score Discrete Diffusion: Posterior-Mean Denoisers for Score Entropy [17.48959208263029]
我々は,クリーンな後進平均を予測し,正確なカーネル依存線形写像を用いてスコアに変換するEmphmean-to-score (M2S)を導入する。
均一な汚職のために、確率的単純度をブリッジポリトープにマッピングし、吸収マスクの破損のためにMD4を正確に回収する。
論文 参考訳(メタデータ) (2026-07-23T14:37:30Z) - Representation Distribution Matching for One-Step Visual Generation [107.84208192304455]
表現分布マッチング(Representation Distribution Matching, RDM)の設計空間の解明
2つの設計軸、分布がどのように比較され、それらの表現が比較されるかを特定し、それに沿って制御された研究によって3つの結果が得られた。
同じレシピは4ステップのFLUX.2[klein]を1ステップのジェネレータに後付けし、GenEvalの4ステップバージョンである0.826から0.794、PickScoreの22.76から22.58を90 H200 GPU時間で上回った。
論文 参考訳(メタデータ) (2026-07-02T16:15:38Z) - ZIP-RC: Optimizing Test-Time Compute via Zero-Overhead Joint Reward-Cost Prediction [57.799425838564]
ZIP-RCは、モデルに報酬とコストのゼロオーバーヘッド推論時間予測を持たせる適応推論手法である。
ZIP-RCは、同じまたはより低い平均コストで過半数投票よりも最大12%精度が向上する。
論文 参考訳(メタデータ) (2025-12-01T09:44:31Z) - MIRA: Towards Mitigating Reward Hacking in Inference-Time Alignment of T2I Diffusion Models [86.07486858219137]
拡散モデルは、テキストプロンプトに条件付けされた画像を生成するのに優れている。
得られた画像は、Aesthetic Scoresのようなスカラー報酬によって測定されるユーザ固有の基準を満たさないことが多い。
近年,ノイズ最適化による推定時間アライメントが,効率的な代替手段として浮上している。
このアプローチは報酬のハッキングに苦しめられ、モデルが高いスコアの画像を生成できるが、元のプロンプトとはかなり異なる。
論文 参考訳(メタデータ) (2025-10-02T00:47:36Z) - A Novel Approach for Estimating Largest Lyapunov Exponents in One-Dimensional Chaotic Time Series Using Machine Learning [0.0]
機械学習を用いて1次元カオス時系列から最大のリアプノフ指数(LLE)を推定するためのデータ駆動手法を提案する。
予測器はサンプル外マルチ水平予測を生成するように訓練され、LLEは地平線を横切る幾何平均予測誤差(GMAE)の指数的成長から推定される。
我々は,4つの標準1次元地図-ロジスティック,正弦,立方体,チェビシェフが達成するR2pos > 0.99のアプローチを,M = 450と短い列の基準LLE曲線に対して検証した。
論文 参考訳(メタデータ) (2025-07-07T10:53:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。