論文の概要: Test-Time Scaling for Video Diffusion Models via Diagnosis-Guided Candidate Recycling
- arxiv url: http://arxiv.org/abs/2608.29322v1
- Date: Sat, 29 Aug 2026 15:08:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:30.924057
- Title: Test-Time Scaling for Video Diffusion Models via Diagnosis-Guided Candidate Recycling
- Title(参考訳): 診断誘導候補リサイクルによるビデオ拡散モデルの試験時間スケーリング
- Abstract要約: textbfGEARS (textbfGuided textbfEditing for textbfRecycling textbfSearch) は,テキスト誘導型候補リサイクルをビデオTSに導入したトレーニングフリーフレームワークである。
- 参考スコア(独自算出の注目度): 33.61736033562169
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent video diffusion models have achieved remarkable generation quality, but high-fidelity results still largely depend on closed-source systems or costly large-scale infrastructure. Test-time scaling (TTS) offers a training-free way to improve lightweight generators by spending additional inference compute, yet existing methods mostly remain within a noise-search paradigm: they sample, select, or perturb denoising trajectories and discard low-scoring candidates after expensive generation. This generate-and-discard process wastes not only computation but also the partial motion, layout, or appearance structure already encoded in recoverable samples. We present \textbf{GEARS} (\textbf{G}uided \textbf{E}diting for \textbf{A}daptive \textbf{R}ecycling \textbf{S}earch), a training-free framework that introduces {diagnosis-guided candidate recycling} into video TTS by turning such candidates into editable priors through a generation-evaluation-editing loop. GEARS consists of two collaborative components. The \textbf{Stage-Aware Scheduler} determines what to repair, when to repair it, and which candidates should be preserved, recycled, or discarded. The \textbf{Candidate Recycler} diagnoses recoverable failures from keyframes and multi-dimensional reward feedback, derives candidate-specific repair prompts, and repairs the corresponding candidates through manifold-aware latent SDEdit. The repaired candidates are recycled into the search pool, creating refinement paths beyond standard noise perturbation while preserving useful structure. Under matched NFE budgets, GEARS consistently outperforms existing video TTS methods on VBench, bringing a 1.3B model to a total score comparable to a 14B counterpart, and ablations verify the necessity of adaptive scheduling, diagnosis-conditioned editing, and manifold-aware re-denoising. Code is available on GitHub.
- Abstract(参考訳): 最近のビデオ拡散モデルは、優れた生成品質を達成したが、高忠実度結果は依然として、クローズドソースシステムや高価な大規模インフラに依存している。
テストタイムスケーリング(TTS)は、追加の推論計算を使用することで軽量なジェネレータを改善するためのトレーニング不要な方法を提供するが、既存の手法はノイズ検索パラダイム内に留まっている。
この生成・破棄プロセスは、計算だけでなく、既に回収可能なサンプルにエンコードされている部分的な動き、レイアウト、外観構造も無駄にしている。
本稿では, {diagnosis-guided candidate recycling} をビデオ TTS に導入する学習自由フレームワークである \textbf{G}uided \textbf{E}diting for \textbf{A}daptive \textbf{R}ecycling \textbf{S}earch を提案する。
GEARSは2つの共同コンポーネントから構成される。
textbf{Stage-Aware Scheduler} は、修理すべきもの、いつ修理するか、どの候補を保存、リサイクル、破棄するかを決定する。
textbf{Candidate Recycler}は、キーフレームからの回復可能な障害と多次元の報酬フィードバックを診断し、候補固有の修復プロンプトを導出し、多様体対応の潜在SDEditを通じて対応する候補を修復する。
補修された候補は、検索プールにリサイクルされ、有用な構造を維持しながら、標準ノイズ摂動を超えた洗練された経路が作成される。
一致したNFE予算の下では、GEARSはVBench上の既存のビデオTS手法を一貫して上回り、1.3Bモデルが14Bに匹敵するスコアに到達し、適応的なスケジューリング、診断条件付き編集、多様体対応の再認識の必要性を検証する。
コードはGitHubで入手できる。
関連論文リスト
- ResiSpec: Enhancing Multi-Candidate Speculative Sampling via Residual Distribution Shaping [79.1905186547363]
ResiSpecは、検証中に提案の配布を戦略的に改革するフレームワークである。
候補の偏光を防止し、最先端のマルチ候補法よりも最大1.92$times$スピードアップを達成する。
論文 参考訳(メタデータ) (2026-08-25T11:25:55Z) - Anchoring and Steering Diffusion: Enhancing the Faithfulness of Text-to-Image Generation at Inference Time [16.04233421396159]
AnchorSteerは、きめ細かい制御を行う、トレーニング不要のフレームワークである。
textbfAnchorSteerとそのコンポーネント。
GenEvalとT2I-CompBench++の実験は、AnchorSteerがテキストのアライメントにおいて既存のベースラインを一貫して上回っていることを示している。
論文 参考訳(メタデータ) (2026-07-29T09:08:57Z) - STRIDE: A Self-Reflective Agent Framework for Reliable Automatic Equation Discovery [6.0574120466674986]
LLMに基づく方程式探索は、データからシンボル法則を回復するための有望な経路を提供する。
本研究では,データ・アウェア・ジェネレーション,混合適合評価,批評家・実行者修復,多様性保存セマンティックメモリの調整により信頼性を向上させる自己表現型エージェント・フレームワークSTRIDEを提案する。
論文 参考訳(メタデータ) (2026-05-18T03:14:32Z) - One Step Forward and K Steps Back: Better Reasoning with Denoising Recursion Models [4.903188186588148]
Denoising Recursion Modelsは、データをノイズで汚すが、複数のステップで破損を逆転させるようモデルを訓練する手法である。
この戦略は、中間状態の抽出可能なカリキュラムを提供すると同時に、テストとの整合性を向上し、非グレーディで前向きな世代にインセンティブを与える。
この手法はARC-AGI上のTiny Recursion Modelよりも優れており、最近はブレークスルー性能を達成している。
論文 参考訳(メタデータ) (2026-04-20T21:06:12Z) - LatSearch: Latent Reward-Guided Search for Faster Inference-Time Scaling in Video Diffusion [87.42285185305813]
本稿では,Reward-Guided Resampling and Pruningを実行する新しい推論時間探索機構を提案する。
LatSearchは、ベースラインのWan2.1モデルと比較して、複数の評価次元にわたるビデオ生成を一貫して改善する。
論文 参考訳(メタデータ) (2026-03-15T18:07:29Z) - CLaRa: Bridging Retrieval and Generation with Continuous Latent Reasoning [34.38636514331703]
CLaRaは、埋め込みベースの圧縮と共同最適化を共有連続空間で実行する統合フレームワークである。
実験により、CLaRaは、しばしばテキストベースの微調整ベースラインを超える、最先端の圧縮と性能の再ランクを達成することが示された。
論文 参考訳(メタデータ) (2025-11-24T00:11:14Z) - Robust Canonicalization through Bootstrapped Data Re-Alignment [5.437226012505534]
昆虫や鳥の識別などのきめ細かい視覚分類タスクは、微妙な視覚的手がかりに対する感受性を必要とする。
分散を低減してトレーニングサンプルを反復的に調整するブートストラップアルゴリズムを提案する。
本手法は,拡張と同等の性能を保ちながら,同変および正準化ベースラインを一貫して上回ることを示す。
論文 参考訳(メタデータ) (2025-10-09T13:05:20Z) - Gumbel Reranking: Differentiable End-to-End Reranker Optimization [61.16471123356738]
RAGシステムは関連する文書を識別するためにリランカーに依存している。
注釈付きクエリ-ドキュメントペアが不足しているため、これらのモデルの微調整は依然として難しい。
我々は,トレーニングと推論のギャップを最小限に抑えることを目的とした,リランカーのためのエンドツーエンドのトレーニングフレームワークであるGumbel Re rankを提案する。
論文 参考訳(メタデータ) (2025-02-16T13:23:39Z) - Noisy Correspondence Learning with Self-Reinforcing Errors Mitigation [63.180725016463974]
クロスモーダル検索は、実際は精力的な、十分に整合した大規模データセットに依存している。
我々は、新しい雑音対応学習フレームワーク、textbfSelf-textbfReinforcing textbfErrors textbfMitigation(SREM)を導入する。
論文 参考訳(メタデータ) (2023-12-27T09:03:43Z) - Noise-Robust Dense Retrieval via Contrastive Alignment Post Training [89.29256833403167]
Contrastive Alignment POst Training (CAPOT) は、指数再生を必要とせず、モデルロバスト性を改善する高効率な微調整法である。
CAPOTはドキュメントエンコーダを凍結することで堅牢な検索を可能にし、クエリエンコーダはノイズの多いクエリを修正されていないルートに整列させる。
MSMARCO、Natural Questions、Trivia QAパス検索のCAPOTノイズ変動を評価し、CAPOTがオーバーヘッドを伴わないデータ増大に類似した影響があることを発見した。
論文 参考訳(メタデータ) (2023-04-06T22:16:53Z) - Making Reconstruction-based Method Great Again for Video Anomaly
Detection [64.19326819088563]
ビデオの異常検出は重要な問題だが、難しい問題だ。
既存の再構成に基づく手法は、昔ながらの畳み込みオートエンコーダに依存している。
連続フレーム再構築のための新しいオートエンコーダモデルを提案する。
論文 参考訳(メタデータ) (2023-01-28T01:57:57Z) - Bridging the Gap Between Clean Data Training and Real-World Inference
for Spoken Language Understanding [76.89426311082927]
既存のモデルはクリーンデータに基づいてトレーニングされ、クリーンデータトレーニングと現実世界の推論の間にtextitgapが発生する。
本稿では,良質なサンプルと低品質のサンプルの両方が類似ベクトル空間に埋め込まれた領域適応法を提案する。
広く使用されているデータセット、スニップス、および大規模な社内データセット(1000万のトレーニング例)に関する実験では、この方法は実世界の(騒々しい)コーパスのベースラインモデルを上回るだけでなく、堅牢性、すなわち、騒々しい環境下で高品質の結果を生み出すことを実証しています。
論文 参考訳(メタデータ) (2021-04-13T17:54:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。