論文の概要: Stream-T1: Test-Time Scaling for Streaming Video Generation
- arxiv url: http://arxiv.org/abs/2605.04461v1
- Date: Wed, 06 May 2026 03:40:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-07 18:41:07.630579
- Title: Stream-T1: Test-Time Scaling for Streaming Video Generation
- Title(参考訳): Stream-T1: ストリーミングビデオ生成のためのテスト時間スケーリング
- Authors: Yijing Tu, Shaojin Wu, Mengqi Huang, Wenchuan Wang, Yuxin Wang, Chunxiao Liu, Zhendong Mao,
- Abstract要約: Stream-T1は、ストリーミングビデオ生成専用の総合的なテスト時間スケーリングフレームワークである。
5sと30sの総合的なビデオベンチマークで評価すると、Stream-T1は大きな優位性を示している。
- 参考スコア(独自算出の注目度): 30.575612184373025
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: While Test-Time Scaling (TTS) offers a promising direction to enhance video generation without the surging costs of training, current test-time video generation methods based on diffusion models suffer from exorbitant candidate exploration costs and lack temporal guidance. To address these structural bottlenecks, we propose shifting the focus to streaming video generation. We identify that its chunk-level synthesis and few denoising steps are intrinsically suited for TTS, significantly lowering computational overhead while enabling fine-grained temporal control. Driven by this insight, we introduced Stream-T1, a pioneering comprehensive TTS framework exclusively tailored for streaming video generation. Specifically, Stream-T1 is composed of three units: (1) Stream -Scaled Noise Propagation, which actively refines the initial latent noise of the generating chunk using historically proven, high-quality previous chunk noise, effectively establishes temporal dependency and utilizing the historical Gaussian prior to guide the current generation; (2) Stream -Scaled Reward Pruning, which comprehensively evaluates generated candidates to strike an optimal balance between local spatial aesthetics and global temporal coherence by integrating immediate short-term assessments with sliding-window-based long-term evaluations; (3) Stream-Scaled Memory Sinking, which dynamically routes the context evicted from KV-cache into distinct updating pathways guided by the reward feedback, ensuring that previously generated visual information effectively anchors and guides the subsequent video stream. Evaluated on both 5s and 30s comprehensive video benchmarks, Stream-T1 demonstrates profound superiority, significantly improving temporal consistency, motion smoothness, and frame-level visual quality.
- Abstract(参考訳): TTS(Test-Time Scaling)は,トレーニングコストの増大を伴わずに映像生成を向上するための有望な方向を提供する一方で,現在の拡散モデルに基づくテストタイムビデオ生成手法は,外乱的候補探索コストに悩まされ,時間的ガイダンスが欠如している。
これらの構造的ボトルネックに対処するために、ストリーミングビデオ生成に焦点を移すことを提案する。
我々は,そのチャンクレベルの合成と最小のデノナイジングステップが本質的にTSに適しており,微粒な時間制御が可能でありながら計算オーバーヘッドを大幅に低減することを確認した。
この洞察に基づいて、私たちはストリーミングビデオ生成専用の総合的なTSフレームワークであるStream-T1を導入しました。
具体的には,(1)ストリーム-スケールドノイズ伝搬(Stream-Scaled noise Propagation),(2)ストリーム-スケールドノイズ伝搬(Stream-Scaled noise Propagation),(2)ストリーム-スケールドノイズ伝搬(Stream-Scaled noise Propagation),(2)ストリーム-スケールドプルーニング(Stream-Scaled Reward Pruning),(2) 局所空間美学とグローバル時間コヒーレンス(global temporal Coherence)の最適バランスを総合的に評価するストリーム-スケールドノイズ伝達(Stream-Scaled Memory Sinking),(3) KV-キャッシュから放出されたコンテキストを,フィードバックによって誘導された異なる経路へ動的にルーティングするストリーム-スケールドメモリシンキング(Stream-Scaled Memory Sinking)の3つのユニットから構成される。
Stream-T1は5sと30sの総合的なビデオベンチマークで評価され、時間的一貫性、動作のスムーズさ、フレームレベルの視覚的品質を大幅に改善した。
関連論文リスト
- Rolling Forcing: Autoregressive Long Video Diffusion in Real Time [86.40480237741609]
Rolling Forcingは、エラーの最小限の蓄積で長いビデオをストリーミングできる、新しいビデオ生成技術である。
転がり強制力には3つの新しい設計が伴う。第一に、エラー伝播を加速する個別のフレームを反復的にサンプリングする代わりに、共同演示方式を設計する。
第2に,アテンションシンク機構を長軸ストリームビデオ生成タスクに導入し,初期フレームのキー値状態をグローバルなコンテキストアンカーとして保持する。
第3に,大半が拡張された遮音窓上での無段蒸留を可能にする効率的な訓練アルゴリズムを設計する。
論文 参考訳(メタデータ) (2025-09-29T17:57:14Z) - Video-LLMs with Temporal Visual Screening [59.18455762289321]
テンポラル・ビジュアル・スクリーニング (TVS) はビデオ質問応答とチューニングデータを処理する新しいタスクである。
TVSは、ビデオインストラクションチューニング(トレーニング)とビデオ質問回答(推論)パイプラインの両方にシームレスに統合可能な、モジュール化されたフロントエンドアダプタタスクとして定式化されている。
実験により、TVSを取り入れた場合、相対利得は7.33%(トレーニング)、34.6%(推論)となることが示された。
論文 参考訳(メタデータ) (2025-08-27T14:33:32Z) - DiTVR: Zero-Shot Diffusion Transformer for Video Restoration [48.97196894658511]
DiTVRはゼロショットビデオ復元フレームワークで、拡散トランスフォーマーと軌跡を意識した注意と流れ一貫したサンプルを結合する。
我々の注意機構は、光流路に沿ってトークンを整列させ、特に時間力学に最も敏感な重要な層に重点を置いている。
フローガイドされたサンプリング装置は、低周波帯域にのみデータの一貫性を注入し、キャッシュを加速させながら高周波事前保存を行う。
論文 参考訳(メタデータ) (2025-08-11T09:54:45Z) - READ: Real-time and Efficient Asynchronous Diffusion for Audio-driven Talking Head Generation [55.58089937219475]
本稿では,最初のリアルタイム拡散変換器を用いた音声ヘッド生成フレームワークREADを提案する。
提案手法はまず,VAEを用いて高度に圧縮されたビデオ潜時空間を学習し,音声生成におけるトークン数を大幅に削減する。
また,READは,実行時間を大幅に短縮した競合する音声ヘッドビデオを生成することにより,最先端の手法よりも優れていることを示す。
論文 参考訳(メタデータ) (2025-08-05T13:57:03Z) - ScalingNoise: Scaling Inference-Time Search for Generating Infinite Videos [41.45750971432533]
ビデオ拡散モデル(VDM)は高品質のビデオの生成を容易にする。
近年,映像の質を高める「金音」の存在が報告されている。
本研究では,拡散サンプリングプロセスにおける黄金の初期雑音を識別する,プラグアンドプレイの推論時間探索手法であるScalingNoiseを提案する。
論文 参考訳(メタデータ) (2025-03-20T17:54:37Z) - Live2Diff: Live Stream Translation via Uni-directional Attention in Video Diffusion Models [64.2445487645478]
大規模言語モデルは、テキストやオーディオなどのストリーミングデータの生成において顕著な効果を示している。
本稿では,一方向の時間的注意を向けたビデオ拡散モデルを設計するための最初の試みであるLive2Diffを紹介する。
論文 参考訳(メタデータ) (2024-07-11T17:34:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。