論文の概要: SparSTAR: Sparse Attention for SpaceTime AutoRegressive Video Synthesis
- arxiv url: http://arxiv.org/abs/2608.10519v2
- Date: Thu, 20 Aug 2026 08:19:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-21 14:00:35.22047
- Title: SparSTAR: Sparse Attention for SpaceTime AutoRegressive Video Synthesis
- Title(参考訳): SparSTAR: 時空自動回帰ビデオ合成のためのスパースアテンション
- Abstract要約: InfinityStarは、画像とクリップピラミッドのシーケンスを通じて、視覚的自己回帰生成をビデオに拡張する。
しかし、そのスケールの変化とクロスクリップのコンテキストは、遅延スケールの注意を犠牲にして、拡散や画像VARモデルから再利用されたスパースパターンを信頼できないものにしている。
本稿では,SparSTARをトレーニング不要なブロックスパースアテンション手法として導入する。
- 参考スコア(独自算出の注目度): 14.713161566145942
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: InfinityStar extends visual autoregressive generation to video through a sequence of image and clip pyramids. Its changing scale and cross-clip context, however, leave late-scale attention costly and make sparse patterns reused from diffusion or image VAR models unreliable. We introduce SparSTAR, a training-free block-sparse attention method tailored to this setting. At each expensive scale and attention head, SparSTAR scores contiguous key blocks from the current query and key activations, retains required conditioning context, and executes the selected blocks through a forward-only sparse path. We analyze cross-scale consistency within a clip, pattern persistence across clip boundaries, and quality degradation as reuse spans increasingly distant scales. Across these analyses, important key blocks shift, showing that recomputing block selection at each target scale is more reliable than reusing a transferred mask. On 720p text-to-video and image-to-video generation, SparSTAR preserves every token and refinement scale while providing about a 1.6x end-to-end speedup and maintaining VBench and paired-output reconstruction fidelity close to dense InfinityStar.
- Abstract(参考訳): InfinityStarは、画像とクリップピラミッドのシーケンスを通じて、視覚的自己回帰生成をビデオに拡張する。
しかし、そのスケールの変化とクロスクリップのコンテキストは、遅延スケールの注意を犠牲にして、拡散や画像VARモデルから再利用されたスパースパターンを信頼できないものにしている。
本稿では,SparSTARをトレーニング不要なブロックスパースアテンション手法として導入する。
各高価なスケールとアテンションヘッドにおいて、SparSTARは現在のクエリとキーアクティベーションから連続したキーブロックをスコアし、必要な条件設定コンテキストを保持し、前方のみのスパースパスを介して選択されたブロックを実行する。
我々は、クリップ内のクロススケール一貫性、クリップ境界を越えたパターン持続性、そして再利用がますます遠くのスケールにまたがるにつれて品質劣化を分析する。
これらの分析全体において重要な鍵ブロックシフトは、転送マスクを再利用するよりも、各ターゲットスケールでのブロック選択の再計算の方が信頼性が高いことを示している。
720pのテキスト・トゥ・ビデオと画像・ビデオ生成では、SparSTARはすべてのトークンと精細化のスケールを保ちながら、1.6倍のエンドツーエンドのスピードアップを提供し、VBenchと高密度のInfinityStarに近いペア出力の再構築フィリティを維持している。
関連論文リスト
- Surprise Forcing: What to Remember, When to Skip in Long Video Generation [65.0022589149937]
自己回帰拡散をストリーミングすることで、ミニスケールのビデオ合成が実用的になるが、そのコンテキスト境界と固定化スケジュールはリソースを均一に割り当てる。
我々は、両方の制限をオンラインリソース割り当て問題として扱う、トレーニング不要のフレームワークであるSurprise Forcingを紹介した。
VBench、VBench-Long、VBench-2.0の実験では、提案されたアロケーション戦略は、リアルタイムストリーミングスループットを維持しながら、長時間の一貫性と視覚的品質を改善する。
論文 参考訳(メタデータ) (2026-07-20T18:37:58Z) - HorizonRelight: Relighting Long-horizon Videos Consistently via Diffusion Transformers [12.923811352890999]
Emphtemporally conditioned latent domain translation としてのLong-Horizon relighting の検討
我々のフレームワークは、境界を越えてターゲットドメインの潜伏を伝播することにより、クロスチャンク連続性を強制する。
地中長距離ビデオの実験では、時間的一貫性が著しく向上した。
論文 参考訳(メタデータ) (2026-06-27T21:23:40Z) - ChronoLock: Protecting Videos from Unauthorized Text-to-Video Personalization [27.79968637806027]
テキスト・ツー・ビデオ(T2V)拡散モデルにより、現実的で時間的に整合したビデオの合成がますます容易になっている。
最近のパーソナライズ技術は、いくつかの参照クリップから特定の主題、スタイル、動きパターンを模倣することができる。
オンラインで共有されたビデオは、無許可のT2V微調整のために収集および使用することができる。
既存の保護的摂動は主に画像認識やテキスト・ツー・イメージのパーソナライゼーションのために設計されており、したがって静的な外観を損なうことに重点を置いている。
論文 参考訳(メタデータ) (2026-06-19T06:37:13Z) - OVGGT: O(1) Constant-Cost Streaming Visual Geometry Transformer [14.628152488797356]
OVGGTはトレーニング不要のフレームワークで、メモリと計算を、シーケンスの長さに関わらず固定予算にバウンドする。
我々は,OVGGTが一定のVRAMエンベロープ内で任意の長さのビデオを処理し,最先端の3D幾何精度を実現していることを示す。
論文 参考訳(メタデータ) (2026-03-06T06:44:17Z) - Fast Autoregressive Video Diffusion and World Models with Temporal Cache Compression and Sparse Attention [37.91838955436801]
自動回帰ビデオ拡散モデルは、ストリーミング生成、ロングフォーム合成への扉を開くこと、ビデオワールドモデル、インタラクティブなニューラルゲームエンジンを可能にする。
生成が進むにつれて、KVキャッシュが増加し、レイテンシの増加とGPUメモリのエスカレーションが生じる。
我々は、自己回帰拡散のための統合されたトレーニングなしアテンションフレームワークを提案する: TempCacheは、時間的対応によるKVキャッシュをバウンドキャッシュ成長に圧縮し、AnnCAは、高速近傍マッチングを用いてフレーム関連プロンプトを選択することで、クロスアテンションを加速し、AnnSAは各クエリを制限して自己アテンションを拡大する。
論文 参考訳(メタデータ) (2026-02-02T08:31:21Z) - Towards Holistic Modeling for Video Frame Interpolation with Auto-regressive Diffusion Transformers [95.68243351895107]
我々はtextbfVideo textbfFrame textbfInterpolation (LDF-VFI) のための textbfLocal textbfDiffusion textbfForcing for textbfVideo textbfFrame textbfInterpolation (LDF-VFI) という包括的でビデオ中心のパラダイムを提案する。
我々のフレームワークは、ビデオシーケンス全体をモデル化し、長距離時間的コヒーレンスを確保する自動回帰拡散変換器上に構築されている。
LDF-VFIは、挑戦的なロングシーケンスベンチマークで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-01-21T12:58:52Z) - Towards Smooth Video Composition [59.134911550142455]
ビデオ生成には、時間とともに動的コンテンツを伴う一貫した永続的なフレームが必要である。
本研究は, 生成的対向ネットワーク(GAN)を用いて, 任意の長さの映像を構成するための時間的関係を, 数フレームから無限までモデル化するものである。
単体画像生成のためのエイリアスフリー操作は、適切に学習された知識とともに、フレーム単位の品質を損なうことなく、スムーズなフレーム遷移をもたらすことを示す。
論文 参考訳(メタデータ) (2022-12-14T18:54:13Z) - Learning Trajectory-Aware Transformer for Video Super-Resolution [50.49396123016185]
ビデオ超解像は、高解像度(HR)フレームを低解像度(LR)フレームから復元することを目的としている。
既存のアプローチは通常、隣接する限られたフレームからビデオフレームを並べて集約する。
ビデオ超解像用トランスフォーマー(TTVSR)を提案する。
論文 参考訳(メタデータ) (2022-04-08T03:37:39Z) - VRT: A Video Restoration Transformer [126.79589717404863]
ビデオ復元(例:ビデオ超解像度)は、高品質のフレームを低品質のフレームから復元することを目的としている。
並列フレーム予測と長距離時間依存性モデリング機能を備えたビデオ再生変換器(VRT)を提案する。
論文 参考訳(メタデータ) (2022-01-28T17:54:43Z) - Few-shot Action Recognition with Permutation-invariant Attention [169.61294360056925]
ビデオブロックを符号化するC3Dエンコーダを用いて、短距離アクションパターンをキャプチャする。
我々は,空間的・時間的注意モジュールと自然主義的自己スーパービジョンを利用する。
提案手法は,HMDB51, UCF101, miniMITデータセット上での最先端技術である。
論文 参考訳(メタデータ) (2020-01-12T10:58:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。