論文の概要: Sol Video Inference Engine: Agent-Native Full-Stack Acceleration Framework for Efficient Video Generation
- arxiv url: http://arxiv.org/abs/2606.23743v2
- Date: Wed, 24 Jun 2026 14:59:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-25 17:05:30.02944
- Title: Sol Video Inference Engine: Agent-Native Full-Stack Acceleration Framework for Efficient Video Generation
- Title(参考訳): Sol Video Inference Engine: 効率的なビデオ生成のためのエージェントネイティブフルスタック高速化フレームワーク
- Abstract要約: 本稿では,ビデオ拡散モデルのためのエージェント型,ネイティブな,トレーニング不要なアクセラレーションフレームワークであるSol Video Inferenceを紹介する。
キャッシュ、スパースアテンション、トークンプルーニング、量子化、カーネル融合の5つの広く適用可能なテクニックをエージェントアクセラレーションスタックにまとめる。
ほぼロスレスなVBench品質を維持しながら、エンドツーエンドのアクセラレーションを2倍以上に向上させる。
- 参考スコア(独自算出の注目度): 50.504140880964336
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Modern video diffusion models achieve higher generation quality through scaling, but this also increases inference cost. Although many acceleration methods have been proposed, a central challenge is that the most effective acceleration strategy is highly instance-specific: a recipe that works well for one combination of model, hardware, and inference configuration often does not transfer to another. Different models vary in architecture, numerical sensitivity, and attention concentration patterns. Inference settings differ in spatial and temporal resolution and video duration, while hardware platforms differ in memory hierarchy, supported numerical formats, and kernel throughput. These factors create a large tuning space, making manual performance engineering costly. We present Sol Video Inference Engine, an agentic, native, training-free acceleration framework for video diffusion models. It organizes five broadly applicable techniques, cache, sparse attention, token pruning, quantization, and kernel fusion, into an agentic acceleration stack for instance-specific optimization. For a concrete deployment target defined by a model, hardware platform, and serving configuration, parallel skill agents optimize the implementation of each technique, an agent integrator composes them into a global acceleration stack, and a human validator provides feedback on generation quality. We instantiate this workflow on three video models with different sizes and architectures: 64B Cosmos3-Super, 22B LTX-2.3, and 2B SANA-Video. With little human effort, the full stack achieves more than 2x end-to-end acceleration while maintaining near-lossless VBench quality, demonstrating the effectiveness of the agent framework for video diffusion acceleration.
- Abstract(参考訳): 現代のビデオ拡散モデルは、スケーリングによってより高い世代品質を達成するが、推論コストも増大する。
多くのアクセラレーション手法が提案されているが、最も効果的なアクセラレーション戦略は、非常にインスタンス固有のものである。
異なるモデルでは、アーキテクチャ、数値感度、注意集中パターンが異なる。
推論設定は空間的・時間的解像度とビデオ時間で異なり、ハードウェアプラットフォームはメモリ階層、数値形式、カーネルスループットで異なる。
これらの要因は大きなチューニングスペースを作り、手動のパフォーマンスエンジニアリングをコストがかかる。
本稿では,ビデオ拡散モデルのためのエージェント型,ネイティブな,トレーニング不要なアクセラレーションフレームワークであるSol Video Inference Engineを提案する。
キャッシュ、スパースアテンション、トークンプルーニング、量子化、カーネル融合の5つの広く適用可能なテクニックを、インスタンス固有の最適化のためにエージェントアクセラレーションスタックにまとめる。
モデル、ハードウェアプラットフォーム、サービス構成で定義された具体的なデプロイメントターゲットに対して、並列スキルエージェントはそれぞれのテクニックの実装を最適化し、エージェントインテグレータはそれらをグローバルなアクセラレーションスタックに構成し、ヒューマンバリデータは生成品質に関するフィードバックを提供する。
我々は,64B Cosmos3-Super,22B LTX-2.3,2B SANA-Videoの3種類のビデオモデルでこのワークフローをインスタンス化する。
人間の努力がほとんどなく、フルスタックはVBench品質を保ちながら2倍以上のエンド・ツー・エンド・アクセラレーションを実現し、ビデオ拡散アクセラレーションのためのエージェント・フレームワークの有効性を示す。
関連論文リスト
- VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding [82.55178663351913]
VideoChat3は、完全にオープンで効率的で汎用的なビデオ中心のMLLMである。
Inflated 3D Vision Transformer (ID-ViT)とAdaptive Frame Resolution for Streaming Video Perceptionを導入する。
有効性のために、我々は3つの多様な高品質なトレーニングデータセットをキュレートするデータ合成パイプラインを開発した。
論文 参考訳(メタデータ) (2026-07-16T12:47:59Z) - LoomVideo: Unifying Multimodal Inputs into Video Generation and Editing [28.426681930851604]
ビデオ生成と編集の両面において,高効率な5Bパラメータ統一アーキテクチャであるLoomVideoを提案する。
このエレガントな設計は、クリーンソースビデオラテントをノイズターゲットラテントにスケーリングおよび直接付加することにより、トークン結合の必要性を排除している。
我々のコンパクトな5Bモデルは、包括的なベンチマークで最先端または高い競争性能を達成する。
論文 参考訳(メタデータ) (2026-06-04T11:35:26Z) - RainFusion2.0: Temporal-Spatial Awareness and Hardware-Efficient Block-wise Sparse Attention [10.041502708600865]
RainFusion2.0は、ビデオおよび画像生成モデルを加速するための、オンライン適応性、ハードウェア効率、低オーバーヘッドのスパースアテンションメカニズムである。
ビデオ品質を損なうことなく、エンドツーエンドの1.51.8xのスピードアップを達成できる。
論文 参考訳(メタデータ) (2025-12-30T08:55:20Z) - Less is Enough: Training-Free Video Diffusion Acceleration via Runtime-Adaptive Caching [57.7533917467934]
EasyCacheは、ビデオ拡散モデルのためのトレーニング不要のアクセラレーションフレームワークである。
我々は,OpenSora,Wan2.1,HunyuanVideoなどの大規模ビデオ生成モデルについて包括的な研究を行っている。
提案手法は,従来のベースラインと比較して推定時間を最大2.1-3.3$times$に短縮する。
論文 参考訳(メタデータ) (2025-07-03T17:59:54Z) - MambaMia: A State-Space-Model-Based Compression for Efficient Video Understanding in Large Multimodal Models [33.89483627891117]
大規模なマルチモーダルモデルに反映する前に、複数のビデオフレームの特徴を圧縮する効率的なフレームワークを提案する。
われわれのフレームワークは、リソースを意識した効率を重視し、現実世界のデプロイに実用的である。
論文 参考訳(メタデータ) (2025-06-16T14:49:49Z) - Astraea: A Token-wise Acceleration Framework for Video Diffusion Transformers [29.130090574300635]
ビデオ拡散変換器(vDiTs)は、テキストからビデオへの生成において大きな進歩を遂げているが、その計算要求は、実用的な展開において大きな課題となっている。
Astraeaは,vDiTをベースとしたビデオ生成の最適に近い構成を,パフォーマンス目標下で検索するフレームワークである。
論文 参考訳(メタデータ) (2025-06-05T14:41:38Z) - QuantCache: Adaptive Importance-Guided Quantization with Hierarchical Latent and Layer Caching for Video Generation [84.91431271257437]
Diffusion Transformers (DiTs) はビデオ生成において支配的なアーキテクチャとして登場した。
DiTには、計算コストやメモリコストの増大など、大きな欠点がある。
我々は,新しいトレーニングフリー推論アクセラレーションフレームワークQuantCacheを提案する。
論文 参考訳(メタデータ) (2025-03-09T10:31:51Z) - Adaptive Caching for Faster Video Generation with Diffusion Transformers [52.73348147077075]
拡散変換器(DiT)はより大きなモデルと重い注意機構に依存しており、推論速度が遅くなる。
本稿では,Adaptive Caching(AdaCache)と呼ばれる,ビデオDiTの高速化のためのトレーニング不要手法を提案する。
また,AdaCache内で動画情報を利用するMoReg方式を導入し,動作内容に基づいて計算割り当てを制御する。
論文 参考訳(メタデータ) (2024-11-04T18:59:44Z) - Fast and Memory-Efficient Video Diffusion Using Streamlined Inference [41.505829393818274]
現在のビデオ拡散モデルは、計算要求と高いピークメモリ使用量を示す。
本稿では,映像拡散モデルの時間的・空間的特性を利用したストリーム線形推論を提案する。
我々のアプローチはピークメモリと計算オーバーヘッドを大幅に削減し、単一のコンシューマGPU上で高品質なビデオを生成することができる。
論文 参考訳(メタデータ) (2024-11-02T07:52:18Z) - Hierarchical Patch Diffusion Models for High-Resolution Video Generation [50.42746357450949]
我々は,階層的な方法で,コンテキスト情報を低スケールから高スケールのパッチに伝播する深層文脈融合を開発する。
また,ネットワーク容量の増大と,粗い画像の細部への演算を行う適応計算を提案する。
得られたモデルは、クラス条件のビデオ生成において66.32の最先端FVDスコアと87.68のインセプションスコアを新たに設定する。
論文 参考訳(メタデータ) (2024-06-12T01:12:53Z) - A Simple Recipe for Contrastively Pre-training Video-First Encoders Beyond 16 Frames [57.758863967770594]
我々は,大規模な画像テキストモデルを浅部時間融合によりビデオに転送する共通パラダイムを構築した。
1)標準ビデオデータセットにおけるビデオ言語アライメントの低下による空間能力の低下と,(2)処理可能なフレーム数のボトルネックとなるメモリ消費の増大である。
論文 参考訳(メタデータ) (2023-12-12T16:10:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。