論文の概要: JoyAI-Video-Edit: Real-Time Open-Ended Video Editing with Autoregressive Diffusion
- arxiv url: http://arxiv.org/abs/2608.03974v1
- Date: Tue, 04 Aug 2026 17:40:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 17:47:10.517254
- Title: JoyAI-Video-Edit: Real-Time Open-Ended Video Editing with Autoregressive Diffusion
- Title(参考訳): JoyAI-Video-Edit: 自動回帰拡散によるリアルタイムオープンエンディングビデオ編集
- Authors: Yicheng Xiao, Wenxun Dai, Xinran Qin, Lin Song, Maoquan Zhang, Hang Xu, Yukang Chen, Yitong Li, Guohui Zhang, Yuan Zhang, Xuying Zhang, Tommy Zhang, Jianlong Yuan, Peihao Li, Shuai Lu, Siming Fu, Chuyang Zhao, Xin Han, Jie Huang, Wenbo Li, Guoqing Ma, Wei Huang, Xiaojuan Qi, Haoyang Huang, Nan Duan,
- Abstract要約: JoyAI-Video-Editは、リアルタイムかつオープンなビデオ編集のための16Bパラメータ自動回帰拡散フレームワークである。
本手法では, チャンクワイド自己回帰適応, ソースアンコール分布マッチング蒸留, ロングホライゾン自己回帰蒸留を組み合わせた。
JoyAI-Video-Editは、既存のストリーミングエディターを大幅に上回っており、ショートビデオとロングビデオの両方で強力なオフラインシステムと競合している。
- 参考スコア(独自算出の注目度): 85.58072988629806
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Real-time video editing requires low-latency causal generation with bounded computational resources while preserving source fidelity and long-term temporal consistency. We present JoyAI-Video-Edit, a 16B-parameter autoregressive diffusion framework for real-time, open-ended video editing without access to future frames or a predefined video duration. Our method combines chunk-wise autoregressive adaptation, Source-Anchored Distribution Matching Distillation (SA-DMD), and Long-Horizon Autoregressive Distillation to reduce train--inference mismatch, preserve source fidelity during two-step generation, and mitigate accumulated temporal drift. Extensive automatic and human evaluations show that JoyAI-Video-Edit substantially outperforms existing streaming editors and remains competitive with strong offline systems on both short and long videos. The complete system achieves end-to-end 720p video editing at approximately 30 FPS on a single Nvidia B200 GPU. Code is available at https://github.com/jd-opensource/JoyAI-Video-Edit.
- Abstract(参考訳): リアルタイムビデオ編集は、情報源の忠実さと長期の時間的一貫性を保ちながら、有界な計算資源を持つ低レイテンシ因果生成を必要とする。
16Bパラメトリック自動回帰拡散フレームワークであるJoyAI-Video-Editを,将来的なフレームや予め定義されたビデオ時間にアクセスせずに,リアルタイムかつオープンなビデオ編集のために提案する。
提案手法は, チャンクワイド自己回帰適応, ソースアンコール分布マッチング蒸留(SA-DMD), ロングホライゾン自己回帰蒸留(Long-Horizon Autoregressive Distillation)を組み合わせることで, 列車ミスマッチの低減, 2段階発生時の震源の忠実さの維持, 蓄積した時間的ドリフトの軽減を図る。
大規模な自動および人間による評価の結果、JoyAI-Video-Editは既存のストリーミングエディタよりも大幅に優れており、ショートビデオとロングビデオの両方で強力なオフラインシステムと競合している。
完全なシステムは、一台のNvidia B200 GPU上で約30FPSで、エンドツーエンドの720pビデオ編集を実現する。
コードはhttps://github.com/jd-opensource/JoyAI-Video-Editで公開されている。
関連論文リスト
- StreamingEffect: Real-Time Human-Centric Video Effect Generation [63.354447770285894]
textbfStreamingEffectは、リアルタイムな人間中心のストリーミングビデオエフェクトフレームワークである。
提案手法は,H200 GPUでリアルタイムで高品質な720pビデオ編集を可能にする。
論文 参考訳(メタデータ) (2026-05-16T14:45:32Z) - Latent Inter-Frame Pruning: A Training-Free Method Bridging Traditional Video Compression and Modern Diffusion Transformers for Efficient Generation [2.639628765667673]
ビデオ生成は、リアルなビデオを生成することができるが、計算コストが高く、遅く、リアルタイムのアプリケーションを禁止している。
オートエンコーダによって符号化されたビデオ潜伏子は、時間軸に沿った冗長性を含む。
本稿では、複製されたラテントパッチをプリキュア(再計算)するためのラテントフレーム間プルーニングフレームワークを提案し、計算負担を低減し、スループットを向上する。
論文 参考訳(メタデータ) (2026-04-26T20:03:11Z) - Adaptive Caching for Faster Video Generation with Diffusion Transformers [52.73348147077075]
拡散変換器(DiT)はより大きなモデルと重い注意機構に依存しており、推論速度が遅くなる。
本稿では,Adaptive Caching(AdaCache)と呼ばれる,ビデオDiTの高速化のためのトレーニング不要手法を提案する。
また,AdaCache内で動画情報を利用するMoReg方式を導入し,動作内容に基づいて計算割り当てを制御する。
論文 参考訳(メタデータ) (2024-11-04T18:59:44Z) - Video-Infinity: Distributed Long Video Generation [73.30145218077074]
拡散モデルは近年,映像生成において顕著な成果を上げている。
提案手法は,約5分で最大2,300フレームの映像を生成し,従来の手法の100倍の速度で長大な映像を生成する。
論文 参考訳(メタデータ) (2024-06-24T01:56:12Z) - StreamingT2V: Consistent, Dynamic, and Extendable Long Video Generation from Text [58.49820807662246]
本稿では,80,240,600,1200以上のフレームをスムーズな遷移で自動回帰的に生成するStreamingT2Vを紹介する。
私たちのコードは、https://github.com/Picsart-AI-Research/StreamingT2V.comで利用可能です。
論文 参考訳(メタデータ) (2024-03-21T18:27:29Z) - LOVECon: Text-driven Training-Free Long Video Editing with ControlNet [9.762680144118061]
本稿では,このギャップを埋めることを目的として,学習自由拡散モデルに基づく長大ビデオ編集のための,シンプルで効果的なベースラインを確立する。
ControlNet上にパイプラインを構築し、テキストプロンプトに基づいて様々な画像編集タスクを抽出する。
本手法は,ユーザの要求に応じて数百フレームの動画を編集する。
論文 参考訳(メタデータ) (2023-10-15T02:39:25Z) - VidEdit: Zero-Shot and Spatially Aware Text-Driven Video Editing [18.24307442582304]
ゼロショットテキストベースのビデオ編集のための新しい方法であるVidEditを紹介する。
実験の結果,VidEditはDAVISデータセット上で最先端の手法より優れていることがわかった。
論文 参考訳(メタデータ) (2023-06-14T19:15:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。