論文の概要: LongE2V: Long-Horizon Event-based Video Reconstruction, Prediction, and Frame Interpolation with Video Diffusion Models
- arxiv url: http://arxiv.org/abs/2607.08770v1
- Date: Thu, 09 Jul 2026 17:59:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.631925
- Title: LongE2V: Long-Horizon Event-based Video Reconstruction, Prediction, and Frame Interpolation with Video Diffusion Models
- Title(参考訳): LongE2V:ビデオ拡散モデルを用いた長距離イベントに基づく映像再構成・予測・フレーム補間
- Authors: Cheng-De Fan, Chun-Wei Tuan Mu, Chen-Wei Chang, Chin-Yang Lin, Kun-Ru Wu, Yu-Chee Tseng, Yu-Lun Liu,
- Abstract要約: LongE2Vは、事前訓練されたビデオ拡散を利用してイベントベースのビデオ再構成を処理する新しいアプローチである。
攻撃的ビデオモデルを微調整することにより、高いデータ効率と優れた知覚品質を軽減できる。
実世界のベンチマークの実験では、LongE2Vは3つのタスクすべてで最先端のメソッドよりも優れています。
- 参考スコア(独自算出の注目度): 14.33633321388011
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recovering high-quality video from sparse event streams is a challenging task. Regression methods often blur textures, while existing generative models struggle with long-term stability. We propose LongE2V, a novel approach that leverages pre-trained video diffusion priors to jointly handle event-based video reconstruction, prediction, and frame interpolation. By fine-tuning a foundational video model, our approach achieves high data efficiency and superior perceptual quality. We introduce Autoregressive Unrolling and Adaptive Context Switching to mitigate temporal drift in extremely long sequences. We also propose Reencoding Alignment with Cross Residual Correction to ensure precise bidirectional consistency during frame interpolation. Furthermore, Event Voxel Density Augmentation ensures robustness across varying sensor resolutions. Extensive experiments on real-world benchmarks demonstrate that LongE2V outperforms state-of-the-art methods across all three tasks, exhibiting exceptional temporal coherence and zero-shot generalization. Project page: https://cdfan0627.github.io/LongE2V-page/
- Abstract(参考訳): スパースなイベントストリームから高品質なビデオを取得することは、難しい課題です。
回帰法はしばしばテクスチャを曖昧にし、既存の生成モデルは長期的な安定性に苦しむ。
本稿では,イベントベースの映像再構成,予測,フレーム補間を協調的に処理するために,事前学習した映像拡散を利用した新しいアプローチであるLongE2Vを提案する。
基礎的なビデオモデルを微調整することにより,高いデータ効率と知覚品質を実現する。
時間的ドリフトを極端に長いシーケンスで緩和するために、自動回帰アンロールと適応コンテキストスイッチを導入する。
また,フレーム補間における双方向の正確な整合性を確保するために,クロス残差補正を用いた符号化アライメントを提案する。
さらに、Event Voxel Density Augmentationは、さまざまなセンサー解像度にわたって堅牢性を保証する。
実世界のベンチマークにおける大規模な実験により、LongE2Vは3つのタスクすべてで最先端の手法より優れており、例外的な時間的コヒーレンスとゼロショットの一般化が示される。
プロジェクトページ: https://cdfan0627.github.io/LongE2V-page/
関連論文リスト
- Linear Scaling Video VLMs for Long Video Understanding [26.67642601439313]
ビデオエンコーダは依然として自己アテンションに依存しており、計算とレイテンシはフレーム数で2倍に増加する。
本稿では,事前学習した長ビデオMを線形時間ビデオプリフィルに適応させる推論時手法であるStateKVを紹介する。
論文 参考訳(メタデータ) (2026-05-29T17:59:02Z) - FlowLong: Inference-time Long Video Generation via Manifold-constrained Tweedie Matching [68.01498128172214]
本稿では,アーキテクチャに依存しない,追加のトレーニングを必要としない長大なビデオ生成のための,斬新でシンプルな推論時間アプローチを提案する。
提案手法では,隣接するウィンドウからのクリーンサンプルをemphTweedieマッチングでブレンドし,テキストbfmanifoldの制約と重複領域間の時間的一貫性を強制する。
本手法は, 時間的一貫性と視覚的品質において, トレーニング不要, 自己回帰ベースラインを両立させながら, ネイティブウィンドウ長よりも数倍長大のビデオを生成する。
論文 参考訳(メタデータ) (2026-05-20T08:55:37Z) - ViBe: Ultra-High-Resolution Video Synthesis Born from Pure Images [30.646542711556787]
トランスフォーマーに基づくビデオ拡散モデルは、空間的および時間的トークンに対する3次元の注意に依存している。
我々は,高解像度映像を合成するために,ネイティブスケールで事前学習したビデオ拡散変換器をアップグレードする純粋な画像適応フレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-24T15:27:22Z) - UniE2F: A Unified Diffusion Framework for Event-to-Frame Reconstruction with Video Foundation Models [67.24086328473437]
イベントカメラは絶対強度よりも相対強度の変化を記録できる。
結果として得られたデータストリームは、空間情報と静的テクスチャの詳細が著しく失われることに悩まされる。
本稿では、事前学習したビデオ拡散モデルを用いて、スパースイベントデータから高忠実度ビデオフレームを再構成することで、この制限に対処する。
論文 参考訳(メタデータ) (2026-02-22T14:06:49Z) - Towards Holistic Modeling for Video Frame Interpolation with Auto-regressive Diffusion Transformers [95.68243351895107]
我々はtextbfVideo textbfFrame textbfInterpolation (LDF-VFI) のための textbfLocal textbfDiffusion textbfForcing for textbfVideo textbfFrame textbfInterpolation (LDF-VFI) という包括的でビデオ中心のパラダイムを提案する。
我々のフレームワークは、ビデオシーケンス全体をモデル化し、長距離時間的コヒーレンスを確保する自動回帰拡散変換器上に構築されている。
LDF-VFIは、挑戦的なロングシーケンスベンチマークで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-01-21T12:58:52Z) - Towards Robust and Generalizable Continuous Space-Time Video Super-Resolution with Events [71.2439653098351]
連続時空ビデオスーパーSTVSRは、高解像度で高フレームのビデオを任意の時間スケールで再構成する能力への関心が高まっている。
EvEnhancerは、イベントストリームにカプセル化された高時間および高ダイナミックレンジのユニークな特性を結合する新しいアプローチである。
提案手法は,OODスケールでの一般化性を維持しつつ,合成および実世界の両方のデータセット上での最先端性能を実現する。
論文 参考訳(メタデータ) (2025-10-04T15:23:07Z) - ViBiDSampler: Enhancing Video Interpolation Using Bidirectional Diffusion Sampler [53.98558445900626]
現在の画像とビデオの拡散モデルは、単一のフレームからビデオを生成するのに強力だが、2フレーム条件付き生成に適応する必要がある。
我々は,これらのオフマンド問題に対処するために,広範囲な再ノイズや微調整を必要とせずに,新しい双方向サンプリング戦略を導入する。
提案手法では,それぞれ開始フレームと終了フレームに条件付き前方経路と後方経路の両方に沿って逐次サンプリングを行い,中間フレームの整合性を確保した。
論文 参考訳(メタデータ) (2024-10-08T03:01:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。