論文の概要: Bridging Event Streams and DiT: Event-Guided Video Frame Interpolation
- arxiv url: http://arxiv.org/abs/2608.10479v2
- Date: Wed, 12 Aug 2026 03:07:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-13 14:28:20.582576
- Title: Bridging Event Streams and DiT: Event-Guided Video Frame Interpolation
- Title(参考訳): Bridging Event Streams and DiT: Event-Guided Video Frame Interpolation
- Abstract要約: イベントカメラは、時間的ギャップを埋めるのに適した高解像度モーションキューを提供する。
本稿では,イベント由来のキューを事前学習した画像間拡散モデルに組み込むアダプタベースのフレームワークを提案する。
- 参考スコア(独自算出の注目度): 75.95737622994548
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Latent diffusion models have recently advanced video frame interpolation by synthesizing intermediate frames between input images. However, handling large temporal gaps and complex motion remains challenging, often resulting in motion blur, structural distortions, and temporal inconsistencies. Event cameras provide high-temporal-resolution motion cues that are well suited for bridging these gaps and improving interpolation quality. To exploit this advantage without training an event-assisted model from scratch, we propose an adapter-based framework that incorporates event-derived cues into a pre-trained image-to-video diffusion model with minimal architectural changes. Specifically, our method leverages Image Warped Events (IWEs) and bidirectional sparse optical flow to provide spatially and temporally aligned guidance during generation. By injecting these event-guided structural and motion cues into the diffusion process, our approach reduces interpolation artifacts and improves both reconstruction fidelity and temporal coherence. Experimental results on real and synthetic benchmarks show that our method consistently outperforms existing state-of-the-art approaches. The project page is at https://joseph-lin-tech.github.io/BridgeEventDiT-VFI/.
- Abstract(参考訳): 遅延拡散モデルは、入力画像間で中間フレームを合成することにより、近年、高度なビデオフレーム補間を行っている。
しかし、大きな時間的ギャップと複雑な動きを扱うことは依然として困難であり、しばしば動きのぼやけ、構造的歪み、時間的矛盾をもたらす。
イベントカメラは、これらのギャップを埋め、補間品質を向上させるのに適した高時間分解能モーションキューを提供する。
イベント支援モデルをゼロからトレーニングすることなく、この利点を活用するために、イベント由来のキューを最小限のアーキテクチャ変更で事前学習した画像からビデオへの拡散モデルに組み込むアダプタベースのフレームワークを提案する。
具体的には、画像ワープイベント(IWE)と双方向スパース光流を利用して、生成中の空間的および時間的に整列したガイダンスを提供する。
これらの事象誘導型構造的および運動的手がかりを拡散過程に注入することにより、補間アーティファクトを低減し、再構成忠実度と時間的コヒーレンスの両方を改善する。
実および合成ベンチマークによる実験結果から,本手法は既存の最先端手法よりも一貫して優れていることがわかった。
プロジェクトページはhttps://joseph-lin-tech.github.io/BridgeEventDiT-VFI/にある。
関連論文リスト
- EGVD: Event-Guided Video Diffusion Model for Physically Realistic Large-Motion Frame Interpolation [16.22243283808375]
Event-Guided Video Diffusion Model (EGVD) は、事前訓練された安定したビデオ拡散モデルの強力な先行性を活用する新しいフレームワークである。
提案手法は,RGBフレームとイベント信号とを効果的に統合して拡散過程を導出するマルチモーダル運動条件生成器(MMCG)を特徴とする。
実データとシミュレーションデータの両方の実験により、EGVDは大きな動きを扱う既存の手法よりも大幅に優れていることが示された。
論文 参考訳(メタデータ) (2025-03-26T06:33:32Z) - Motion-aware Latent Diffusion Models for Video Frame Interpolation [51.78737270917301]
隣接するフレーム間の動き推定は、動きのあいまいさを避ける上で重要な役割を担っている。
我々は、新しい拡散フレームワーク、動き認識潜在拡散モデル(MADiff)を提案する。
提案手法は,既存手法を著しく上回る最先端性能を実現する。
論文 参考訳(メタデータ) (2024-04-21T05:09:56Z) - FRESCO: Spatial-Temporal Correspondence for Zero-Shot Video Translation [85.29772293776395]
フレーム間対応とフレーム間対応のFRESCOを導入し,より堅牢な時空間制約を確立する。
この拡張により、フレーム間で意味的に類似したコンテンツのより一貫性のある変換が可能になる。
提案手法では,入力ビデオと高空間時間整合性を実現するために,特徴の明示的な更新を行う。
論文 参考訳(メタデータ) (2024-03-19T17:59:18Z) - Motion-Aware Video Frame Interpolation [49.49668436390514]
我々は、連続するフレームから中間光の流れを直接推定する動き対応ビデオフレーム補間(MA-VFI)ネットワークを導入する。
受容場が異なる入力フレームからグローバルな意味関係と空間的詳細を抽出するだけでなく、必要な計算コストと複雑さを効果的に削減する。
論文 参考訳(メタデータ) (2024-02-05T11:00:14Z) - Joint Video Multi-Frame Interpolation and Deblurring under Unknown
Exposure Time [101.91824315554682]
本研究では,より現実的で挑戦的なタスク – 複数フレームのジョイントビデオと,未知の露光時間下での劣化 – を野心的に目標とする。
我々はまず,入力されたぼやけたフレームから露出認識表現を構築するために,教師付きコントラスト学習の変種を採用する。
次に、プログレッシブ露光適応型畳み込みと動き改善による露出と動きの表現に基づいて、映像再構成ネットワークを構築した。
論文 参考訳(メタデータ) (2023-03-27T09:43:42Z) - Unifying Motion Deblurring and Frame Interpolation with Events [11.173687810873433]
フレームベースのカメラのスローシャッター速度と長時間露光は、しばしばフレーム間の情報の視覚的曖昧さと損失を引き起こし、キャプチャされたビデオの全体的な品質を劣化させる。
イベントの極めて低レイテンシを利用して、動きのぼやけを緩和し、中間フレーム予測を容易にする、ぼやけたビデオ強調のためのイベントベースモーションデブロアリングとフレーム拡張の統一フレームワークを提案する。
ぼやけたフレーム,潜入画像,イベントストリーム間の相互制約を探索することにより,実世界のぼやけたビデオやイベントによるネットワークトレーニングを可能にする,自己教師付き学習フレームワークを提案する。
論文 参考訳(メタデータ) (2022-03-23T03:43:12Z) - TimeLens: Event-based Video Frame Interpolation [54.28139783383213]
本稿では,合成法とフロー法の両方の利点を生かした,等価寄与法であるTime Lensを紹介する。
最先端のフレームベースおよびイベントベース手法よりもPSNRが最大5.21dB向上したことを示す。
論文 参考訳(メタデータ) (2021-06-14T10:33:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。