FuguReport

NaviCache: Test-Time Self-Calibration Caching for Video Generation

著者 Zheqi Lv, Zhibo Zhu, Jinke Wang, Qi Tian, Shengyu Zhang, Zhengyu Chen, Chengxi Zang, Zhou Zhao, Fei Wu
所属 Cornell University / Zhejiang University / Tencent / MeiTuan LongCat
カテゴリ Method / Model Calibration / Self-calibration for video diffusion models, Application / Video Generation / Enhancing video diffusion model performance, Theory / Error Analysis / Theoretical error bounds and skip mechanisms
ライセンス CC BY 4.0

Abstractの概要

NaviCacheは、動画拡散モデルを高速化するためのプラグアンドプレイ対応、テスト時自己キャリブレーション・キャッシング手法です。本論文では、入力特徴量の変化と出力応答の関係を、慣性ナビゲーションシステムにヒントを得た状態空間トラッキング問題として再構築し、初期アライメント段階、双対状態推定、および不確実性を考慮した更新決定を用いて計算スキップを制御します。この設計は、オフラインキャリブレーションに基づく手法におけるデータ依存性や分布シフトの問題を回避しつつ、0次キャリブレーションフリーのヒューリスティクスを改善することを目的としています。また、定常的な推定誤差の上界が0次のヒューリスティクスよりも低くなることを主張する理論的分析を提供し、Wan 2.1、HunyuanVideo、およびOpen-Sora 1.2で本手法を評価しています。

新規性

本論文の主な新規性は、動画拡散の特徴の進化を、オフラインで適合されたマッピングや瞬間的な0次近似を用いるのではなく、慣性ナビゲーション方式の状態推定問題として扱う点にあります。スキップの決定を行うため、初期アライメント、再帰的二重状態推定、および不確実性によってトリガーされる測定更新を備えたテスト時自己キャリブレーション機構を導入しています。

成果

Wan 2.1、HunyuanVideo、Open-Sora 1.2全体において、NaviCacheは従来の高速化ベースラインと比較して強力な効率と品質のトレードオフを実証しています。例えば、HunyuanVideoにおいてNaviCache-midは2.17倍の高速化達成時にPSNR 32.65、SSIM 0.9256、LPIPS 0.0571を記録し、同等のレイテンシ制約下にあるEasyCacheをわずかに上回りました。本手法はオフラインでのキャリブレーションを必要とせず、スキップ判定のオーバーヘッドも0.0109秒と無視できるほど小さいことが報告されています。

論文の注目点

  1. NaviCacheは、0次のスキップ予測を、出力と入力の変化率に関するオンライン状態空間推定に置き換え、初期アライメントフェーズと再帰的な不確実性の追跡を組み込んでいる。
  2. プロセスノイズおよび観測ノイズが正であるという仮定の下で、NaviCacheがEasyCacheなどの0次ヒューリスティクスよりも定常状態における推定誤差分散を低く抑えられることを理論的に証明している。
  3. 3つの動画拡散モデルファミリーを用いた実験により、NaviCacheがオフラインのキャリブレーションコストを回避しつつ、同等の高速化レベルにおいて従来のキャリブレーションフリー手法よりも視覚的品質を良好に保持することが確認されている。

参考リンク

このページはGPT-5、Claude Opus 4、Gemini 3、Gemini 3.1 Flash Image 及びその上位バージョンなどの生成AIを用いて作成されています。内容の保証は一切できません。