論文の概要: MosaiChunk: Compositing Spatio-Temporal Memory for Autoregressive Video Generation
- arxiv url: http://arxiv.org/abs/2610.02153v1
- Date: Thu, 01 Oct 2026 17:51:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:24.355676
- Title: MosaiChunk: Compositing Spatio-Temporal Memory for Autoregressive Video Generation
- Title(参考訳): MosaiChunk: 自動回帰ビデオ生成のための時空間メモリの構成
- Abstract要約: MosaiChunkは、選択された歴史的キー値エントリのモザイクを構成する時間記憶機構である。
RememBenchは、プロンプト駆動のテキスト・トゥ・ビデオ(T2V)とカメラ駆動のイメージ・トゥ・ビデオ(I2V)の分割によるロングホライズンリバイス(long-horizon revisits)のベンチマークである。
- 参考スコア(独自算出の注目度): 51.06065746897343
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Long-horizon autoregressive video generation is limited by a finite context window. When an object or scene falls out of context, its fine-grained visual details may be lost and difficult to recover upon reappearance. To retain access to such visual details, we introduce MosaiChunk, a spatio-temporal memory mechanism that composes a mosaic of selected historical key-value (KV) entries across space and time. Our approach is motivated by the observation that a frozen video generator can directly consume such non-contiguous historical KV and recover the corresponding visual content. We therefore keep the generator fixed and learn only a lightweight router that determines which historical sections to include in the mosaic under a fixed active-memory budget. We further introduce RememBench, a benchmark of long-horizon revisits with prompt-driven text-to-video (T2V) and camera-driven image-to-video (I2V) splits. Our experiments show that MosaiChunk consistently improves revisit consistency over both sliding-window inference and whole-chunk retrieval under matched memory budgets, across both T2V and I2V settings.
- Abstract(参考訳): 長軸自己回帰ビデオ生成は、有限コンテキストウィンドウによって制限される。
オブジェクトやシーンがコンテキストから外れたとき、そのきめ細かい視覚的詳細が失われ、再び現れると回復が困難になる可能性がある。
このような視覚的細部へのアクセスを維持するため、空間と時間にわたって選択された歴史的キー値(KV)エントリのモザイクを構成する時空間記憶機構であるMosaiChunkを導入する。
本手法は, 冷凍ビデオ生成装置が非連続的な歴史的KVを直接消費し, 対応する視覚的コンテンツを復元できるという観察に動機づけられる。
そこで,我々は発電機の固定を保ち,モザイクにどの歴史的区分を組み込むかを決定する軽量ルータのみを,アクティブメモリの固定予算の下で学習する。
さらに、RememBenchは、プロンプト駆動のテキスト・ツー・ビデオ(T2V)とカメラ駆動の画像・ツー・ビデオ(I2V)の分割によるロングホライズンリビジョンのベンチマークである。
実験の結果,MosaiChunk はT2V と I2V の両方の設定において,スライディングウインドウ推論と全チャンク検索の整合性を常に改善していることがわかった。
関連論文リスト
- Memory-V2V: Augmenting Video-to-Video Diffusion Models with Memory [63.32726513381937]
現在のビデオエディタは、シーケンシャルな編集の相互一貫性を維持するのに苦労している。
Memory-V2Vは、既存のビデオ間モデルを明示的なメモリで拡張するフレームワークである。
メモリ-V2Vは、計算オーバーヘッドを最小限に抑えながら、はるかに相反するビデオを生成する。
論文 参考訳(メタデータ) (2026-01-22T19:59:17Z) - Memorize-and-Generate: Towards Long-Term Consistency in Real-Time Video Generation [33.32047364623734]
Memorize-and-Generate(MAG)は、メモリ圧縮とフレーム生成を別々のタスクに分離するフレームワークである。
我々は、記憶モデルを訓練して、履歴情報をコンパクトなKVキャッシュに圧縮し、この圧縮された表現を用いて、後続のフレームを合成する別個のジェネレータモデルを訓練する。
実験により、MAGは標準的なビデオ生成ベンチマーク上での競争性能を維持しながら、優れた歴史的一貫性を実現することが示された。
論文 参考訳(メタデータ) (2025-12-21T14:02:53Z) - WorldMM: Dynamic Multimodal Memory Agent for Long Video Reasoning [66.24870234484668]
我々は,複数の相補的記憶から構築・取得する,新しいマルチモーダルメモリエージェント WorldMM を紹介する。
WorldMMは5つの長いビデオ質問回答ベンチマークで既存のベースラインを大幅に上回っている。
論文 参考訳(メタデータ) (2025-12-02T05:14:52Z) - Mixture of Contexts for Long Video Generation [72.96361488755986]
我々は長文ビデオ生成を内部情報検索タスクとして再放送する。
本稿では,学習可能なスパークアテンション・ルーティング・モジュールであるMixture of Contexts (MoC) を提案する。
データをスケールしてルーティングを徐々に分散させていくと、そのモデルは計算を適切な履歴に割り当て、アイデンティティ、アクション、シーンを数分のコンテンツで保存する。
論文 参考訳(メタデータ) (2025-08-28T17:57:55Z) - VMem: Consistent Interactive Video Scene Generation with Surfel-Indexed View Memory [55.73900731190389]
Surfel-Indexed View Memory (VMem) は、過去のビューを記憶するメモリモジュールであり、それらが観測した3次元表面要素(サーフェル)に基づいて幾何学的にインデックス化することで、過去のビューを記憶する。
VMemは、新しいビューを生成する際に、最も関連性の高い過去のビューを効率的に検索することを可能にする。
論文 参考訳(メタデータ) (2025-06-23T17:59:56Z) - Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval [33.15952106579093]
歴史的文脈をメモリとして利用して映像生成を行うコンテキスト・アズ・メモリを提案する。
歴史的文脈を全て組み込むという膨大な計算オーバーヘッドを考慮すると、メモリ検索モジュールを提案する。
実験により, コンテキスト・アズ・メモリは, SOTAと比較して, 対話型長ビデオ生成において優れたメモリ能力を実現することが示された。
論文 参考訳(メタデータ) (2025-06-03T17:59:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。