論文の概要: SlotMemory: Object-Centric KV Memory for Streaming Long-Video Generation
- arxiv url: http://arxiv.org/abs/2605.31033v1
- Date: Fri, 29 May 2026 09:04:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-01 20:56:50.493324
- Title: SlotMemory: Object-Centric KV Memory for Streaming Long-Video Generation
- Title(参考訳): SlotMemory:長いビデオ生成をストリーミングするためのオブジェクト中心のKVメモリ
- Abstract要約: SlotMemoryは、ビデオ拡散をストリーミングするためのオブジェクト中心のKey-Valueメモリメカニズムである。
我々のアプローチでは、イベントが発生したときのメモリ抽象化を、トランスフォーマーのキー-値多様体を分解することで、"何"が表現されているかに変換する。
- 参考スコア(独自算出の注目度): 30.157534925157844
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Streaming video generation models typically rely on temporal-centric memory, which organizes historical context as raw frames, chunk segments, or unclustered tokens. This organization frequently leads to identity drift and semantic inconsistency when entities exit the frame or during interactive prompt transitions. To address these limitations, we propose SlotMemory, an object-centric Key-Value memory mechanism for streaming video diffusion. Our approach shifts the memory abstraction from "when" an event occurred to "what" is being represented by decomposing the transformer's key-value manifold into discrete, reusable semantic slots. By utilizing these slots as routing addresses to index and store high-fidelity key-value tokens, we enable entity-level persistence and prompt-aware retrieval across long horizons. Evaluated on 60-second interactive narratives using the Wan2.1-T2V-1.3B backbone, SlotMemory achieves a state-of-the-art quality score of 81.61 and a 22.8 percent relative improvement in dynamic consistency over the strongest existing streaming baseline. Our results demonstrate that structured semantic representation, rather than raw temporal capacity, is the essential primitive for persistent long-form video synthesis. Our codes and checkpoints are available at https://tj12323.github.io/SlotMemory/.
- Abstract(参考訳): ストリーミングビデオ生成モデルは一般的に時間中心のメモリに依存しており、歴史的コンテキストを生のフレーム、チャンクセグメント、あるいはクラスタ化されていないトークンとして整理する。
この組織は、エンティティがフレームを離れたり、対話的なプロンプト遷移中に、アイデンティティのドリフトやセマンティックな不整合につながることが多い。
これらの制限に対処するために,ビデオ拡散をストリーミングするためのオブジェクト中心キーバリューメモリ機構であるSlotMemoryを提案する。
我々のアプローチは、イベントが発生したときのメモリ抽象化を、トランスフォーマーのキー値多様体を離散的で再利用可能なセマンティックスロットに分解することで、"何"が表現されているかに移行します。
これらのスロットをインデックスのルーティングアドレスとして利用し、高忠実度キーバリュートークンを格納することにより、エンティティレベルの永続性と、長い水平線をまたいだプロンプト・アウェア検索を可能にする。
Wan2.1-T2V-1.3Bのバックボーンを用いて60秒間のインタラクティブな物語を評価すると、SlotMemoryは最先端の品質スコア81.61と、既存の最強のストリーミングベースラインよりも22.8%向上している。
本研究は, 時間的容量ではなく, 構造的意味表現が, 持続的長大ビデオ合成に必須のプリミティブであることを実証した。
私たちのコードとチェックポイントはhttps://tj12323.github.io/SlotMemory/で公開されています。
関連論文リスト
- ObjectStream: Latent Objects as Memory Anchors for Streaming Video Understanding [50.17161313335395]
ObjectStreamはトレーニング不要のフレームワークで、ストリーミングビデオ理解のためのメモリアンカーとして潜在オブジェクトを扱う。
それは3つの補完的な証拠を保存している: 永続的なオブジェクト履歴、過渡的なオブジェクト変更、そして最近の視覚的コンテキストである。
オンラインストリーミングとオフラインの長時間ビデオベンチマークの実験は、有効性と効率の両方を示している。
論文 参考訳(メタデータ) (2026-07-30T14:47:00Z) - FadeMem: Distance-Aware Memory Consolidation for Autoregressive Video Diffusion [59.207505503284715]
FadeMemは、歴史的なKVブロックを固定キャッシュ予算の下で時間階層に整理する。
新しい歴史はきめ細かいエントリとして挿入され、古い隣のエントリは徐々にマージされる。
実験では、既存の有界キャッシュ戦略よりも、被験者の一貫性、背景安定性、時間的コヒーレンスが改善された。
論文 参考訳(メタデータ) (2026-06-09T10:22:18Z) - Advancing Narrative Long Video Generation via Training-Free Identity-Aware Memory [79.01059178883817]
IAMFlowはトレーニング不要のID対応メモリフレームワークで、永続的なエンティティのIDを明示的にモデル化し追跡する。
VLMは、レンダリングフレームから属性を非同期に検証し、洗練し、暗黙の類似性ベースのマッチングの代わりに明示的なエンティティ追跡を可能にする。
NarraStream-Benchは,6次元にまたがる324のマルチプロンプトスクリプトを備えた,ナラストリームビデオ生成のためのベンチマークである。
論文 参考訳(メタデータ) (2026-05-18T17:54:34Z) - SWIFT: Prompt-Adaptive Memory for Efficient Interactive Long Video Generation [31.105007908298003]
ストリーミング長ビデオ生成は、連続的なセマンティックスイッチングにおいて中心的な課題に直面している。
現在のアプローチは、プロンプトバウンダリや固定メモリ予算でのキャッシュ再構築に依存している。
マルチプロンプト長ビデオ生成のためのトレーニングフリーフレームワークであるSWIFTを提案する。
論文 参考訳(メタデータ) (2026-05-10T09:37:56Z) - Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding [55.7992006853979]
SAVEMemは、セマンティックな認識をメモリ生成にもたらすフレームワークで、クエリ毎に検索スコープを適応させる。
SAVEMemは、メモリ生成にセマンティックな認識をもたらし、クエリ毎に検索範囲を適応させる、トレーニングフリーのデュアルステージフレームワークである。
論文 参考訳(メタデータ) (2026-05-08T15:40:40Z) - Going Down Memory Lane: Scaling Tokens for Video Stream Understanding with Dynamic KV-Cache Memory [50.30283773196725]
既存のアプローチは、時間とともにフレームレベルの詳細を蓄積するためにキーバリューキャッシングに依存していますが、フレーム毎に限られた数のトークンを使用します。
より詳細な時間的理解と推論を可能にするためにトークン予算のスケーリングを提案する。
論文 参考訳(メタデータ) (2026-02-20T18:59:50Z) - VideoMemory: Toward Consistent Video Generation via Memory Integration [28.605816634949814]
VideoMemoryは、Dynamic Memory Bankを通じてナラティブプランニングとビジュアルジェネレーションを統合する。
ダイナミックメモリバンクは、文字、小道具、背景の明示的な視覚的および意味的な記述を格納する。
この検索更新機構は、遠距離ショット間のエンティティの一貫性のある表現を可能にし、コヒーレントなロングフォーム生成をサポートする。
論文 参考訳(メタデータ) (2026-01-07T07:10:32Z) - Fast SAM2 with Text-Driven Token Pruning [52.8350457627401]
Segment Anything Model 2 (SAM2) では、視覚計算モデルがプロンプト駆動のビデオオブジェクトセグメンテーションにおいて大幅に進歩している。
SAM2パイプラインは、イメージエンコーダが生成するすべての視覚トークンを、ターゲットオブジェクトとの関係にかかわらず、下流の時間的推論モジュールを通じて伝達する。
本稿では,時間的伝播に先立ってトークン密度を選択的に低減し,推論効率を向上させるためのテキスト誘導型トークンプルーニングフレームワークを提案する。
論文 参考訳(メタデータ) (2025-12-24T18:59:05Z) - Temporally Consistent Referring Video Object Segmentation with Hybrid Memory [98.80249255577304]
本稿では,参照セグメンテーションとともに時間的一貫性を明示的にモデル化する,エンドツーエンドなR-VOSパラダイムを提案する。
自動生成された高品質の参照マスクを有するフレームの特徴は、残りのフレームをセグメント化するために伝播される。
大規模な実験により,本手法は時間的整合性を著しく向上させることが示された。
論文 参考訳(メタデータ) (2024-03-28T13:32:49Z) - Dual Temporal Memory Network for Efficient Video Object Segmentation [42.05305410986511]
ビデオオブジェクト(VOS)の基本的な課題の1つは、時間情報を最大限活用してパフォーマンスを向上する方法である。
本稿では,現在のフレームに先行する短・長期のビデオシーケンス情報を時間記憶として格納するエンド・ツー・エンド・ネットワークを提案する。
我々のネットワークは、短期記憶サブネットワークと長期記憶サブネットワークを含む2つの時間的サブネットワークで構成されている。
論文 参考訳(メタデータ) (2020-03-13T06:07:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。