論文の概要: VideoMemory: Toward Consistent Video Generation via Memory Integration
- arxiv url: http://arxiv.org/abs/2601.03655v1
- Date: Wed, 07 Jan 2026 07:10:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-01-09 02:15:23.364081
- Title: VideoMemory: Toward Consistent Video Generation via Memory Integration
- Title(参考訳): ビデオメモリ: メモリ統合による一貫性のあるビデオ生成を目指して
- Abstract要約: VideoMemoryは、Dynamic Memory Bankを通じてナラティブプランニングとビジュアルジェネレーションを統合する。
ダイナミックメモリバンクは、文字、小道具、背景の明示的な視覚的および意味的な記述を格納する。
この検索更新機構は、遠距離ショット間のエンティティの一貫性のある表現を可能にし、コヒーレントなロングフォーム生成をサポートする。
- 参考スコア(独自算出の注目度): 28.605816634949814
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Maintaining consistent characters, props, and environments across multiple shots is a central challenge in narrative video generation. Existing models can produce high-quality short clips but often fail to preserve entity identity and appearance when scenes change or when entities reappear after long temporal gaps. We present VideoMemory, an entity-centric framework that integrates narrative planning with visual generation through a Dynamic Memory Bank. Given a structured script, a multi-agent system decomposes the narrative into shots, retrieves entity representations from memory, and synthesizes keyframes and videos conditioned on these retrieved states. The Dynamic Memory Bank stores explicit visual and semantic descriptors for characters, props, and backgrounds, and is updated after each shot to reflect story-driven changes while preserving identity. This retrieval-update mechanism enables consistent portrayal of entities across distant shots and supports coherent long-form generation. To evaluate this setting, we construct a 54-case multi-shot consistency benchmark covering character-, prop-, and background-persistent scenarios. Extensive experiments show that VideoMemory achieves strong entity-level coherence and high perceptual quality across diverse narrative sequences.
- Abstract(参考訳): 複数のショットにまたがって一貫したキャラクター、小道具、環境を維持することは、物語ビデオ生成における中心的な課題である。
既存のモデルは高品質なショートクリップを生成することができるが、シーンが変わるときや長い時間的ギャップの後、エンティティが再び現れるとき、エンティティのアイデンティティや外観を保存できないことが多い。
本稿では,動的メモリバンクを通じて物語計画と視覚生成を統合する,エンティティ中心のフレームワークであるVideoMemoryを紹介する。
構造化されたスクリプトが与えられた場合、マルチエージェントシステムは物語をショットに分解し、メモリからエンティティ表現を検索し、これらの検索された状態に条件付けられたキーフレームとビデオを合成する。
ダイナミックメモリバンクは、文字、小道具、背景の明示的な視覚的および意味的な記述を格納し、各ショットの後に更新され、アイデンティティを保持しながらストーリー駆動的な変更を反映する。
この検索更新機構は、遠距離ショット間のエンティティの一貫性のある表現を可能にし、コヒーレントなロングフォーム生成をサポートする。
この設定を評価するために,キャラクタ,プロップ,バックグラウンドパーシスタントシナリオをカバーする54ケースのマルチショット一貫性ベンチマークを構築した。
広範囲にわたる実験により,ビデオメモリは多様な物語列にまたがる強い実体レベルのコヒーレンスと高い知覚的品質を実現することが示された。
関連論文リスト
- PermaVid: Consistent Video Generation Across Edits via Disentangled Context Memory [80.58558679163197]
PermaVidは、空間コンテキストを意味的な外観と幾何学的構造に分解するマルチモーダルなコンテキストメモリ上に構築された新しいフレームワークである。
本手法は,編集後の長期的セマンティクスと構造的整合性を強く維持し,最先端の手法よりも優れていた。
論文 参考訳(メタデータ) (2026-06-15T09:20:32Z) - Closed-Loop Triplet Synergistic Generation for Long-Form Video [61.88597038104749]
CoSyTriGenは、クローズドループビジュアル-テキスト-メモリのシナジープロセスとしてマルチショット長ビデオ生成を定式化するエージェントフレームワークである。
この三重項に対して視覚言語モデルに基づくアナライザが原因となり、2つの経路に沿ってプロンプトとメモリの両方を更新する。
StoryBenchベンチマークの実験では、代表法よりもクロスショット一貫性、即効性、撮影連続性を大幅に改善した。
論文 参考訳(メタデータ) (2026-06-15T03:56:43Z) - Memento: Reconstruct to Remember for Consistent Long Video Generation [33.84564823908538]
ロングフォームビデオ生成は、様々なショット、視点、動き、シーン遷移において、連続した被写体を維持する必要がある。
メトンは、被写体保存を明示的なアイデンティティ基盤問題として扱う、被写体再構成誘導フレームワークである。
Metonは、長期的な主題整合性、クロスショットコヒーレンス、視覚的品質において最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-06-12T17:37:13Z) - ViMax: Agentic Video Generation [55.546794487716646]
ロングフォームビデオ生成には、体系的な物語計画と視覚的一貫性が必要である。
我々のフレームワークは、グローバルなストーリーコヒーレンスのための検索強化世代を備えた階層的な物語エンジンを採用している。
VLM誘導エージェントは、物語のコヒーレンスと視覚的忠実さの両方を継続的に監視し、洗練する。
論文 参考訳(メタデータ) (2026-06-02T12:55:41Z) - EM-Vid: Training-Free Entity-Centric Memory for Efficient and Consistent Multi-Shot Video Generation [18.052867824594347]
マルチショットビデオ生成には、ショット間で連続的なエンティティの出現を維持する必要がある。
最近の自己回帰手法は、以前生成されたフレームをメモリとして再利用する。
我々は、潜伏パッチのエンティティインデックスバンクという形でエンティティ中心のメモリを提案する。
論文 参考訳(メタデータ) (2026-05-22T13:20:29Z) - Advancing Narrative Long Video Generation via Training-Free Identity-Aware Memory [79.01059178883817]
IAMFlowはトレーニング不要のID対応メモリフレームワークで、永続的なエンティティのIDを明示的にモデル化し追跡する。
VLMは、レンダリングフレームから属性を非同期に検証し、洗練し、暗黙の類似性ベースのマッチングの代わりに明示的なエンティティ追跡を可能にする。
NarraStream-Benchは,6次元にまたがる324のマルチプロンプトスクリプトを備えた,ナラストリームビデオ生成のためのベンチマークである。
論文 参考訳(メタデータ) (2026-05-18T17:54:34Z) - Soap2Soap: Long Cinematic Video Remaking via Multi-Agent Collaboration [61.98029663481308]
Soap2SoapはDualBridgeメカニズムを通じて長期の視覚的一貫性を強制するマルチエージェントフレームワークである。
クローズドループ検証エージェントは、識別、安定性、アライメントを監査し、選択的再生を誘導する。
論文 参考訳(メタデータ) (2026-05-17T12:38:21Z) - Gloria: Consistent Character Video Generation via Content Anchors [63.7455328319917]
本稿では,アンカーフレームのコンパクトな集合を通して,文字の視覚特性を表現することを提案する。
この設計は、一貫性のための安定した参照を提供するが、参照ベースのビデオ生成はコピーパッティングとマルチ参照競合の課題に直面している。
実験により,提案手法は10分を超える高品質なキャラクタビデオを生成し,既存の手法を超越して,ビュー間の表現的アイデンティティと外観整合性を実現する。
論文 参考訳(メタデータ) (2026-03-31T16:06:16Z) - CoAgent: Collaborative Planning and Consistency Agent for Coherent Video Generation [9.91271343855315]
CoAgentは、コヒーレントなビデオ生成のためのフレームワークで、プラン合成の検証パイプラインとしてプロセスを定式化している。
Storyboard Plannerは、入力を明示的な実体、空間的関係、時間的手がかりで構造化されたショットレベルのプランに分解する。
Global Context Managerは、エンティティレベルのメモリを維持して、ショット間の外観とアイデンティティの整合性を維持する。
ペーシング対応エディタは、所望の物語の流れに合わせて時間リズムと遷移を洗練する。
論文 参考訳(メタデータ) (2025-12-27T09:38:34Z) - StoryMem: Multi-shot Long Video Storytelling with Memory [32.97816766878247]
本稿では,ビデオの長めのストーリーテリングを,明示的な視覚記憶を前提とした反復的なショット合成として再構成するパラダイムであるStoryMemを提案する。
提案するフレームワークは、スムーズなショット遷移とカスタマイズされたストーリー生成アプリケーションに自然に対応している。
論文 参考訳(メタデータ) (2025-12-22T16:23:24Z) - STAGE: Storyboard-Anchored Generation for Cinematic Multi-shot Narrative [55.05324155854762]
本稿では,STAGEに基づく映像生成タスクを再構成するStoryboard-Anchored GEnerationワークフローを提案する。
そこで本研究では,スペーサーの代わりに,各ショットの先頭フレーム対からなる構造的ストーリーボードを推定するSTEP2を提案する。
ConStoryBoardの大規模データセットには、ストーリーの進行、映画的属性、人間の嗜好など、高品質な映像クリップが含まれています。
論文 参考訳(メタデータ) (2025-12-13T15:57:29Z) - FilmWeaver: Weaving Consistent Multi-Shot Videos with Cache-Guided Autoregressive Diffusion [46.67733869872552]
textbfFilmWeaverは任意の長さで一貫したマルチショットビデオを生成するように設計されたフレームワークである。
私たちの重要な洞察は、問題をショット間の一貫性とショット内のコヒーレンスに分離することです。
本手法は, 整合性と美的品質の両面において, 既存の手法を超越した手法である。
論文 参考訳(メタデータ) (2025-12-12T04:34:53Z) - AlcheMinT: Fine-grained Temporal Control for Multi-Reference Consistent Video Generation [58.844504598618094]
本稿では、被験者駆動ビデオ生成のための明示的なタイムスタンプ条件付きフレームワークAlcheMinTを提案する。
提案手法では,時間間隔の符号化を解き放つ新しい位置符号化機構を導入する。
我々は、視覚的アイデンティティとビデオキャプションの結合を強化するために、主観記述型テキストトークンを導入し、世代間あいまいさを緩和する。
論文 参考訳(メタデータ) (2025-12-11T18:59:34Z) - WorldMM: Dynamic Multimodal Memory Agent for Long Video Reasoning [66.24870234484668]
我々は,複数の相補的記憶から構築・取得する,新しいマルチモーダルメモリエージェント WorldMM を紹介する。
WorldMMは5つの長いビデオ質問回答ベンチマークで既存のベースラインを大幅に上回っている。
論文 参考訳(メタデータ) (2025-12-02T05:14:52Z) - SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding [6.980340270823506]
SceneRAGは,映像を物語に一貫性のあるシーンに分割するフレームワークである。
各シーンについて、このフレームワークは視覚とテキストの両方のモダリティから情報を融合し、エンティティ関係を抽出する。
LongerVideosベンチマークの実験では、134時間以上の多様なコンテンツがあり、SceneRAGが以前のベースラインを大幅に上回っていることを確認した。
論文 参考訳(メタデータ) (2025-06-09T10:00:54Z) - VideoGen-of-Thought: Step-by-step generating multi-shot video with minimal manual intervention [76.3175166538482]
VideoGen-of-Thought(VGoT)は、単一の文から複数ショットのビデオ合成を自動化するステップバイステップのフレームワークである。
VGoTは、ナラティブな断片化、視覚的不整合、トランジションアーティファクトの3つの課題に対処する。
トレーニング不要のパイプラインで組み合わせられたVGoTは、ショット内面の一貫性が20.4%、スタイルの一貫性が17.4%向上した。
論文 参考訳(メタデータ) (2024-12-03T08:33:50Z) - Storynizor: Consistent Story Generation via Inter-Frame Synchronized and Shuffled ID Injection [27.412361280397057]
本稿では,フレーム間キャラクタ一貫性の強いコヒーレントなストーリを生成するモデルであるStorynizorを紹介する。
Storynizorの主なイノベーションは、主要なモジュールであるID-SynchronizerとID-Injectorにある。
Storynizorのトレーニングを容易にするために、100,000の画像からなるStoryDBと呼ばれる新しいデータセットをキュレートした。
論文 参考訳(メタデータ) (2024-09-29T09:15:51Z) - TC-Bench: Benchmarking Temporal Compositionality in Text-to-Video and Image-to-Video Generation [97.96178992465511]
生成したビデオは、新しい概念の出現と、時間経過とともに現実の動画のようにそれらの関係の遷移を取り入れるべきである、と我々は主張する。
ビデオ生成モデルの時間構成性を評価するため,細部まで作り上げたテキストプロンプトのベンチマークであるTC-Benchと,それに対応する地上の真理ビデオ,ロバストな評価指標を提案する。
論文 参考訳(メタデータ) (2024-06-12T21:41:32Z) - Make-A-Story: Visual Memory Conditioned Consistent Story Generation [57.691064030235985]
本稿では,アクタと背景コンテキストを暗黙的にキャプチャするビジュアルメモリモジュールを備えた,自己回帰拡散に基づく新しいフレームワークを提案する。
本手法は,視覚的品質の高いフレーム生成において,先行技術よりも優れていた。
MUGEN, PororoSV, FlintstonesSVデータセット上でのストーリー生成実験により, この手法は, 視覚的品質の高いフレーム生成において, 先行技術よりも優れるだけでなく, キャラクタと背景との適切な対応をモデル化した。
論文 参考訳(メタデータ) (2022-11-23T21:38:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。