論文の概要: DecMem: Towards Minute-Long Consistent World Generation with Decoupled Memory
- arxiv url: http://arxiv.org/abs/2605.31336v1
- Date: Fri, 29 May 2026 14:17:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-01 20:56:50.655782
- Title: DecMem: Towards Minute-Long Consistent World Generation with Decoupled Memory
- Title(参考訳): DecMem: メモリを分離した分長の連続した世界生成を目指す
- Abstract要約: 我々は3Dメモリを超えて、フレームレベルの粗い暗黙的モデリングを行い、一貫した世界生成のためのきめ細かい、学習可能な、スケーラブルなメモリを提案する。
正確で効率的な長期記憶を確保することで、DecMemは高品質な外挿による極小レベルの制御可能な長期ビデオ生成を可能にする。
- 参考スコア(独自算出の注目度): 44.72702042082084
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent advances in video generative models have promoted rapid progress in controllable world models. However, maintaining fine-grained spatio-temporal consistency under long-horizon reasoning remains a key challenge. In this work, we move beyond explicit 3D memory and coarse frame-level implicit modeling, and propose a fine-grained, learnable, and scalable memory for consistent world generation. We first identify two fundamental limitations of naïve learnable memory architectures in long-horizon extrapolation, namely computational inefficiency and attention dispersion. Through a systematic analysis of attention dispersion, we propose DecMem, a decoupled memory architecture that employs Sparse Global Memory for efficient fine-grained access to global history and Anchored Local Memory for stable and high-quality extrapolation. Extensive experiments demonstrate that DecMem significantly outperforms current state-of-the-art methods. By ensuring precise and efficient long-term memory and achieving superior extrapolation capabilities, DecMem enables minute-level controllable long video generation with high fidelity and consistency.
- Abstract(参考訳): 映像生成モデルの最近の進歩は、制御可能な世界モデルの急速な進歩を促進している。
しかし、長い水平推論の下での微細な時空間一貫性を維持することは重要な課題である。
本研究では,明快な3次元メモリと粗いフレームレベルの暗黙的モデリングを超えて,一貫した世界生成のためのきめ細かい,学習可能な,スケーラブルなメモリを提案する。
まず,長軸外挿法におけるナイーブ学習可能メモリアーキテクチャの基本的制約,すなわち計算不効率性と注意分散の2つを同定する。
注意分散の系統的解析を通じて,グローバルヒストリのきめ細かいアクセスにスパースグローバルメモリを利用する分離メモリアーキテクチャであるDecMemと,安定かつ高品質な外挿のためのAnchoredローカルメモリを提案する。
大規模な実験により、DecMemは現在の最先端の手法を大きく上回っていることが示されている。
正確で効率的な長期記憶を確保し、優れた補間機能を実現することで、DecMemは、高忠実で一貫性のある微小レベルの制御可能な長ビデオ生成を可能にする。
関連論文リスト
- MemoryWAM: Efficient World Action Modeling with Persistent Memory [80.90899269062128]
本稿では,効率的な永続メモリを持つ世界アクションモデルであるMemoryWAMを紹介する。
調整された注意機構は、詳細な短期コンテキストと圧縮された長期コンテキストの両方の検索を可能にする。
MemoryWAMは、シミュレーションと実世界の両方において、強力な視覚言語アクション(VLA)とWAMベースラインを上回っている。
論文 参考訳(メタデータ) (2026-06-18T17:59:51Z) - Memorize When Needed: Decoupled Memory Control for Spatially Consistent Long-Horizon Video Generation [22.26820693283945]
本稿では,メモリコンディショニングと生成を分離する分離されたフレームワークを提案する。
我々は、歴史的観測から正確な空間整合性を学ぶために、軽量で独立したメモリブランチを使用している。
提案手法は,視覚的品質と空間的整合性の両方の観点から,最先端の性能を実現する。
論文 参考訳(メタデータ) (2026-04-20T13:00:17Z) - From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents [78.30630000529133]
本稿ではファジィトレース理論に基づくピラミッド型マルチモーダルメモリアーキテクチャMM-Memを提案する。
MM-Memメモリは階層的に感覚バッファ、エピソードストリーム、シンボリックに構造する。
実験により、MM-Memがオフラインタスクとストリーミングタスクの両方で有効であることが確認された。
論文 参考訳(メタデータ) (2026-03-02T05:12:45Z) - RELIC: Interactive Video World Model with Long-Horizon Memory [74.81433479334821]
真のインタラクティブな世界モデルは、リアルタイムの長距離ストリーミング、一貫した空間記憶、正確なユーザ制御を必要とする。
この3つの課題を完全に解決する統合フレームワークであるRELICを紹介します。
単一の画像とテキスト記述が与えられた後、RELICは任意のシーンをリアルタイムにメモリを意識した長期探索を可能にする。
論文 参考訳(メタデータ) (2025-12-03T18:29:20Z) - WorldPack: Compressed Memory Improves Spatial Consistency in Video World Modeling [42.52474988220278]
効率的な圧縮メモリを備えたビデオワールドモデルであるWorldPackを提案する。
WorldPackは、長期世代における空間的一貫性、忠実度、品質を著しく改善する。
パフォーマンスはMinecraftのベンチマークであるLoopNavで評価されています。
論文 参考訳(メタデータ) (2025-12-02T07:06:23Z) - Video World Models with Long-term Spatial Memory [110.530715838396]
本稿では,ビデオワールドモデルの長期的整合性を高める新しい枠組みを提案する。
我々のフレームワークは、長期空間記憶から情報を保存・取得する機構を含んでいる。
評価の結果,関連するベースラインに比べて品質,一貫性,コンテキスト長が向上した。
論文 参考訳(メタデータ) (2025-06-05T17:42:34Z) - Long-Context State-Space Video World Models [66.28743632951218]
本稿では、状態空間モデル(SSM)を活用して、計算効率を損なうことなく時間記憶を拡張する新しいアーキテクチャを提案する。
我々の設計の中心はブロックワイズSSMスキャン方式であり、時間記憶の拡張のために空間整合性を戦略的にトレードオフする。
メモリ迷路とMinecraftのデータセットの実験は、我々のアプローチが長距離メモリ保存のベースラインを超えたことを示している。
論文 参考訳(メタデータ) (2025-05-26T16:12:41Z) - WORLDMEM: Long-term Consistent World Simulation with Memory [20.450750381415965]
WorldMemは、メモリフレームとステートを格納するメモリユニットで構成されるメモリバンクでシーン生成を強化するフレームワークである。
本手法は,重要な視点や時間的ギャップの下でも,事前に観察されたシーンを正確に再構成することができる。
論文 参考訳(メタデータ) (2025-04-16T17:59:30Z) - Stable Hadamard Memory: Revitalizing Memory-Augmented Agents for Reinforcement Learning [64.93848182403116]
現在のディープラーニングメモリモデルは、部分的に観察可能で長期にわたる強化学習環境で苦労している。
本稿では,強化学習エージェントのための新しい記憶モデルであるStable Hadamard Memoryを紹介する。
我々の手法は、部分的に観測可能なベンチマークに挑戦する上で、最先端のメモリベースの手法よりも大幅に優れています。
論文 参考訳(メタデータ) (2024-10-14T03:50:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。