論文の概要: Ring Forcing: Towards Precise Long-Term Memory for Autoregressive Video Diffusion
- arxiv url: http://arxiv.org/abs/2608.26794v1
- Date: Thu, 27 Aug 2026 08:25:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 16:30:58.312856
- Title: Ring Forcing: Towards Precise Long-Term Memory for Autoregressive Video Diffusion
- Title(参考訳): リング強制: 自己回帰的ビデオ拡散のための高精度な長期記憶を目指して
- Abstract要約: Ring Forcingは、長期記憶を堅牢に構築し、正確に利用するように設計された自動回帰ビデオ拡散フレームワークである。
我々のリング構造トレーニング戦略は、厳密な歴史的遵守と生成的多様性の間のトレードオフを効果的に調整し、遠い歴史からの検索を強制する。
本稿では,事前学習をフル活用しながら,フレキシブルでスケーラブルなメモリアダプティブを実現するための疎結合なRoPE機構を提案する。
- 参考スコア(独自算出の注目度): 30.13108213701987
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Scaling video generation to long durations reveals a critical bottleneck: current models lack robust long-term memory. This deficiency can be studied along two critical aspects: object permanence, the ability to precisely reproduce the appearance of objects upon re-entry; and memory capacity, the ability to process ultra-long context and use information from distant history. Robust long-term memory requires both: object permanence without sufficient context handling limits the temporal scope, while long context length without permanence fails to maintain identity. To address this, we present Ring Forcing, an autoregressive video diffusion framework designed to robustly construct and precisely utilize long-term memory. Our ring-structured training strategy enforces retrieval from distant history, effectively reconciling the trade-off between strict historical adherence and generative diversity. To expand memory capacity, we introduce a compression and timestep composition strategy. Under fixed sequence length constraints, this method extends the effective historical span to minutes-long durations and achieves a comprehensive receptive field over the entire history. Furthermore, we present a sparse RoPE mechanism to enable flexible, scalable memory adaptation while fully exploiting pre-trained priors. Extensive experiments demonstrate that Ring Forcing achieves superior minutes-long coherence and object permanence, significantly outperforming state-of-the-art methods.
- Abstract(参考訳): 現在のモデルでは、堅牢な長期記憶が欠如している。
この欠損は、オブジェクトの永続性、再突入時にオブジェクトの外観を正確に再現する能力、メモリ容量、超長期のコンテキストを処理し、遠い歴史からの情報を使用する能力の2つの重要な側面に沿って研究することができる。
十分なコンテキストハンドリングのないオブジェクト永続性は時間的スコープを制限するが、永続性のない長いコンテキスト長はアイデンティティを維持するのに失敗する。
そこで本稿では,長期記憶の堅牢な構築と精度向上を目的とした自動回帰ビデオ拡散フレームワークであるRing Forcingを紹介する。
我々のリング構造トレーニング戦略は、厳密な歴史的遵守と生成的多様性の間のトレードオフを効果的に調整し、遠い歴史からの検索を強制する。
メモリ容量を拡大するために、圧縮と時間ステップの構成戦略を導入する。
固定列長制約の下では, 有効期間を数分まで延長し, 歴史全体に対する包括的受容場を実現する。
さらに,事前学習を十分に活用しつつ,フレキシブルでスケーラブルなメモリアダプティブを実現するための疎結合なRoPE機構を提案する。
広範囲な実験により、リングフォーシングはより優れた数分のコヒーレンスとオブジェクト永続性を達成し、最先端の手法を著しく上回ることを示した。
関連論文リスト
- MemoryWAM: Efficient World Action Modeling with Persistent Memory [80.90899269062128]
本稿では,効率的な永続メモリを持つ世界アクションモデルであるMemoryWAMを紹介する。
調整された注意機構は、詳細な短期コンテキストと圧縮された長期コンテキストの両方の検索を可能にする。
MemoryWAMは、シミュレーションと実世界の両方において、強力な視覚言語アクション(VLA)とWAMベースラインを上回っている。
論文 参考訳(メタデータ) (2026-06-18T17:59:51Z) - REAL: A Reasoning-Enhanced Graph Framework for Long-Term Memory Management of LLMs [17.526686616588794]
大きな言語モデル(LLM)は、長い時間をかけてユーザーと対話することがますます期待されている。
LLMは過去のすべてのインタラクションを保持することができず、履歴情報の保存、更新、検索には長期記憶管理が不可欠である。
REALは長期会話記憶を時間的かつ信頼性に配慮したプロパティグラフとして構成する。
論文 参考訳(メタデータ) (2026-06-09T10:53:10Z) - FadeMem: Distance-Aware Memory Consolidation for Autoregressive Video Diffusion [59.207505503284715]
FadeMemは、歴史的なKVブロックを固定キャッシュ予算の下で時間階層に整理する。
新しい歴史はきめ細かいエントリとして挿入され、古い隣のエントリは徐々にマージされる。
実験では、既存の有界キャッシュ戦略よりも、被験者の一貫性、背景安定性、時間的コヒーレンスが改善された。
論文 参考訳(メタデータ) (2026-06-09T10:22:18Z) - DecMem: Towards Minute-Long Consistent World Generation with Decoupled Memory [44.72702042082084]
我々は3Dメモリを超えて、フレームレベルの粗い暗黙的モデリングを行い、一貫した世界生成のためのきめ細かい、学習可能な、スケーラブルなメモリを提案する。
正確で効率的な長期記憶を確保することで、DecMemは高品質な外挿による極小レベルの制御可能な長期ビデオ生成を可能にする。
論文 参考訳(メタデータ) (2026-05-29T14:17:59Z) - Relax Forcing: Relaxed KV-Memory for Consistent Long Video Generation [73.84423888025171]
オートレグレッシブ(AR)ビデオ拡散は,近年,長大なビデオ生成において有望なパラダイムとして浮上している。
時間的劣化が進行しているため, 生成から微小スケールの地平線への延長は依然として困難であることを示す。
本稿では,AR拡散のための時間記憶機構であるRelax Forcingを紹介する。
論文 参考訳(メタデータ) (2026-03-22T18:59:24Z) - Context Forcing: Consistent Autoregressive Video Generation with Long Context [74.08361435348873]
長文教師を介して長文学生を訓練するフレームワークであるtextbfContext Forcingを提案する。
教師が全世代の歴史に気付くことを保証することで、教師のミスマッチを解消する。
提案手法は,最先端手法の2倍から10倍の20秒を超える有効コンテキスト長を実現する。
論文 参考訳(メタデータ) (2026-02-05T18:58:01Z) - Mixture of Contexts for Long Video Generation [72.96361488755986]
我々は長文ビデオ生成を内部情報検索タスクとして再放送する。
本稿では,学習可能なスパークアテンション・ルーティング・モジュールであるMixture of Contexts (MoC) を提案する。
データをスケールしてルーティングを徐々に分散させていくと、そのモデルは計算を適切な履歴に割り当て、アイデンティティ、アクション、シーンを数分のコンテンツで保存する。
論文 参考訳(メタデータ) (2025-08-28T17:57:55Z) - Long-Context State-Space Video World Models [66.28743632951218]
本稿では、状態空間モデル(SSM)を活用して、計算効率を損なうことなく時間記憶を拡張する新しいアーキテクチャを提案する。
我々の設計の中心はブロックワイズSSMスキャン方式であり、時間記憶の拡張のために空間整合性を戦略的にトレードオフする。
メモリ迷路とMinecraftのデータセットの実験は、我々のアプローチが長距離メモリ保存のベースラインを超えたことを示している。
論文 参考訳(メタデータ) (2025-05-26T16:12:41Z) - MeMSVD: Long-Range Temporal Structure Capturing Using Incremental SVD [27.472705540825316]
本論文は、長時間の時間窓上での人間の行動を認識すること(最大数分)を目標とする長期映像理解について述べる。
本稿では,Singular Value Decomposition を用いて取得したメモリの低ランク近似に基づくアテンションベースのスキームの代替を提案する。
提案手法には2つの利点がある: (a) 複雑度を1桁以上削減し, (b) メモリベース計算の効率的な実装が可能である。
論文 参考訳(メタデータ) (2024-06-11T12:03:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。