論文の概要: Memorizon: Training World Models Beyond Their Context Window
- arxiv url: http://arxiv.org/abs/2610.00544v1
- Date: Wed, 30 Sep 2026 18:26:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.69579
- Title: Memorizon: Training World Models Beyond Their Context Window
- Title(参考訳): Memorizon: コンテキストウィンドウを越えて世界モデルをトレーニングする
- Abstract要約: ストリーミングの世界モデルは、繰り返し訪れるたびに一貫して場所をレンダリングするべきです。
ロングスパンは監督のために必要だが、2つの訪問はすべてのフレームを含まないフォワードパスを共有することができるため、注意は要らない。
Memorizonは、この結合を断ち切る: 長いスパンは監督のために必要だが、注意は要らない。
- 参考スコア(独自算出の注目度): 6.659521315834027
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Streaming world models should render a place consistently across repeated visits. Directly supervising such revisits requires training samples that capture both visits, often spanning minutes. Yet dense attention over the full span incurs quadratic costs, making long-span supervision expensive. Memorizon breaks this coupling: long spans are needed for supervision, but not for attention, since the two visits can share a forward pass without including every intervening frame. A training sample covers a span of any length but is scored only on its last $k$ chunks. Instead of tokenizing the history before them, each scored chunk retrieves its own top-$K$ latents by camera co-visibility, and the union of these requests forms a shared bank. The bank is bounded by $kK$, so the sequence stays bounded however long the span; at the shortest span the recipe is exactly conventional training. Adding the bank raises the cost of a step once; beyond that, a longer span costs little, and going from 100 to 400 s adds 12% to the step time. Against a sliding-window baseline, retrieval raises revisit consistency on every split, and a span long enough to reach the first visit of each return adds a further 24% to 30%, at some cost in image quality; beyond that span, more length no longer helps. Filling the bank from another episode lowers revisit correlation by 83%, so the model uses what it retrieves. Project page: https://tingtingliao.github.io/memorizon
- Abstract(参考訳): ストリーミングの世界モデルは、繰り返し訪れるたびに一貫して場所をレンダリングするべきです。
このようなリビジットを直接監督するには、両方の訪問をキャプチャするトレーニングサンプルが必要である。
しかし、フルスパンに対する集中的な関心は2次的なコストをもたらし、長期にわたる監督を高価にしている。
Memorizonは、この結合を断ち切る: 長いスパンは監督のために必要だが、注意は要らない。
トレーニングサンプルは任意の長さのスパンをカバーしているが、最後の$k$チャンクでのみスコアされる。
それらの前に履歴をトークン化する代わりに、各スコアされたチャンクは、カメラのコ可視性によって、自身のトップ$K$ラテントを取得し、これらの要求の合体は共有銀行を形成する。
銀行のバウンドは$kK$なので、シーケンスのバウンドはスパンほど長く保たれます。
銀行を追加することで、ステップのコストが1度上昇する。それ以上に、長いスパンのコストは小さく、100~400秒にするとステップタイムに12%上昇する。
スライディングウィンドウベースラインに対して、検索はスプリット毎のリビジット一貫性を高め、各リターンの最初の訪問に到達するのに十分なスパンは、画像品質のある程度のコストでさらに24%から30%増加します。
別のエピソードから銀行を埋めることでリビジット相関が83%低下する。
プロジェクトページ:https://tingliao.github.io/memorizon
関連論文リスト
- FlexiWorld: Learning and Planning via Flexible Action Chunks Across Multiple Time Scales [15.338055488719938]
潜在世界モデルは、複数の原始的なステップにまたがるアクションチャンクを使用して、ゴール指向の計画のための将来の状態を予測する。
我々は,JEPAベースのワールドモデルであるFlexiWorldを紹介した。
論文 参考訳(メタデータ) (2026-09-28T13:26:49Z) - ReWorld: An Interactive World Model with Long-Horizon Memory [43.24590497177396]
ReWorldは、トレーニング中にコントロールとメモリを分離し、推論時にそれらをバウンドする。
メカニカルスケールのデータエンジンは、8つのソース(非現実的なフライスルー、ゲームローミング、現実世界の映像)を1つの物理アクションスケールに配置する。
1つのバックボーンは高忠実度マルチステップモードとリアルタイムインタラクティブモードの両方を提供する。
論文 参考訳(メタデータ) (2026-08-24T17:59:05Z) - Alaya-EVOKE: From Linear-Scaling Supervision to Endless World [34.25175575182297]
インタラクティブな世界モデルは、永続メモリ、応答性相互作用、長期水平生成をサポートしなければならない。
Alaya-EVOKE(Evoke)は、永続的な世界状態の外部化と、長距離対話型世代のための教師の再設計によって、両方の制限に対処する。
Evokeは、VBench-LongとVBench-2.0で競争力を維持しながら、WBenchで最先端のパフォーマンスを達成した。
論文 参考訳(メタデータ) (2026-08-13T17:57:00Z) - Surprise Forcing: What to Remember, When to Skip in Long Video Generation [65.0022589149937]
自己回帰拡散をストリーミングすることで、ミニスケールのビデオ合成が実用的になるが、そのコンテキスト境界と固定化スケジュールはリソースを均一に割り当てる。
我々は、両方の制限をオンラインリソース割り当て問題として扱う、トレーニング不要のフレームワークであるSurprise Forcingを紹介した。
VBench、VBench-Long、VBench-2.0の実験では、提案されたアロケーション戦略は、リアルタイムストリーミングスループットを維持しながら、長時間の一貫性と視覚的品質を改善する。
論文 参考訳(メタデータ) (2026-07-20T18:37:58Z) - Concurrent Image Understanding and Generation: Self-Correcting Coupled Markov Jump Processes [70.61868608402723]
我々は$textbfSelf-Correcting Coupled Markov Jump Processes (SC-CMJP)を紹介する。
SC-CMJPと組み合わせて、共同マルチモーダルジェネレーションのための新しいトレーニングフリーシングルパスサンプリングであるtextttCO_texttt2textttJump$を紹介する。
トレーニングと評価のために,我々は3つの大規模ジョイントマルチモーダル生成コーパスを作成し,リリースする。
論文 参考訳(メタデータ) (2026-07-14T18:39:29Z) - Mixture of Contexts for Long Video Generation [72.96361488755986]
我々は長文ビデオ生成を内部情報検索タスクとして再放送する。
本稿では,学習可能なスパークアテンション・ルーティング・モジュールであるMixture of Contexts (MoC) を提案する。
データをスケールしてルーティングを徐々に分散させていくと、そのモデルは計算を適切な履歴に割り当て、アイデンティティ、アクション、シーンを数分のコンテンツで保存する。
論文 参考訳(メタデータ) (2025-08-28T17:57:55Z) - On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention [53.22963042513293]
大規模言語モデル(LLM)は、自己アテンションを通じてグローバルトークンの依存関係をキャプチャするが、長い入力に対する計算とメモリコストに直面する。
まず,二状態線形注意(Dual-state linear attention, A)を提案する。これは2つの隠れ状態を保持する設計であり,その1つは,リニアアテンションアーキテクチャの典型的な短距離バイアスを緩和し,リニアアテンションを追尾するものである。
本稿では,DSLA層を段階的に置き換えるオンライン適応蒸留フレームワークであるDSLA-Serveを紹介する。
論文 参考訳(メタデータ) (2025-06-11T01:25:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。