論文の概要: Persistent Computational State: A Session-Centric Runtime for Generative World Models
- arxiv url: http://arxiv.org/abs/2607.21686v1
- Date: Thu, 23 Jul 2026 14:39:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 20:58:56.958519
- Title: Persistent Computational State: A Session-Centric Runtime for Generative World Models
- Title(参考訳): Persistent Computational State: 生成世界モデルのためのセッション中心ランタイム
- Abstract要約: ジェネレーティブワールドモデルはシミュレーターとしてますます推進されている。
最近のベンチマークでは、現在のビデオワールドモデルは、この使用を失敗している。
この属性は不完全であり、重要なモデルのクラスは単に間違っている。
- 参考スコア(独自算出の注目度): 4.4664120040328035
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Generative world models are increasingly driven as simulators: a planner forks a state, rolls out futures, backtracks, and returns to a visited viewpoint. Recent benchmarks establish that current video world models fail this usage, and attribute it to the model, prescribing new architectures and training objectives. We show this attribution is incomplete, and for an important class of models simply wrong. Snapshotting the state the runtime already holds -- an observation plus RNG state, a memory bank, or a windowed KV context, by architecture -- and restoring it after a genuine excursion reproduces the never-left continuation byte-identically on all three; corrupting only the RNG degrades it. The capability was never missing: request-centric serving discarded it, inheriting from language-model serving the assumption that runtime state is recomputable -- but world-model state carries a non-recomputable kernel. We define Persistent Computational State (PCS), the minimal non-recomputable state that must survive across requests, show it can be discovered by measurement, and build a session-centric runtime over it. Checkpoint and restore cost 0.012 ms against a 1.85 s generation step; resident sessions become host- rather than device-bounded (measured to 1,024); and world memory must be evicted by relevance to the return, not recency -- the inverse of LLM practice.
- Abstract(参考訳): 計画立案者が状態をフォークし、未来をロールアウトし、バックトラックをロールアウトし、訪問する視点に戻る。
最近のベンチマークでは、現在のビデオワールドモデルは、この使用を失敗させ、新しいアーキテクチャを規定し、トレーニング目標をモデルに当てはめている。
この属性は不完全であり、重要なモデルのクラスは単に間違っている。
ランタイムがすでに保持している状態 -- 監視プラスRNG状態、メモリバンク、あるいはウィンドウ化されたKVコンテキスト -- をアーキテクチャによってスナップショニングし、真のエクストラクションが3つすべてで無期限の継続をバイト単位に再現した後にそれを復元する。
要求中心のサービスによって破棄され、ランタイム状態が再計算可能であるという前提で言語モデルから継承される。
永続計算状態(PCS)は、リクエスト間で存続しなければならない最小限の非再計算可能な状態であり、測定によって検出できることを示し、その上にセッション中心のランタイムを構築する。
チェックポイントとリストアのコストは 1.85 s 生成ステップに対して 0.012 ms であり、常駐セッションはデバイスバウンドではなくホストベースになり(1,024 で測定される)、ワールドメモリは、リターンの関連性によって排除されなければならない -- LLM のプラクティスの逆である。
関連論文リスト
- DeltaLog: Deferred Materialization of Recurrent States for Linear Attention Decoding [6.8533987856750045]
線形アテンションモデルでは、ペアワイズトークンの相互作用をリカレント状態更新に置き換えることで、2次プレフィックス計算と、ソフトマックスアテンションの文脈成長KVキャッシュを排除している。
既存の復号化実装は、生成されたトークン毎に完全な再帰状態を実現し、書き戻すことが多い。
本稿では,モデルセマンティクスを変更することなく,このオーバヘッドを低減する再帰状態復号方式であるDeltaLogを提案する。
論文 参考訳(メタデータ) (2026-08-16T05:04:11Z) - SC$^{2}$-WM: A Self-Correcting World Model with Closed-Loop Feedback for Vision-and-Language Navigation in Continuous Environments [54.76467884696539]
本稿では,VLN-CEにおける閉ループ決定のための内部フィードバックを導入する自己修正ワールドモデルフレームワークであるSC$2$-WMを提案する。
本手法は,行動実行前の状態レベルの計画改善を行うための,世界モデルからのフィードバックを導出する。
標準的なVLN-CEベンチマークの実験では、ナビゲーションと一般化が改善された。
論文 参考訳(メタデータ) (2026-08-01T03:17:48Z) - Apple-$π$: Benchmarking Thinking with Video Towards Law-Grounded Physical Intelligence [54.58886283991723]
Apple-PIは、物理法則でビデオモデルの評価を明示的に固定する最初のベンチマークである。
Apple-PIは3つのコンポーネントから構成される。
ベンチマーク11モデルは、現在のビデオモデルが信頼性の高い地上のワールドシミュレータから遠く離れていることを示している。
論文 参考訳(メタデータ) (2026-07-17T18:00:05Z) - PatchWorld: Gradient-Free Optimization of Executable World Models [69.05094454437402]
我々は、オフラインのトラジェクトリを実行可能なPythonの世界モデルに変換する、勾配のないフレームワークであるPatchWorldを紹介します。
7つのAgentGym環境の中で、PatchWorld-Simpleはコードベースの計画スコアが最も高い。
人間の特定残差バイアスは, 表面観察精度を向上するが, 判定性は低下する。
論文 参考訳(メタデータ) (2026-05-29T06:11:14Z) - Phasor Memory Networks: Stable Backpropagation Through Time for Scalable Explicit Memory [3.0459410574367314]
ニューラルチューリングマシンのような明示的なメモリアーキテクチャは、バックプロパゲーション・オブ・タイムにおいて破滅的な不安定さのため、言語モデリングには理論上は魅力的だが実用上は魅力的である。
この研究は、textitPhasor Memory Network (PMNet) によって、この不安定な状態を破り、textitUnitary Phasor Dynamics と textitHierarchical Learnable Anchors によって、メモリのボラティリティを構造的に解決する新しいアーキテクチャである。
我々のアブレーション研究と勾配解析により、明示的メモリの歴史的故障は構造的アライメントの問題であり、PMNetが効果的に克服し、拡張性のあるシーケンスの理論的基礎となることが確認された。
論文 参考訳(メタデータ) (2026-05-13T11:28:06Z) - DexWorldModel: Causal Latent World Modeling towards Automated Learning of Embodied Tasks [54.32016216994156]
本稿では,DINOv3特徴を生成対象として用い,視覚ノイズから相互作用意味を乱す因果潜在世界モデル(CLWM)を提案する。
メモリスケーリングを克服するため、CLWMはDual-State Test-Time Training (TTT)メモリを備えている。
EmbodiChainは、トレーニング中に物理基底軌道の無限の流れを注入することによって効率法を確立するオンラインフレームワークである。
論文 参考訳(メタデータ) (2026-04-13T03:19:36Z) - The UNDO Flip-Flop: A Controlled Probe for Reversible Semantic State Management in State Space Model [0.0]
状態空間モデル(SSM)は、星のないシーケンシャルタスクと有界階層構造の両方をモデル化する理論的能力を持っていることが示されている。
このギャップを埋めるためにUNDO Flip-Flopタスクを導入します。
我々は,この枠組みの下で一層および二層マンバ-2を評価する。
論文 参考訳(メタデータ) (2026-04-07T14:23:40Z) - Debugging code world models [1.0152838128195467]
コードワールドモデル(Code World Models、CWM)は、プログラムの実行をシミュレートするために訓練された言語モデルである。
CWMは局所的セマンティック実行と長期状態追跡という2つの相補的な視点から研究する。
論文 参考訳(メタデータ) (2026-02-07T19:32:15Z) - Person Re-ID in 2025: Supervised, Self-Supervised, and Language-Aligned. What Works? [0.0]
人物再同定(ReID)はコンピュータビジョンにおいて依然として難しい問題である。
本研究は、様々なトレーニングパラダイムをレビューし、ドメイン間アプリケーションにおける最先端のReIDモデルの堅牢性を評価する。
論文 参考訳(メタデータ) (2026-01-28T13:35:31Z) - EmbeddingRWKV: State-Centric Retrieval with Reusable States [12.535698360263988]
State-Centric Retrievalは、埋め込みモデルと再ランカを接続するブリッジとして"states"を利用する統一的な検索パラダイムである。
テストの結果,システム全体の効率を大幅に向上させながら,高品質な検索と再ランク付けを実現していることがわかった。
論文 参考訳(メタデータ) (2026-01-10T03:29:43Z) - Bench2Drive-R: Turning Real World Data into Reactive Closed-Loop Autonomous Driving Benchmark by Generative Model [63.336123527432136]
我々は,リアクティブ閉ループ評価を可能にする生成フレームワークであるBench2Drive-Rを紹介する。
既存の自動運転用ビデオ生成モデルとは異なり、提案された設計はインタラクティブなシミュレーションに適したものである。
我々は、Bench2Drive-Rの生成品質を既存の生成モデルと比較し、最先端の性能を達成する。
論文 参考訳(メタデータ) (2024-12-11T06:35:18Z) - OpenPI-C: A Better Benchmark and Stronger Baseline for Open-Vocabulary
State Tracking [55.62705574507595]
OpenPIは、オープン語彙状態トラッキング用に注釈付けされた唯一のデータセットである。
手順レベル,ステップレベル,状態変化レベルの3つの問題を分類する。
評価指標として,クラスタベースの計量法を提案する。
論文 参考訳(メタデータ) (2023-06-01T16:48:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。