論文の概要: Twin Rollouts: Noise-Coupled Counterfactual Branching in Interactive Video World Models
- arxiv url: http://arxiv.org/abs/2608.08982v1
- Date: Mon, 10 Aug 2026 00:57:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.026653
- Title: Twin Rollouts: Noise-Coupled Counterfactual Branching in Interactive Video World Models
- Title(参考訳): ツインロールアウト:対話型ビデオワールドモデルにおけるノイズ結合型対物分岐
- Authors: Yu Ma, Hongli Shi, Xinran Xu,
- Abstract要約: 生成したプレフィックスと将来のノイズシーケンスを共有する実例と反実例の分岐を形式化する。
t* でのシミュレーター状態のフォークは、地平線再レンダリングを発生させ、これをポストトレーニングの検証可能な報酬として用いる。
- 参考スコア(独自算出の注目度): 2.316997093749761
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Interactive video world models generate rollouts autoregressively under an action stream, yet they are trained and evaluated almost exclusively on factual prediction. We study counterfactual generation inside the rollout: given a trajectory the model has itself generated, what would have happened had the actions differed from step t* onward? We formalize noise-coupled twin rollouts --- a factual and a counterfactual branch sharing the generated prefix and the future exogenous noise sequence, diverging only in the action stream at an intervention point. Because the factual branch is self-generated, its exogenous noise is known exactly: the abduction step of Pearl's counterfactual procedure is exact by construction, sidestepping the approximate-inversion problem faced by editing-based pipelines. Noise coupling further turns the minimal-change principle into a per-sample verifiable property: we define a spatiotemporal locality metric that penalizes divergence outside the causal descendants of the intervention, computable against simulator ground truth without a learned judge. Forking the simulator state at t* yields ground-truth counterfactual re-renders, which we use as verifiable rewards for post-training. This note establishes the formal framework, metric definitions, and positioning; experiments are forthcoming.
- Abstract(参考訳): インタラクティブなビデオワールドモデルは、アクションストリーム下で自動回帰的にロールアウトを生成するが、トレーニングされ、ほぼ事実予測に基づいて評価される。
モデル自体が生成した軌道を仮定すると、ステップ t* 以降と異なるアクションがあったらどうなるのか?
ノイズ結合型ツインロールアウト -- 生成したプレフィックスと将来の外因性ノイズシーケンスを共有する実と反実の分岐 -- を形式化し、介入点におけるアクションストリームのみに分散する。
事実分岐は自己生成であるため、その外因性ノイズは正確には分かっていない: パールの逆ファクトの手順の退行ステップは、編集ベースのパイプラインが直面する近似反転問題をサイドステッピングして、建設によって正確である。
ノイズカップリングは、最小限の変動原理をサンプルごとの検証可能な性質へと変換する:我々は、学習した判断なしに、シミュレーションされた基底真理に対して計算可能な、介入の因果的子孫の外でのばらつきを罰する時空間的局所性計量を定義する。
t* でのシミュレーター状態のフォークは、後トレーニングの検証可能な報酬として使用する、接地的反実的再レンダリングをもたらす。
このノートは形式的な枠組み、メートル法の定義、位置決めを定めている。
関連論文リスト
- FlowBender: Feedback-Aware Training for Self-Correcting Conditional Flows [18.746098727212544]
FlowBenderは3D再構成のための新しい拡散流モデルである。
FlowBenderは、標準的な教師付きアライメントトレーニングよりも一貫して優れています。
微分可能な演算子に対して、FlowBenderのいくつかの変種を提案する。
論文 参考訳(メタデータ) (2026-06-18T15:56:07Z) - Drift No More? Context Equilibria in Multi-Turn LLM Interactions [58.69551510148673]
コンテキストドリフト(Contexts drift)とは、ターン間のゴール一貫性のある振る舞いからモデルが出力する出力の段階的なばらつきである。
シングルターンエラーとは異なり、ドリフトは時間的に展開し、静的な評価指標では捉えにくい。
マルチターンドリフトは、避けられない崩壊というよりも、制御可能な平衡現象として理解できることを示す。
論文 参考訳(メタデータ) (2025-10-09T04:48:49Z) - Manifold Trajectories in Next-Token Prediction: From Replicator Dynamics to Softmax Equilibrium [0.0]
大規模言語モデルでの復号化はしばしばスコアリングトークンとソフトマックスによる正規化と表現される。
我々は、このステップの自己完結した幻覚を、確率単純性上の制約付き変分原理として与える。
固定された文脈と温度に対して、次トーケン分布は単純体内部の滑らかな軌道を辿り、ソフトマックス平衡に収束することを示す。
論文 参考訳(メタデータ) (2025-08-28T20:00:22Z) - Bench2Drive-R: Turning Real World Data into Reactive Closed-Loop Autonomous Driving Benchmark by Generative Model [63.336123527432136]
我々は,リアクティブ閉ループ評価を可能にする生成フレームワークであるBench2Drive-Rを紹介する。
既存の自動運転用ビデオ生成モデルとは異なり、提案された設計はインタラクティブなシミュレーションに適したものである。
我々は、Bench2Drive-Rの生成品質を既存の生成モデルと比較し、最先端の性能を達成する。
論文 参考訳(メタデータ) (2024-12-11T06:35:18Z) - Gumbel Counterfactual Generation From Language Models [64.55296662926919]
対実的推論が介入と概念的に異なることを示す。
そこで本研究では,真の文字列反事実を生成するためのフレームワークを提案する。
提案手法は,従来の介入手法が望ましくない副作用を有意に生み出しているのに対し,本手法は有意義な反事実を生じさせることを示す。
論文 参考訳(メタデータ) (2024-11-11T17:57:30Z) - Continual Offline Reinforcement Learning via Diffusion-based Dual Generative Replay [16.269591842495892]
本研究では, 逐次的オフラインタスクに取り組むために, 前方転送を容易にし, 破滅的な忘れを緩和する実践的パラダイムについて検討する。
本稿では,生成した擬似データの同時再生により,過去の知識を保持できる2つの生成再生フレームワークを提案する。
論文 参考訳(メタデータ) (2024-04-16T15:39:11Z) - Time-series Generation by Contrastive Imitation [87.51882102248395]
モーメントマッチングの目的によってモチベーションされ、複合的エラーを軽減し、局所的(しかし前方的な)遷移ポリシーを最適化する。
推論において、学習されたポリシーは反復的なサンプリングのジェネレータとして機能し、学習されたエネルギーはサンプルの品質を評価するための軌道レベル尺度として機能する。
論文 参考訳(メタデータ) (2023-11-02T16:45:25Z) - Consistent Diffusion Models: Mitigating Sampling Drift by Learning to be
Consistent [97.64313409741614]
本稿では, モデルが生成したデータ上での予測が時間とともに一定であることを示す, 両立性特性を強制することを提案する。
CIFAR-10の条件および非条件生成とAFHQとFFHQのベースライン改良について,本研究の新たな訓練目標が得られた。
論文 参考訳(メタデータ) (2023-02-17T18:45:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。