論文の概要: Keep the Future, Drop the Rollout: RIFT for World Action Models
- arxiv url: http://arxiv.org/abs/2608.11521v2
- Date: Thu, 13 Aug 2026 02:41:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-14 14:00:09.762801
- Title: Keep the Future, Drop the Rollout: RIFT for World Action Models
- Title(参考訳): 未来を守り、ロールアウトを落とす:世界アクションモデルのためのRIFT
- Abstract要約: 将来のキャッシュ値のマスキングや再割り当てによって実行が変化し、成功が減少することを示す。
本稿では,学習した予測トークンを用いて,完全な将来K/Vキャッシュを1つのバックボーンパスで構築するRIFTを提案する。
- 参考スコア(独自算出の注目度): 46.70481761959841
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: World action models (WAMs) condition robot actions on predicted futures, but iterative video rollout increases deployment latency. We ask whether action generation requires the evolving rollout trajectory or only its future representation. Across four WAMs on all 40 LIBERO tasks, paired closed-loop interventions show that masking or reassigning future-cache values changes execution and reduces success, indicating sensitivity to future values and their assigned positions. For Joint and Cosmos-2, however, replaying one fixed final-clean key/value (K/V) cache nearly preserves unmodified execution, with $1.7$ to $1.9$~cm end-effector average displacement error and $97.9\%$ to $98.2\%$ success. This separates cache consumption from production: these models can reuse a fixed cache but still require iterative rollout to construct it. We therefore propose RIFT (\emph{Rollout-free Imagination via Future Tokens}), which uses learned anticipation tokens to construct a complete future K/V cache in one backbone pass while retaining the original future-read interface. On LIBERO, RIFT achieves $98.8\%$ success, close to rollout-based Joint, IDM, and LingBot-VA at $98.4\%$ to $98.6\%$, while reducing action-chunk latency by $68.2\%$ to $89.1\%$. On RoboTwin~2.0, RIFT reaches $92.9/92.6\%$ on clean/randomized scenes, the highest observed among the evaluated methods. These results support rollout-free future conditioning without iterative video generation at deployment.
- Abstract(参考訳): World Action Model(WAM)は、予測される未来に対するロボットアクションを条件とするが、反復的なビデオロールアウトはデプロイメントのレイテンシを増大させる。
我々は、アクション生成が進化するロールアウト軌跡を必要とするのか、それとも将来の表現のみを必要とするのかを問う。
40のLIBEROタスクの4つのWAMの中で、ペア化されたクローズドループの介入は、将来のキャッシュ値のマスキングまたは再割り当てが実行を変え、成功を減少させ、将来の値とその割り当てられた位置に対する感受性を示すことを示している。
しかし、JointとCosmos-2では、1つの固定されたfinal-clean key/value (K/V)キャッシュをリプレイすることは、修正されていない実行をほとんど保存し、平均変位誤差が1.7$から1.9$〜cm、9.9\%が9.9\%から9.2\%が成功する。
これらのモデルは固定キャッシュを再利用できるが、構築には反復的なロールアウトが必要である。
そこで我々は、学習した予測トークンを用いて、元のFuture Tokensインタフェースを維持しながら、完全な将来K/Vキャッシュを1つのバックボーンパスで構築するRIFT(\emph{Rollout-free Imagination via Future Tokens})を提案する。
LIBERO では、RIFT は、ロールアウトベースの Joint, IDM, LingBot-VA を 98.4\% から 98.6\% に近づき、アクション・チャンクのレイテンシを 68.2\% から 89.1\% に減らした。
RoboTwin~2.0 では、RIFT はクリーン/ランダム化シーンで 92.9/92.6 % に達する。
これらの結果は、デプロイ時に繰り返しビデオを生成することなく、ロールアウトフリーの将来のコンディショニングをサポートする。
関連論文リスト
- ActionSplice: In-Flight Action Editing for Interactive World Models [4.400011068855375]
チャンク自動回帰ビデオワールドモデルは通常、1つのアクションで生成されたチャンクを条件付けする。
我々は、この問題をCST(Counterfactual State Transport)として定式化する推論フレームワークであるActionpliceを紹介する。
一時スプライシングの$mathrmCST*R$は、一時プレフィックスを保持し、接尾辞のみを更新する。
$mathrmCST*T$は、それぞれ接尾辞LPIPSを56.1%減らし、77.5%減らし、2.73times$と1.69times$の1.69timesを待ち前のスピードアップで提供する。
論文 参考訳(メタデータ) (2026-09-08T04:21:36Z) - World-Coherent Decoding: Self-Verifying Test-Time Planning for World Action Models [20.97725301919032]
World-Coherent-Decoding (WCD)は、WAMのための自己検証テスト時間計画フレームワークである。
WCDは、将来の候補選択のための軽量オンライン予測器を訓練する。
RoboTwin 2.0では、WCDは限定的なランダム化シーンの監督の下でハードな成功を55.80%ドルから60.90%ドルに改善し、Horizon-3タスクでは+16.43ドルが上昇した。
WAMのテストタイムスケーリングは、信頼できるものを選択することよりも、より多くの未来をサンプリングすることに依存します。
論文 参考訳(メタデータ) (2026-09-02T06:21:36Z) - Latent Action as Intention Enables Efficient Future Imagination for World Action Models [20.031922437200524]
提案するアーキテクチャ**LAWA**は,コンパクトな潜伏動作を将来の意図の操作的表現として利用するWAMアーキテクチャである。
RoboCasaでは、LAWAは数ショットと全データ設定で65.6%と80.8%という最先端の平均的な成功率を達成した。
また、一致したJoint-WAMモデルの性能レベルも保持し、42.9%の遅延時間を必要とする。
論文 参考訳(メタデータ) (2026-08-25T17:59:03Z) - FBFM: A Training-Free Asynchronous Feedback Mechanism for Flow-Matching in World-Action Models Execution [50.18922379062543]
フィードバックフローマッチング(Feedback Flow Matching, FBFM)は、アクティブに生成されたチャンク内で再接地を行うトレーニング不要な推論機構である。
トレーニング不要であるため、このメカニズムは予期せぬ事象に対する応答性を改善し、長時間の作業におけるドリフトを抑制する。
我々は,FBFMを第2世代WAMと第2世代WAMの両方で評価した。
論文 参考訳(メタデータ) (2026-07-31T10:11:09Z) - Test-Time Scaling for World Action Models via Zero-Shot Geometric Evaluation [17.21271965568624]
世界行動モデル(WAM)は自然に決定する: 各ロールアウトはアクションチャンクと将来の観測の両方を公開する。
WAMのためのトレーニング不要な選択的テスト時間スケーリングフレームワークである Methodgated を提案する。
論文 参考訳(メタデータ) (2026-07-20T01:05:02Z) - ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation [72.54604107217669]
textscpass@$k$は圧縮後にほぼ消滅するが、textscpass@$k$は繰り返しサンプリングの下でほぼ回復する。
回復は、密集したトークンレベルの監督の下で、圧縮されたモデル自身のオン政治状態で訓練すべきである。
我々は,教師が確認した反復接尾辞を検知する短時間のOPDスケジュールであるtextbfshortopdを提案する。
論文 参考訳(メタデータ) (2026-07-14T17:50:50Z) - ReactVLA: Fast and Lightweight Reactive Robot Manipulation via Improved Mean Flow Action Generation [6.976481623762446]
textttReactVLAは、リアルタイムロボット操作のための軽量で低レイテンシなVLAフレームワークである。
textttReactVLAは、同じサイズのVLAベースラインを一貫して上回る。
現実世界のポリシーのレイテンシを38.6ミリ秒以下に短縮し、物理ロボットプラットフォームでの高速な反応性制御を可能にする。
論文 参考訳(メタデータ) (2026-06-12T08:33:37Z) - Diffusion Transformer World-Action Model for AV Scene Prediction [0.0]
アクションコンディショニングされた世界モデルは、自動運転車が将来のカメラシーンを独自のコントロールから予測することを可能にする。
しかし、コンパクトで訓練可能なスケールでは、未来は曖昧であり、フィールドの標準歪み指標は積極的に誤解を招く。
我々はこれを、冷凍デコーダが最大256倍256ドルフレームを最大8秒前にレンダリングする将来のシーンの潜伏を予測するコンパクトな潜伏世界モデルと対決する。
論文 参考訳(メタデータ) (2026-06-11T07:24:12Z) - Causal Forcing++: Scalable Few-Step Autoregressive Diffusion Distillation for Real-Time Interactive Video Generation [50.55853275866995]
リアルタイムのインタラクティブなビデオ生成には、低レイテンシ、ストリーミング、コントロール可能なロールアウトが必要である。
本稿では,フレームワイドの自己回帰を1~2ステップのサンプリングで行うという,よりアグレッシブな設定について検討する。
原理的かつスケーラブルなパイプラインである textbfCausal Forcing++ を提案する。
論文 参考訳(メタデータ) (2026-05-14T17:46:36Z) - When to Trust Imagination: Adaptive Action Execution for World Action Models [42.51856318901667]
世界行動モデル(WAM)は、近ごろ、将来の視覚的観察と将来の行動を共同で予測することによって、ロボット操作のための有望なパラダイムとして登場した。
現在のWAMは、各モデル推論の後、一定の数の予測アクションを実行し、ロボットは、想像された未来が実際の物理的なロールアウトと一致しているかどうかを無視する。
我々は,将来性検証問題として適応型WAM実行を定式化し,WAM予測された未来が信頼性を保ちながらロボットはより長く実行すべきであり,現実が想像力から逸脱した場合にはより早く再計画する。
論文 参考訳(メタデータ) (2026-05-07T13:18:28Z) - Motion-Aware Caching for Efficient Autoregressive Video Generation [73.27762884730272]
MotionCacheは、ピクセルレベルのモーション特性の軽量プロキシとして、フレーム間の差異を利用する。
SkyReels-V2やMAGI-1のような最先端モデルの実験では、MotionCacheが大幅なスピードアップを実現している。
論文 参考訳(メタデータ) (2026-05-03T05:49:27Z) - WorldCache: Content-Aware Caching for Accelerated Video World Models [50.7543797435026]
我々はPerception-Constrained Dynamic CaCacheフレームワークであるtextbfWorldCacheを紹介する。
WorldCacheは、機能をいつ、どのように再利用するかを改善します。
PAI-Benchで評価されたCosmos-2.5-2Bでは、WorldCacheはtextbf$2.3times$推論スピードアップを実現し、textbf99.4%のベースライン品質を維持している。
論文 参考訳(メタデータ) (2026-03-23T17:59:54Z) - FLARE: Robot Learning with Implicit World Modeling [87.81846091038676]
$textbfFLARE$は、予測潜在世界モデリングをロボットポリシー学習に統合する。
$textbfFLARE$は最先端のパフォーマンスを実現し、これまでのポリシー学習のベースラインを最大26%上回っている。
この結果は、暗黙の世界モデリングと高周波ロボット制御を組み合わせた汎用的でスケーラブルなアプローチとして$textbfFLARE$を確立した。
論文 参考訳(メタデータ) (2025-05-21T15:33:27Z) - Simple ReFlow: Improved Techniques for Fast Flow Models [68.32300636049008]
拡散および流れマッチングモデルは、優れた生成性能を実現するが、多くのサンプリングステップを犠牲にしている。
我々は、力学、学習、推論のトレーニングに7つの改善点を提案する。
我々は、ニューラルネットワークによる高速な生成のために、最先端のFIDスコア(ガイダンスなし/参照なし)を達成している。
論文 参考訳(メタデータ) (2024-10-10T11:00:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。