論文の概要: Efficient World Action Model Inference with Adaptive Intermediate States
- arxiv url: http://arxiv.org/abs/2609.34608v1
- Date: Mon, 28 Sep 2026 08:37:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 11:59:00.302573
- Title: Efficient World Action Model Inference with Adaptive Intermediate States
- Title(参考訳): 適応的中間状態を用いた効率的な世界行動モデル推論
- Abstract要約: $mathrmWAMscriptstylemathrmACHINE$は、WAM推論のためのトレーニング不要のフレームワークである。
制御ループが進化するにつれて、推論状態を効率的かつ正確な継続のために保存し、適応する。
$mathrmWAMscriptstylemathrmACHINE$は1.47-3.05$times$speedups in Observation-to-action latencyと2.23-3.27$times$ speedups in GPU inference time per replanを達成する。
- 参考スコア(独自算出の注目度): 21.241948060806934
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: World Action Models (WAMs) enable future-aware control by jointly modeling actions and environment dynamics. However, iterative diffusion or flow inference incurs substantial denoising latency. Prior inference state offers a natural opportunity for acceleration, yet changing planning contexts, observations, and intermediate representations can quickly render retained state stale. Preserving useful computation therefore requires adapting inference state rather than reusing it as-is. To this end, we present $\mathrm{WAM}{\scriptstyle\mathrm{ACHINE}}$, a training-free framework that accelerates WAM inference by preserving and adapting inference state for efficient and accurate continuation as the control loop evolves. Across closed-loop replans, Trajectory Remapping remaps replan state from the preceding replan to initialize the next replan, reducing redundant trajectory generation. Across denoising steps, Observation Rebinding performs anticipatory inference during action execution and rebinds retained denoising state to the real observation for continuation when consistency checks pass, reducing latency exposed to the control loop. Across Transformer layers, Residual Rescaling selectively rescales retained layer state and refreshes it through full computation of the middle layers when probe checks fail, reducing repeated Transformer computation. Evaluations of three representative WAM architectures on LIBERO and RoboTwin 2.0 show that $\mathrm{WAM}{\scriptstyle\mathrm{ACHINE}}$ achieves 1.47-3.05$\times$ speedups in observation-to-action latency and 2.23-3.27$\times$ speedups in GPU inference time per replan, while preserving 96.69-99.54% of native WAM task success.
- Abstract(参考訳): World Action Models (WAM) は、アクションと環境ダイナミクスを共同でモデリングすることで、将来の認識制御を可能にする。
しかし、反復拡散やフロー推論は遅延を著しく悪化させる。
事前推論状態は、アクセラレーションの自然な機会を提供するが、計画コンテキスト、観察、中間表現は、保持状態の古い状態を素早くレンダリングすることができる。
したがって、有用な計算を保存するには、推論状態をそのまま再利用するのではなく、適応する必要がある。
この目的のために、制御ループが進化するにつれて、効率的に正確な継続のために推論状態を保持し、適応させることで、WAM推論を加速するトレーニング不要のフレームワークである$\mathrm{WAM}{\scriptstyle\mathrm{ACHINE}}を提示する。
クローズドループのリプラン全体で、トラジェクトリリマッピングリマップは、前のリプランからリプラン状態を取得し、次のリプランを初期化し、冗長なトラジェクトリ生成を減らす。
復調ステップ全体では、アクション実行中に予測推論を行い、一貫性チェックがパスした場合の継続のための実際の観測に復調状態を保持することで、制御ループに露出するレイテンシを低減する。
Transformer層全体で、Residual Rescalingは保持されたレイヤ状態を選択的に再スケールし、プローブチェックの失敗時に中間層の完全な計算を通じてリフレッシュする。
LIBERO と RoboTwin 2.0 上の3つの代表的な WAM アーキテクチャの評価によると、$\mathrm{WAM}{\scriptstyle\mathrm{ACHINE}}$ achieves 1.47-3.05$\times$ speedups in Observation-to-action latency and 2.23-3.27$\times$ speedups in GPU inference time per replan であり、ネイティブ WAM タスクの成功率 96.69-99.54% を維持している。
関連論文リスト
- FBFM: A Training-Free Asynchronous Feedback Mechanism for Flow-Matching in World-Action Models Execution [50.18922379062543]
フィードバックフローマッチング(Feedback Flow Matching, FBFM)は、アクティブに生成されたチャンク内で再接地を行うトレーニング不要な推論機構である。
トレーニング不要であるため、このメカニズムは予期せぬ事象に対する応答性を改善し、長時間の作業におけるドリフトを抑制する。
我々は,FBFMを第2世代WAMと第2世代WAMの両方で評価した。
論文 参考訳(メタデータ) (2026-07-31T10:11:09Z) - FutureRTC: Real-Time Robot Execution with Anticipatory-Conditioned Action Chunking [51.97839311685636]
FutureRTCは、実行時の観察と非同期VLA制御の状態を予測するためのプラグイン・アンド・プレイ適応フレームワークである。
FutureRTCは推論遅延に対する堅牢性を実現し,よりスムーズな軌道,高速な実行,一貫したタスク成功率を実現している。
論文 参考訳(メタデータ) (2026-07-27T05:10:16Z) - Evolving Cache Schedules for Fast Diffusion Policy Inference [6.879031540914794]
拡散ポリシは、アクションチャンクを反復的にデノナイズすることで、強力なビジュモータ制御を実現するが、繰り返しデノナイズすることで、リアルタイムなデプロイメントを計算的に要求する。
Evolving Cache Schedules (EVO)は,進化的検索によるキャッシュリフレッシュをグローバルにスケジュールする,トレーニング不要のアクセラレーションフレームワークである。
EVOは計算量を大幅に削減し、最大8.05倍の動作生成速度を実現し、FLOPを15.77Gから1.96Gに削減する。
論文 参考訳(メタデータ) (2026-07-22T15:40:11Z) - LeapTS: Rethinking Time Series Forecasting as Adaptive Multi-Horizon Scheduling [74.94985663101906]
本稿では,予測地平線上での動的スケジューリングプロセスとして時系列予測を再構成する新しいフレームワーク LeapTSを提案する。
LeapTSは、Transformerベースのモデルよりも2.6$times$から5.3$times$推論スピードアップを実現しつつ、全体的な予測性能を少なくとも7.4%向上させる。
論文 参考訳(メタデータ) (2026-05-11T09:54:02Z) - SSR: A Training-Free Approach for Streaming 3D Reconstruction [53.19807901585702]
自己表現型シーケンス規則化(Self Expressive Sequence Regularization、SSR)は、推論中にグラスマン列の正則性を強制するプラグアンドプレイ演算子である。
本研究では,SSRが連続的にドリフトを低減し,複数のストリーミング3D再構成タスクにおける再構成品質を向上させることを示す。
論文 参考訳(メタデータ) (2026-03-16T02:55:14Z) - Fully Spiking Neural Networks for Unified Frame-Event Object Tracking [17.626181371045575]
我々は、SpikeFETと呼ばれる、最初の完全なSpyking Frame-Event Trackingフレームワークを提案する。
このネットワークは、進化的局所特徴抽出とトランスフォーマーに基づくグローバルモデリングをスパイキングパラダイム内で相乗的に統合する。
提案手法は既存の手法よりも優れたトラッキング精度を実現し,消費電力を大幅に削減できることを示す。
論文 参考訳(メタデータ) (2025-05-27T07:53:50Z) - Intensity Profile Projection: A Framework for Continuous-Time
Representation Learning for Dynamic Networks [50.2033914945157]
本稿では、連続時間動的ネットワークデータのための表現学習フレームワークIntensity Profile Projectionを提案する。
このフレームワークは3つの段階から構成される: 対の強度関数を推定し、強度再構成誤差の概念を最小化する射影を学習する。
さらに、推定軌跡の誤差を厳密に制御する推定理論を開発し、その表現がノイズに敏感な追従解析に利用できることを示す。
論文 参考訳(メタデータ) (2023-06-09T15:38:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。