論文の概要: SplineWAM: Adaptive Action Horizons for World Action Models via B-Spline Representations
- arxiv url: http://arxiv.org/abs/2609.39873v1
- Date: Wed, 30 Sep 2026 14:51:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 18:57:27.946517
- Title: SplineWAM: Adaptive Action Horizons for World Action Models via B-Spline Representations
- Title(参考訳): SplineWAM:B-Spline表現を用いた世界行動モデルのための適応型アクションホライズン
- Abstract要約: 動作軌跡を適応的にB-スプラインパラメータの固定サイズウィンドウに圧縮するSplineWAMを提案する。
1つのパラメータ予算は、時間的解像度と期間の異なるチャンクにデコードされ、実行されたスパンと、次のポリシー呼び出しが予測自体から続くまでのインターバルの両方にデコードされる。
LIBERO-PlusとRoboCasaでは、アクションチャンキングWAMの成功率を8.2ドルと4.4ドルで改善し、エピソードごとのポリシーコールを22%と26%削減した。
- 参考スコア(独自算出の注目度): 29.139819960625744
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: World action models (WAMs) are large embodied policies that jointly predict future video and the actions to execute, emitting a fixed-length action chunk per inference call. Such a policy allocates its computational budget uniformly in time, unable to execute for longer over free-space motion or to spend more inference on contact-rich manipulation, which limits the throughput a WAM can reach when served in the cloud. We present SplineWAM, which adaptively compresses the action trajectory into a fixed-size window of cubic B-spline parameters, fitting the knot times to the characteristics of the motion. One parameter budget then decodes into chunks of varying temporal resolution and duration, and both the executed span and the interval until the next policy call follow from the prediction itself. Aligning the video supervision to the fitted knot times of the demonstration rather than to a uniform grid concentrates the supervised frames where the action trajectory is complex. For asynchronous deployment we introduce Jacobian-Pullback Real-Time Chunking (JP-RTC), which imposes chunk continuity on the decoded raw actions the robot executes rather than on the spline parameters, and corrects the parameters through the decoder so that the executed prefix agrees with the actions already committed. On LIBERO-Plus and RoboCasa, SplineWAM improves success rate over an action chunking WAM by $8.2$ and $4.4$ points while cutting policy calls per episode by 22% and 26%. On three bimanual real-robot tasks under asynchronous execution, it leads or matches the baseline while decoding 1.2 to 1.6 times as much executed motion per call.
- Abstract(参考訳): World Action Model(WAM)は、将来のビデオと実行すべきアクションを共同で予測し、推論コール毎に一定の長さのアクションチャンクを出力する、大規模な具体的ポリシーである。
このようなポリシーは、その計算予算を均一に割り当て、自由空間の動きよりも長く実行できない、あるいはコンタクトリッチな操作により多くの推論を費やすことができないため、WAMがクラウドで提供できるスループットを制限できる。
本研究では,動作軌跡を3次B-スプラインパラメータの固定サイズウィンドウに適応的に圧縮し,その結び目時間を動作特性に適合させるSplineWAMを提案する。
1つのパラメータ予算は、その後、時間的解像度と期間の異なるチャンクにデコードされ、実行されたスパンと、次のポリシー呼び出しが予測自体から続くまでのインターバルの両方にデコードされる。
動画の監督を一様格子ではなく、デモの結び目時間に合わせることで、アクション軌跡が複雑である監督されたフレームに集中する。
非同期デプロイメントにはJacobian-Pullback Real-Time Chunking (JP-RTC)を導入します。これは、ロボットがスプラインパラメータではなく実行しているデコードされた生のアクションに対してチャンク連続性を課し、実行済みプレフィックスがすでにコミットしているアクションと一致するようにデコーダを通じてパラメータを修正します。
LIBERO-PlusとRoboCasaでは、アクションチャンキングWAMの成功率を8.2ドルと4.4ドルで改善し、エピソードごとのポリシーコールを22%と26%削減した。
非同期実行中の3つの実ロボットタスクでは、ベースラインをリードまたは一致させ、呼び出し毎の1.2から1.6倍の動作をデコードする。
関連論文リスト
- Action Chunking Proximal Policy Optimization with Feedback Correction [24.47744124194428]
アクションチャンキングは強化学習における時間的抽象化を提供する。
本稿では,PPO拡張であるAction Chunking PPO(ACPPO)について述べる。
ACPPO-Corrは、各チャンク内で計画されたアクションをオンラインで調整するステップワイズフィードバック修正器でチャンクプランナを強化します。
論文 参考訳(メタデータ) (2026-09-28T20:43:07Z) - Streaming-WAM: Action-Conditioned World-Action Model for Asynchronous Robot Manipulation [21.031571063193546]
Streaming-WAMは、非同期ロボット制御によるアクション条件付き世界モデリングを結合して、将来の視覚的予測におけるコミットアクションを考慮した。
現実世界のスタンプペーパータスクでは、平均エピソード時間は、同期ジョイントWAMで90秒からストリーミングWAMで38秒に減少する。
論文 参考訳(メタデータ) (2026-09-24T02:19:21Z) - SmoothRL: Online Reinforcement Learning During Asynchronous Execution [12.24698147742807]
物理的な世界でロボットポリシーをデプロイするには、信頼性とスムーズなリアルタイム実行という、2つの基本的なデシダータを満たす必要がある。
SmoothRLは、非同期推論ループ内で事前訓練されたポリシーを微調整するオンライン強化学習フレームワークである。
我々は,SmoothRLを実世界のロボットタスクに対して高い精度で評価し,非同期実行を必要とする高ダイナミックなタスクについて検討した。
論文 参考訳(メタデータ) (2026-08-30T12:56:09Z) - StreamPI: Streaming Multimodal Temporal Modeling for Vision-Language-Action Models [84.17128030384099]
StreamPIはストリーミングマルチモーダル時間モデリングフレームワークである。
追加パラメータを導入することなく、単一フレームのVLAに時間的推論能力を持たせる。
メモリ依存および正確な認識シナリオにまたがる実ロボットタスクの実験とシミュレーションベンチマークのLIBEROは、StreamPIが様々なタスクでpi0.5より優れていることを示した。
論文 参考訳(メタデータ) (2026-08-26T17:33:19Z) - FBFM: A Training-Free Asynchronous Feedback Mechanism for Flow-Matching in World-Action Models Execution [50.18922379062543]
フィードバックフローマッチング(Feedback Flow Matching, FBFM)は、アクティブに生成されたチャンク内で再接地を行うトレーニング不要な推論機構である。
トレーニング不要であるため、このメカニズムは予期せぬ事象に対する応答性を改善し、長時間の作業におけるドリフトを抑制する。
我々は,FBFMを第2世代WAMと第2世代WAMの両方で評価した。
論文 参考訳(メタデータ) (2026-07-31T10:11:09Z) - FutureRTC: Real-Time Robot Execution with Anticipatory-Conditioned Action Chunking [51.97839311685636]
FutureRTCは、実行時の観察と非同期VLA制御の状態を予測するためのプラグイン・アンド・プレイ適応フレームワークである。
FutureRTCは推論遅延に対する堅牢性を実現し,よりスムーズな軌道,高速な実行,一貫したタスク成功率を実現している。
論文 参考訳(メタデータ) (2026-07-27T05:10:16Z) - B-spline Policy: Accelerating Manipulation Policies via B-spline Action Representations [75.39816527838181]
B-スプラインポリシー(B-spline Policy、BSP)は、ロボット操作ポリシーを加速するために設計されたアクション表現である。
BSPは、一連の結び目と制御点によって定義される連続B-スプライン曲線としてアクションをパラメータ化する。
論文 参考訳(メタデータ) (2026-07-10T17:46:32Z) - DiscreteRTC: Discrete Diffusion Policies are Natural Asynchronous Executors [57.944744187489185]
外部修正をネイティブなアンマスクに置き換えるDiscreteRTCを提案する。
DiscreteRTCは、非同期のインペインティングのために0行のコードを実装するのが簡単で、スクラッチから生成したアクションに比べてわずか0.7倍の計算速度で推論が高速で、フローベースのRTCに比べて実世界の動的ピックタスクの成功率が50%向上した。
論文 参考訳(メタデータ) (2026-04-27T23:04:03Z) - Closed-Loop Action Chunks with Dynamic Corrections for Training-Free Diffusion Policy [52.106797722292896]
我々は,チャンクベースのアクション生成とリアルタイム修正を統合した動的クローズドループ拡散ポリシーフレームワークDCDPを提案する。
動的PushTシミュレーションでは、DCDPは5%の計算しか必要とせず、再トレーニングなしに適応性を19%改善する。
論文 参考訳(メタデータ) (2026-03-02T15:04:18Z) - Real-Time Robot Execution with Masked Action Chunking [38.37108371991901]
ロボットのようなサイバー物理システムにはリアルタイム実行が不可欠である。
近年,リアルタイムロボット操作のためのシステムレベルのパラダイムとして,非同期推論が登場している。
本稿では,マスクされたアクションチャンキングによって事前訓練されたポリシーの修正を学習するREMACを提案する。
論文 参考訳(メタデータ) (2026-01-27T23:48:32Z) - Sparse ActionGen: Accelerating Diffusion Policy with Real-time Pruning [9.92274274871221]
拡散政策は、マルチモーダルな行動分布をモデル化する強力な能力のために、アクション生成を支配してきた。
我々は、非常にスパースなアクション生成のために$underlinetextbfS$parse $underlinetextbfA$ction$underlinetextbfG$enを提案する。
論文 参考訳(メタデータ) (2026-01-19T09:50:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。