論文の概要: One from Infinity: Actualizing Futures from Pretrained World Models into Robot Actions
- arxiv url: http://arxiv.org/abs/2609.36413v2
- Date: Thu, 01 Oct 2026 01:47:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.516926
- Title: One from Infinity: Actualizing Futures from Pretrained World Models into Robot Actions
- Title(参考訳): 無限の1つ:事前訓練された世界モデルからロボット行動への未来の実現
- Abstract要約: 映像の世界モデルでは、シーンの多くの有望な未来が認められるが、ロボットは正確なタスク条件に気付く必要がある。
我々は、このタスクを現実化として形式化し、フリーズワールドモデルによって提供された事前のタスク条件の選択と実現を学習する。
我々は,冷凍世界モデルエンコーダ上に,最大60万パラメータのRoboActualizerを実装した。
現実化器は2つの軽量なDiT専門家で構成されており、将来的な潜伏剤とフローマッチングによるアクションを共同で予測する。
- 参考スコア(独自算出の注目度): 52.542279563757724
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A pretrained video world model admits many plausible futures for a scene, but a robot must realize the exact task-conditioned one. To turn world models into executable robot policies, existing methods fine-tune the heavy world model backbone using large-scale robot data and computational resources. Challenging this status quo, we argue that the expensive part has already been paid in the world model pretraining since the representation space of a video world model lays out the diverse potential futures. In this case, what remains is to select the future that accomplishes the task and to read out the actions that realize it. We formalize this task as actualization, which learns a task-conditioned selection and realization on top of a prior supplied by a frozen world model. This can be solved by a tiny actualizer model. We implement RoboActualizer with as few as 60M parameters on top of a frozen world model encoder. The actualizer is composed of two lightweight DiT experts that jointly predict future latents and actions by flow matching. The model can be trained entirely on a single GPU with 32 GB peak memory. With up to 100x fewer trainable parameters than existing WAMs and VLAs, RoboActualizer reaches great performance on simulation benchmarks including LIBERO, LIBERO-Plus, RoboTwin 2.0 and five tasks on two real-world platforms, with a low latency of 39 ms that allows real-time control.
- Abstract(参考訳): 事前訓練されたビデオワールドモデルでは、シーンに多くの有望な未来が認められるが、ロボットは正確なタスク条件を実現する必要がある。
世界モデルを実行可能なロボットポリシーに変換するため、既存の手法では、大規模ロボットデータと計算資源を用いて重世界モデルバックボーンを微調整する。
このような現状を鑑みると,ビデオワールドモデルの表現空間が多種多様な将来性を示すことから,コストのかかる部分は,すでに事前訓練済みのワールドモデルで支払われていると論じる。
この場合、残っているのは、タスクを達成する未来を選択し、それを実現するアクションを読み取ることです。
我々は、このタスクを現実化として形式化し、フリーズワールドモデルによって提供された事前のタスク条件の選択と実現を学習する。
これは小さな実化器モデルによって解決できる。
我々は,冷凍世界モデルエンコーダ上に,最大60万パラメータのRoboActualizerを実装した。
現実化器は2つの軽量なDiT専門家で構成されており、将来的な潜伏剤とフローマッチングによるアクションを共同で予測する。
モデルは、32GBのピークメモリを持つ単一のGPUで完全にトレーニングすることができる。
既存のWAMやVLAよりも100倍少ないトレーニング可能なパラメータを持つRoboActualizerは、LIBERO、LIBERO-Plus、RoboTwin 2.0、および2つの現実世界プラットフォーム上の5つのタスクを含むシミュレーションベンチマークで優れたパフォーマンスを達成し、39msのレイテンシでリアルタイム制御が可能になった。
関連論文リスト
- DELE-w0.5: Inferring Action from Future Latent State for Robotic Manipulation [11.665741844323984]
我々は、ビデオ生成がワールドアクションモデリングの不要な目的であると主張している。
ロボット操作においては、世界モデルの目的は、中間の瞬間に世界がどのように見えるかを再現するのではなく、アクションの実行後に世界が到達する状態を予測することである。
本稿では,映像生成に頼らずに将来予測状態からロボット動作を推定するDELE-w0.5を提案する。
論文 参考訳(メタデータ) (2026-08-22T18:17:36Z) - LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation [26.29942570664068]
LiLa-WAMは軽量なワールドアクションモデルで、コンパクトな潜在空間における未来を推論し、24GBのGPUでエンドツーエンドにトレーニングすることができる。
本稿では,視覚的特徴空間の方向として各タスクを符号化する言語自由なタスク表現であるVisual Transition Token(VTT)を提案する。
論文 参考訳(メタデータ) (2026-08-04T14:06:15Z) - RoboWorld: Fast and Reliable Neural Simulators for Generalist Robot Policy Evaluation [52.855830378221775]
一般的なロボットポリシーを評価するためのスケーラブルな代替手段として、ビデオワールドモデルが登場しつつある。
タスクプログレス対応の視覚言語モデルスコアリングと,高速なビデオワールドモデルを組み合わせた自動評価パイプラインであるRoboWorldを紹介する。
論文 参考訳(メタデータ) (2026-07-01T15:22:41Z) - LaWAM: Latent World Action Models for Efficient Dynamics-Aware Robot Policies [31.88655699486955]
ラワント・アクション条件付きラワント・ワールドモデル(LaWM)を提案する。
LaWAMは、将来のビデオの再構成ではなく、コンパクトで潜伏した視覚サブゴールを通じて、ロボットポリシーに対する予測ダイナミクスを公開する。
LaWAMはアクションチャンク予測あたり187msで動作し、画素空間のWAMよりも最大24倍の遅延時間を実現する。
論文 参考訳(メタデータ) (2026-06-14T12:06:58Z) - World Action Models are Zero-shot Policies [111.91938055103633]
本稿では,予めトレーニングされたビデオ拡散バックボーン上に構築されたワールドアクションモデル(WAM)であるDreamZeroを紹介する。
ビデオとアクションを共同でモデリングすることで、DreamZeroは異種ロボットデータから多様なスキルを効果的に学習する。
ビデオのみによる他のロボットや人間によるデモは、目に見えないタスクのパフォーマンスに対して42%以上の相対的な改善をもたらす。
論文 参考訳(メタデータ) (2026-02-17T15:04:02Z) - Large Video Planner Enables Generalizable Robot Control [117.49024534548319]
汎用ロボットは、様々なタスクや環境にまたがって一般化する意思決定モデルを必要とする。
最近の研究は、マルチモーダル大言語モデル(LM)をアクション出力で拡張し、視覚-アクション(VLA)システムを構築することで、ロボット基盤モデルを構築している。
本稿では,ロボット基礎モデル構築における主要なモダリティとして,大規模ビデオ事前学習を用いるための代替パラダイムについて検討する。
論文 参考訳(メタデータ) (2025-12-17T18:35:54Z) - RT-1: Robotics Transformer for Real-World Control at Scale [98.09428483862165]
我々は,有望なスケーラブルなモデル特性を示す,ロボティクストランスフォーマーと呼ばれるモデルクラスを提示する。
実世界の課題を遂行する実ロボットの大規模データ収集に基づいて,様々なモデルクラスと,データサイズ,モデルサイズ,データの多様性の関数として一般化する能力について検証した。
論文 参考訳(メタデータ) (2022-12-13T18:55:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。