論文の概要: Beyond Future Prediction: Denoising as Generative Adaptation for Robot Control
- arxiv url: http://arxiv.org/abs/2609.28339v1
- Date: Wed, 23 Sep 2026 16:17:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 00:05:18.106672
- Title: Beyond Future Prediction: Denoising as Generative Adaptation for Robot Control
- Title(参考訳): 未来予測を超えて:ロボット制御のためのジェネレーティブ適応としての認知
- Abstract要約: 将来的な目標のない協調学習の定式化である NowWAM を導入し、現在の観察を軽視し、同じ視覚的ストリームからロボットの動作を予測する。
一致した制御された設定の下では、過去と将来の視覚的ターゲットは互換性を持って動作し、クリーンエンドポイントへのトレーニングを制限することで、ロバスト性が大幅に低下する。
純粋なテキストと画像のZ画像のバックボーンにより、NowWAMはさらに87.8%に達し、強力な制御適応がビデオ生成や画像編集のバックボーンと結びついていないことを示している。
- 参考スコア(独自算出の注目度): 70.89713052912246
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Pretrained generative Diffusion Transformers (DiTs) capture rich pixel-level visual and language-conditioned structure through large-scale image and video generation training. A growing line of robot policies builds on this generative prior, but how it should be transferred to control remains unclear, and existing approaches commonly instantiate this transfer through future visual prediction. We ask a more basic question: what a pretrained generative DiT actually contributes to action learning, and how this prior should be adapted for control. We introduce NowWAM, a future-target-free co-training formulation that denoises the current observation and predicts robot actions from the same visual stream, directly coupling the native generative objective to the action-facing representation across the denoising trajectory. Under matched controlled settings, past and future visual targets perform comparably, while restricting training to the clean endpoint substantially reduces robustness, suggesting that a separate future target is not essential for generative adaptation, while the denoising trajectory remains an effective interface for control. On LIBERO-Plus, NowWAM reaches 87.7% with FLUX2-Klein, improving over the future-target co-training baseline by 6.1 points while halving training visual tokens (784 to 392) and reducing step time from 2.85 s to 1.63 s, a 1.8x speedup. With the pure text-to-image Z-Image backbone, NowWAM further reaches 87.8%, showing that strong control adaptation is not tied to video generation or image-editing backbones.
- Abstract(参考訳): DiT(Pretrained Generative Diffusion Transformers)は、大規模画像とビデオ生成のトレーニングを通じて、リッチなピクセルレベルの視覚構造と言語条件構造をキャプチャする。
ロボットポリシーの行は、この生成以前のものの上に構築されているが、どのように制御に移されるべきかは、まだ不明であり、既存のアプローチでは、将来の視覚的予測を通じて、この転送をインスタンス化している。
より基本的な質問は、事前訓練された生成型DiTが実際にアクションラーニングにどのような貢献をするのか、そして、この前もってどのように制御に適応すべきかである。
我々は,現在観測されているロボットの動作を同一の視覚的ストリームから予測し,ネイティブな生成目標と視覚的軌跡をまたいだアクション対向表現を直接結合する,将来的な目標のない協調学習形式であるNowWAMを紹介した。
一致した制御条件の下では、過去と将来の視覚的ターゲットは相容れないが、クリーンエンドポイントへのトレーニングの制限はロバスト性を大幅に低下させ、個別の将来のターゲットが生成的適応に必須ではないことを示唆し、デノベーション軌道は制御に有効なインターフェースのままである。
LIBERO-Plusでは、NowWAMはFLUX2-Kleinで87.7%に達し、将来の目標となるコトレーニングベースラインを6.1ポイント改善し、トレーニング用ビジュアルトークン(784から392)を半減させ、ステップタイムを2.85秒から1.63秒に短縮し、1.8倍のスピードアップを実現した。
純粋なテキストと画像のZ画像のバックボーンにより、NowWAMはさらに87.8%に達し、強力な制御適応がビデオ生成や画像編集のバックボーンと結びついていないことを示している。
関連論文リスト
- MT-WAM: Reorienting the One-Pass Predictive Representation Toward Action Generation [8.200221267664881]
Fast-WAMは、将来の動画を推論時に生成することなく、ビデオアクションの協調訓練が制御を改善することを示す。
MT-WAMは,本来の訓練目標を維持し,将来の2次元点軌跡と視覚的特徴を補完的に監視する。
論文 参考訳(メタデータ) (2026-09-18T08:23:15Z) - Foresight Without Seeing: Latent Futures for World Action Models [31.423405133926334]
本稿では,動的条件付き直接政治WAMであるForeWAMを提案する。
また、凍結した潜伏行動教師が指導するダイナミクスを導入し、物体の動きや接触変化、タスクの進行といった相互作用によって引き起こされる遷移を、暗黙の未来の状態が捉えることを奨励する。
ロボットデータの事前トレーニングがなければ、ForeWAMの標準版と加速版は平均96.7%、LIBEROは96.9%である。
論文 参考訳(メタデータ) (2026-08-12T03:27:43Z) - Native Video-Action Pretraining for Generalizable Robot Control [77.59831077077176]
LingBot-VA 2.0は、エンボディメントのためにゼロから構築されたビデオアクション基盤モデルである。
高周波推論の要求を満たすため,本モデルは疎いMOEバックボーンを用いる。
現実のデプロイメントは、堅牢な基盤モデルとしてLingBot-VA 2.0を検証する。
論文 参考訳(メタデータ) (2026-07-09T16:15:43Z) - InternVLA-A1.5: Unifying Understanding, Latent Foresight, and Action for Compositional Generalization [81.9611022323101]
本稿では,VQAとサブタスク予測のトレーニングを継続するネイティブVLMバックボーン上にポリシを構築するInternVLA-A1.5について述べる。
将来の予測は、学習可能な予測トークンの小さなセットが、凍結事前学習されたビデオ生成モデルの監督の下で、タスク関連の将来をコンパクトな遅延コードに凝縮する潜時予測問題として再放送される。
InternVLA-A1.5は、1.2Mのロボットエピソードと3Mのマルチモーダルサンプルで事前訓練され、6つのシミュレーションベンチマークで最高の結果を得る。
論文 参考訳(メタデータ) (2026-07-06T12:25:30Z) - FOCA: Future-Oriented Conditioning for Data-Efficient Vision-Language-Action Adaptation [14.178611843420683]
データ効率のよいVLA適応のための未来指向コンディショニングフレームワークFOCAを紹介する。
FOCAはタスク・グラウンドの将来の相互作用の埋め込みの明示的な予測と将来の目標観測への暗黙のアライメントを組み合わせている。
実験では、LIBEROで20回のデモを行い、FOCAが95.7%成功し、RoboCasaで7-12%改善し、実際のロボットで最大26%の絶対ゲインを達成している。
論文 参考訳(メタデータ) (2026-06-18T18:54:51Z) - GigaWorld-Policy: An Efficient Action-Centered World--Action Model [50.107640832046464]
GigaWorld-Policyはアクション中心のWAMで、2Dピクセルアクションのダイナミクスを学習し、オプションのビデオ生成で効率的なアクションデコーディングを可能にする。
実世界のロボットプラットフォームでの実験結果によると、GigaWorld-Policyは主要なWAMベースラインであるMotusの9倍高速で動作する。
論文 参考訳(メタデータ) (2026-03-18T00:52:02Z) - RynnVLA-001: Using Human Demonstrations to Improve Robot Manipulation [39.383510768790295]
RynnVLA-001は、人間のデモンストレーションから大規模ビデオ生成前訓練に基づいて構築された視覚言語アクション(VLA)モデルである。
最初のステージであるEgo-Centric Video Generative Pretrainingは、12Mのエゴ中心の操作ビデオ上で、画像からビデオまでのモデルを訓練し、初期フレームと言語命令で条件付けられた将来のフレームを予測する。
第2段階であるHuman-Centric Trajectory-Aware Modelingは、将来のキーポイント軌跡を共同で予測することでこれを拡張し、アクション予測による視覚的フレーム予測を効果的にブリッジする。
論文 参考訳(メタデータ) (2025-09-18T17:58:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。