論文の概要: Achieve What You Imagined: Learning to Align Actions with Visual Plans
- arxiv url: http://arxiv.org/abs/2609.33832v1
- Date: Sun, 27 Sep 2026 18:32:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-04 16:30:35.306153
- Title: Achieve What You Imagined: Learning to Align Actions with Visual Plans
- Title(参考訳): 想像したことを達成する:ビジュアルプランで行動の調整を学ぶ
- Abstract要約: 世界行動モデルは、将来の視覚的な観察とロボットのアクションを共同で予測することができる。
視覚的予測と、生成された行動によって引き起こされる結果の間には、相違がある可能性がある。
我々は、フリーズされた行動条件付き世界モデルを用いて、行動条件付き結果の予測とフィードバックの構築を行う。
- 参考スコア(独自算出の注目度): 37.7412146305617
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: World-action models can jointly predict future visual observations and robot actions. However, discrepancies may exist between their visual predictions and the consequences implied by generated actions. We observe that WAMs can often generate visually plausible task-completion outcomes before producing action sequences that reliably achieve them. Consequently, we treat the WAM-generated visual prediction as a goal-conditioned visual proposal rather than a directly executable plan. We use a frozen action-conditioned world model to predict action-conditioned consequences and construct feedback based on consistency between the two future predictions and alignment with the terminal goal. Leveraging this feedback, we employ Flow Policy Optimization (FPO) to optimize the action head of the WAM. This framework avoids online robot interaction and additional training of task-specific reward models. Across four real-world UR5 manipulation tasks, our method increases the mean success rate from 43.4% to 75.1%, compared with 61.4% for $π_{0.5}$. These results show that cross-model prediction discrepancy can provide useful feedback for improving robot policies under the evaluated manipulation tasks. Website: https://imagine-to-achieve.github.io/
- Abstract(参考訳): 世界行動モデルは、将来の視覚的な観察とロボットのアクションを共同で予測することができる。
しかし、視覚的な予測と、生成された行動によって引き起こされる結果の間には相違がある可能性がある。
We observed that WAMs can be generated visually plausible task-completion outcomes before produce action sequences that ensureably achieved it。
そこで本研究では,WAM生成した視覚予測を,直接実行可能な計画ではなく,目標条件の視覚的提案として扱う。
凍結した行動条件付き世界モデルを用いて、行動条件付き結果を予測するとともに、2つの将来の予測の整合性と端末目標との整合性に基づくフィードバックを構築する。
このフィードバックを活用して、私たちは、WAMのアクションヘッドを最適化するためにフローポリシー最適化(FPO)を使用します。
このフレームワークは、オンラインロボットのインタラクションやタスク固有の報酬モデルの追加トレーニングを避ける。
4つの実世界のUR5操作タスクにおいて、平均成功率は43.4%から75.1%に上昇し、平均成功率は61.4%が$π_{0.5}$となった。
これらの結果から,クロスモデル予測の不一致は,評価操作条件下でのロボットのポリシー改善に有用なフィードバックとなることが示唆された。
ウェブサイト:https://imagine-to-achieve.github.io/
関連論文リスト
- Dynin-Robotics: Omnimodal Unified Diffusion Vision-Language-Action Model [7.384043308834925]
視覚目標とダイナミックス予測は、目標とする結果とアクションに依存したシーン変化の表現の両方で言語条件のロボットポリシーを提供することができる。
ダイニン・ロボティクスはこの定式化をダイニン・オムニに実装し、言語、視覚的観察、ゴール、アクションを離散トークンとして表現している。
我々は、48のOpen X-Embodimentデータセットから約133万の軌道上でモデルを継続的に事前訓練し、下流ドメインに個別に適応する。
論文 参考訳(メタデータ) (2026-09-11T16:49:26Z) - TrAct: Bridging Robot Control and Visual Prediction with Visual Tracks [22.702826122425268]
制御と予測の中間インタフェースとして視覚トラックを用いた世界モデルに基づくロボット意思決定フレームワークTrActを提案する。
TrActは3つのコンポーネントから構成される: ビジョン・ランゲージ・アクション・アンド・トラックモデル(VLAT)は、現在の観察と言語指導から候補行動と対応する視覚トラックを共同で予測し、トラック条件付き世界モデル(TWM)は、提案されたトラックで条件付けられた将来の視覚結果を予測する。
論文 参考訳(メタデータ) (2026-08-25T06:00:01Z) - From Imagined Futures to Executable Actions: Mixture of Latent Actions for Robot Manipulation [88.39072412680633]
将来の映像を実行可能な表現に変換する制御指向インタフェースであるMoLAを提案する。
我々は,シミュレーションベンチマークと実世界のロボット操作タスクに対するアプローチを評価した。
論文 参考訳(メタデータ) (2026-05-12T14:15:16Z) - When to Trust Imagination: Adaptive Action Execution for World Action Models [42.51856318901667]
世界行動モデル(WAM)は、近ごろ、将来の視覚的観察と将来の行動を共同で予測することによって、ロボット操作のための有望なパラダイムとして登場した。
現在のWAMは、各モデル推論の後、一定の数の予測アクションを実行し、ロボットは、想像された未来が実際の物理的なロールアウトと一致しているかどうかを無視する。
我々は,将来性検証問題として適応型WAM実行を定式化し,WAM予測された未来が信頼性を保ちながらロボットはより長く実行すべきであり,現実が想像力から逸脱した場合にはより早く再計画する。
論文 参考訳(メタデータ) (2026-05-07T13:18:28Z) - Grounded World Model for Semantically Generalizable Planning [94.53923128709965]
我々は、視覚言語対応の潜在空間において、グラウンドドワールドモデル(GWM)を学習する。
提案された各アクションは、タスク命令に対する将来の結果がどの程度近いかに基づいてスコアされる。
提案したWISERベンチマークでは、GWM-MPCはテストセットで87%の成功率を達成した。
論文 参考訳(メタデータ) (2026-04-13T17:25:41Z) - GigaWorld-Policy: An Efficient Action-Centered World--Action Model [50.107640832046464]
GigaWorld-Policyはアクション中心のWAMで、2Dピクセルアクションのダイナミクスを学習し、オプションのビデオ生成で効率的なアクションデコーディングを可能にする。
実世界のロボットプラットフォームでの実験結果によると、GigaWorld-Policyは主要なWAMベースラインであるMotusの9倍高速で動作する。
論文 参考訳(メタデータ) (2026-03-18T00:52:02Z) - GRAPE: Generalizing Robot Policy via Preference Alignment [58.419992317452376]
GRAPE: 優先度アライメントによるロボット政策の一般化について述べる。
GRAPEはドメイン内および未確認操作タスクにおける成功率をそれぞれ51.79%、58.20%向上させる。
GRAPEは安全性や効率、衝突速度の37.44%、ロールアウト長さの11.15%といった様々な目標に合わせることができる。
論文 参考訳(メタデータ) (2024-11-28T18:30:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。