論文の概要: Completion Aware Guidance for World Action Models
- arxiv url: http://arxiv.org/abs/2610.01559v1
- Date: Thu, 01 Oct 2026 12:27:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:24.11061
- Title: Completion Aware Guidance for World Action Models
- Title(参考訳): 世界行動モデルのための完成度保証
- Abstract要約: 世界行動モデル(WAM)は、視覚的未来とロボット行動を予測するが、タスク不完全な想像力に影響を受けない。
本稿では,この故障は世界モデルバックボーンに固有のものではなく,短絡制御に適応した場合に現れることを示す。
Aware Completion Guidance (CAG) は,タスク完了に向けて生成を誘導する訓練不要サンプリング手法である。
- 参考スコア(独自算出の注目度): 31.276475913209925
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: World Action Models (WAMs) predict visual futures and robot actions, yet they remain susceptible to task-incomplete imagination, where plausible, action-consistent predictions omit the transition needed for task completion. In this paper, we show that this failure is not inherent to the world model backbone, but emerges when adapted for short-chunk control, which can repeatedly favor plausible local continuations over task-completing transitions. To address this, we introduce Completion Aware Guidance (CAG), a training-free sampling method that guides generation toward task completion. Across representative WAMs, CAG improves success from 64% to 70% on a RoboTwin 2.0 subset and from 69% to 75% in zero-shot simulation, while reducing task-incomplete imagination from 79% to 40%.
- Abstract(参考訳): 世界行動モデル(WAM)は視覚的な未来とロボットの行動を予測するが、タスク不完全な想像力に影響を受けない。
本稿では,この障害は世界モデルバックボーンに固有のものではなく,タスク補完トランジションに対して妥当な局所的継続を繰り返すショートチャンク制御に適用した場合に現れることを示す。
そこで本研究では,タスク完了に向けて生成を誘導するトレーニング不要サンプリング手法であるCompletion Aware Guidance (CAG)を紹介する。
代表的WAM全体で、CAGはRoboTwin 2.0サブセットで64%から70%に、ゼロショットシミュレーションで69%から75%に改善し、タスク不完全なイマジネーションを79%から40%に削減した。
関連論文リスト
- The Planning Limits of Latent World Models [27.2709460237741]
5つの凍結した自己教師付き視覚バックボーン上に構築された動作条件付き予測器を使用する。
私たちは、世界モデルが、ゴールが計画中に想定される軌道内にあるとき、あるいは少し先にあるときのみ、アクションの選択を確実に導くことに気付きました。
論文 参考訳(メタデータ) (2026-09-30T08:05:32Z) - EVO-WAM: Evolving World Action Models through Video-Action Verification [51.68210232964847]
EVO-WAMは、自身の生成したビデオアクション軌跡から学習することで、WAMを見えないタスクに適応するフレームワークである。
コスモス3の平均成功率は20.0%から76.7%に改善され、56.7%となった。
論文 参考訳(メタデータ) (2026-09-29T17:25:35Z) - Zero-WAM: In-Context World-Action Modeling from Human Videos for Open-Ended Task Generalization [66.06331553787281]
テキスト内ビデオガイダンスに従うことで、見知らぬタスクを実行する因果的ビデオアクションモデルであるZero-WAMを提案する。
我々はまた、8.6Kタスクにまたがる74.2Kの人間ロボットICLペアのデータセットであるHumanGenを提示する。
RoboTwin 2.0シミュレーションの7つの目に見えないタスクにおいて、Zero-WAMは47.0%の平均的な成功率を達成する。
論文 参考訳(メタデータ) (2026-08-26T17:59:34Z) - HarnessWAM: Bridging Prediction and Deliberation in World Action Models [39.20825071922887]
World Action Models (WAM) は、環境力学とロボットの動作を共同で学習し、身体的制御に物理的進化の先行を取り入れている。
本稿では,WAMの予測・検討ギャップに対処するため,WAMのエージェントフレームワークであるHarnessWAMを提案する。
我々は、HarnessWAMがRoboMemArenaで59.6%、69.9%、RoboCerebra Idealで23.7%、最先端のフルタスクとサブタスクの成功率を達成したことを示す。
論文 参考訳(メタデータ) (2026-08-10T12:15:59Z) - Learning from Failure: Inference-Time Self-Improvement for Computer-Use Agents [80.03824805228719]
コンピュータ利用エージェントを開発する上での大きな課題は、大規模で高品質な軌道を収集することである。
我々は、失敗した軌道をエージェント改善に変換するデータ中心のパラダイムを提案する。
この手法をOSWorldベンチマーク上で,最先端のOpenCUA-72Bモデルを用いて検証する。
論文 参考訳(メタデータ) (2026-06-30T07:44:37Z) - Exposing Limitations of Language Model Agents in Sequential-Task Compositions on the Web [69.6913064185993]
言語モデルエージェント(LMA)は、ミューティステップ決定タスクにおける有望なパラダイムとして登場した。
約束にもかかわらず、現実世界のアプリケーションでの彼らのパフォーマンスはまだ過小評価されている。
既存のLMAはベースタスクで平均94.0%の成功率を達成したが、その性能は構成タスクで平均24.9%に低下した。
論文 参考訳(メタデータ) (2023-11-30T17:50:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。