FuguReport

Zero-WAM: In-Context World-Action Modeling from Human Videos for Open-Ended Task Generalization

著者 Jiaming Zhou, Qihang Zhang, Gangwei Xu, Cunxin Fan, Yujie Zhao, Ruilin Wang, Yiming Luo, Shuai Yang, Xing Zhu, Yujun Shen, Junwei Liang, Yinghao Xu
所属 Robbyant / The Hong Kong University of Science and Technology (Guangzhou) / The Hong Kong University of Science and Technology
カテゴリ Method / Video Action Modeling / In-context causal modeling from videos, Application / Robotic Task Generalization / Open-ended task execution using video guidance, Evaluation / Task Performance Evaluation / Success rate on unseen RoboTwin tasks
ライセンス CC BY 4.0

Abstractの概要

本論文では、ゼロショットのタスク横断ロボット操作をコンテキスト内学習(in-context learning)の問題として定式化し、展開時に言語だけでなく人間のデモ動画によって未知のタスクを指定する手法を提案しています。著者らは、言語または人間の動画プロンプトを条件として、将来のロボット動画チャンクおよび整合した行動を予測する因果的動画・行動モデル「Zero-WAM」を提案しています。このような学習を拡張可能にするため、8.6Kのタスクにまたがる74.2K組の人間・ロボットのコンテキスト内ペアからなる自動生成データセット「HumanGen」と、タスク単位でサンプリングされたタスクバランス型のロボット事前学習データを導入しました。さらに、既知タスクのロボット履歴からの近道学習を抑制し、人間の動画プロンプトの活用を促進するために、コンテキスト内の将来チャンク予測目的関数を追加しています。

新規性

本研究の独自性は、単一の因果的世界・行動モデル内において、ゼロショットのロボットタスク汎化のためのコンテキスト内タスク指定として人間の動画を利用する点にあります。また、意味的に一致した大規模な人間・ロボットのペアを生成する自動パイプラインと、モデルがコンテキスト内動画により依存するように特別に設計された補助的な将来チャンク予測目的関数を導入した点も新規性として挙げられます。

成果

RoboTwin 2.0シミュレーションにおいて、Zero-WAMは7つの未知タスク全体で46.95%の平均成功率を達成し、LingBot-VAを29.50ポイント、Wanベースのベースラインを35.97ポイント上回りました。未知のタスク設定における実世界評価では、物体から容器への配置で53.3%、3つの物体の連続操作で33.3%、2本のテーブル脚の挿入で16.7%の成功率を記録し、これら3つの設定すべてにおいて言語条件付けのLingBot-VAベースラインを上回りました。

論文の注目点

  1. Zero-WAMは、ロボットの学習時に見られなかったタスクへの汎化を目指し、人間のデモ動画をコンテキスト内タスクプロンプトとして条件付けしたロボットの実行を行います。
  2. 本論文では、タスク単位でサンプリングされたロボット軌道を意味的に一致する人間の動画へと自動変換することで構築された、8.6Kのタスクにわたる74.2Kペアのデータセット「HumanGen」を導入しています。
  3. コンテキスト内の将来チャンク予測目的関数とタスクバランス型のロボット事前学習により、7つの未知のRoboTwinタスクにおける46.95%の平均成功率を含む、未知タスク性能の向上が示されています。

参考リンク

このページはGPT-5、Claude Opus 4、Gemini 3、Gemini 3.1 Flash Image 及びその上位バージョンなどの生成AIを用いて作成されています。内容の保証は一切できません。