論文の概要: Zero-WAM: In-Context World-Action Modeling from Human Videos for Open-Ended Task Generalization
- arxiv url: http://arxiv.org/abs/2608.26103v1
- Date: Wed, 26 Aug 2026 17:59:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-27 14:15:16.017973
- Title: Zero-WAM: In-Context World-Action Modeling from Human Videos for Open-Ended Task Generalization
- Title(参考訳): Zero-WAM:オープンエンディングタスク一般化のためのヒューマンビデオからの文脈内ワールドアクションモデリング
- Authors: Jiaming Zhou, Qihang Zhang, Gangwei Xu, Cunxin Fan, Yujie Zhao, Ruilin Wang, Yiming Luo, Shuai Yang, Xing Zhu, Yujun Shen, Junwei Liang, Yinghao Xu,
- Abstract要約: テキスト内ビデオガイダンスに従うことで、見知らぬタスクを実行する因果的ビデオアクションモデルであるZero-WAMを提案する。
我々はまた、8.6Kタスクにまたがる74.2Kの人間ロボットICLペアのデータセットであるHumanGenを提示する。
RoboTwin 2.0シミュレーションの7つの目に見えないタスクにおいて、Zero-WAMは47.0%の平均的な成功率を達成する。
- 参考スコア(独自算出の注目度): 66.06331553787281
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Zero-shot cross-task generalization, where a policy must execute manipulation tasks never seen during training, remains a central challenge in robot learning. In large language models, a novel task can be performed simply by specifying it in the context, without any parameter update. This form of in-context learning (ICL) turns generalization into a problem of task specification. To achieve cross-task generalization, we bring this paradigm to robotic manipulation, and argue that the natural task specification for manipulation is a human video: unlike language, it provides rich visual cues about the intended task evolution. We present Zero-WAM, a causal video-action model that executes unseen tasks by following in-context human video guidance. To address the scarcity of task-rich paired human-robot data, we propose an automatic pipeline that converts task-sampled robot trajectories into semantically matched human videos, yielding HumanGen, a dataset of 74.2K human-robot ICL pairs across 8.6K tasks. For model training, we further introduce an in-context future chunk prediction (IFP) objective that suppresses shortcuts learned from seen tasks and forces the policy to draw task information from the video prompt. On seven unseen tasks in RoboTwin 2.0 simulation, Zero-WAM achieves a 47.0% average success rate, an absolute improvement of 29.5 percentage points over the strongest video-action baseline. In real-world evaluations, it follows human video guidance to generalize to unseen task configurations involving multi-object scenes, long-horizon manipulation, and fine-grained insertion.
- Abstract(参考訳): ゼロショットのクロスタスクの一般化は、トレーニング中に見たことのない操作タスクをポリシーで実行しなければならないが、ロボット学習において依然として中心的な課題である。
大規模言語モデルでは、パラメータを更新することなく、コンテキストで指定するだけで新しいタスクを実行することができる。
この形式でのインコンテキスト学習(ICL)は、一般化をタスク仕様の問題に変える。
クロスタスクの一般化を実現するために、このパラダイムをロボット操作に適用し、操作の自然なタスク仕様は人間のビデオである、と論じる。
テキスト内ビデオガイダンスに従うことで、見知らぬタスクを実行する因果的ビデオアクションモデルであるZero-WAMを提案する。
タスクリッチな人間ロボットデータの不足に対処するため,タスクサンプリングされたロボットの軌跡を意味的に一致した人間のビデオに変換する自動パイプラインを提案し、8.6Kタスクにまたがる74.2Kの人間ロボットICLのデータセットであるHumanGenを得た。
モデルトレーニングでは,対象タスクから学んだショートカットを抑え,ビデオプロンプトからタスク情報を引き出すようポリシーに強制する,コンテキスト内将来のチャンク予測(IFP)の目的も導入する。
RoboTwin 2.0シミュレーションの7つの目に見えないタスクにおいて、Zero-WAMは47.0%の平均的な成功率を達成する。
実世界の評価では、マルチオブジェクトシーン、ロングホライゾン操作、きめ細かい挿入を含む、見えないタスク構成を一般化するためのヒューマンビデオガイダンスに従っている。
関連論文リスト
- Human-to-Robot Interaction: Learning from Video Demonstration for Robot Imitation [5.967530183571141]
人間とロボットの模倣学習パイプラインは、ロボットが非構造化ビデオデモから直接操作スキルを取得することを可能にする。
鍵となる革新は、学習プロセスを2つの異なる段階に分離するモジュラーフレームワークである。
ロボット操作では,全ての動作の平均成功率は87.5%であり,タスク達成で100%,複雑なピック・アンド・プレイス操作で90%に達する。
論文 参考訳(メタデータ) (2026-02-22T13:26:27Z) - Scalable Vision-Language-Action Model Pretraining for Robotic Manipulation with Real-Life Human Activity Videos [42.86535655563404]
我々は、任意の手動ビデオのための完全自動化された総合的人間活動分析手法を開発した。
大量のエゴセントリックなビデオを処理し、100Mエピソードと26Mフレームを含む手動VLAトレーニングデータセットを作成します。
我々は手動VLAモデルアーキテクチャを設計し、このデータセット上でモデルを事前訓練する。
論文 参考訳(メタデータ) (2025-10-24T15:39:31Z) - Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models [49.4824734958566]
カオス・オブ・モダリティ(CoM)は、ビジョン言語モデルがマルチモーダルな人間の実演データを推論することを可能にする。
CoMはタスクプランを洗練し、詳細な制御パラメータを生成し、ロボットは単一のマルチモーダルなヒューマンビデオプロンプトに基づいて操作タスクを実行できる。
論文 参考訳(メタデータ) (2025-04-17T21:31:23Z) - RH20T-P: A Primitive-Level Robotic Dataset Towards Composable Generalization Agents [105.13169239919272]
プリミティブレベルのロボット操作データセットであるRH20T-Pを提案する。
実際のシナリオで67種類の操作タスクをカバーする約38Kのビデオクリップが含まれている。
我々は、計画実行CGAパラダイムを標準化し、RH20T-PにRA-Pと呼ばれる典型的なベースラインを実装します。
論文 参考訳(メタデータ) (2024-03-28T17:42:54Z) - Towards Generalizable Zero-Shot Manipulation via Translating Human
Interaction Plans [58.27029676638521]
我々は、人間の受動的ビデオが、そのようなジェネラリストロボットを学習するための豊富なデータ源であることを示す。
我々は、シーンの現在の画像とゴール画像から将来の手やオブジェクトの設定を予測する人間の計画予測器を学習する。
学習システムは、40個のオブジェクトに一般化する16以上の操作スキルを実現できることを示す。
論文 参考訳(メタデータ) (2023-12-01T18:54:12Z) - Learning Video-Conditioned Policies for Unseen Manipulation Tasks [83.2240629060453]
ビデオ条件付きポリシー学習は、以前は目に見えないタスクの人間のデモをロボット操作スキルにマッピングする。
我々は,現在のシーン観察と対象課題のビデオから適切なアクションを生成するためのポリシーを学習する。
われわれは,多タスクロボット操作環境の課題と,技術面における性能の面から,そのアプローチを検証した。
論文 参考訳(メタデータ) (2023-05-10T16:25:42Z) - Learning Generalizable Robotic Reward Functions from "In-The-Wild" Human
Videos [59.58105314783289]
ドメインに依存しないビデオ識別器(DVD)は、2つのビデオが同じタスクを実行しているかどうかを判断するために識別器を訓練することによりマルチタスク報酬関数を学習する。
DVDは、人間のビデオの広いデータセットで少量のロボットデータから学習することで、一般化することができる。
DVDと視覚モデル予測制御を組み合わせることで、実際のWidowX200ロボットのロボット操作タスクを単一の人間のデモから未知の環境で解決できます。
論文 参考訳(メタデータ) (2021-03-31T05:25:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。