論文の概要: World Action Agent: Harnessing VLMs for Robot Manipulation via World Action Rehearsal
- arxiv url: http://arxiv.org/abs/2609.29964v1
- Date: Thu, 24 Sep 2026 15:19:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 21:10:10.047615
- Title: World Action Agent: Harnessing VLMs for Robot Manipulation via World Action Rehearsal
- Title(参考訳): 世界アクションエージェント:世界アクションリハーサルによるロボット操作のためのハーネスングVLM
- Abstract要約: 汎用視覚言語モデル(VLM)は、ロボット操作に広い知識と空間推論をもたらす。
本稿では、VLMが基本ツールで操縦する多エージェントハーネスであるWorld Action Agent(WAA)を紹介する。
- 参考スコア(独自算出の注目度): 45.2458976067941
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: General-purpose vision-language models (VLMs) bring broad knowledge and spatial reasoning to robot manipulation, yet existing systems either use them indirectly, to predict constraints or write programs, or give them a view of the scene rather than a world in which to act. We present World Action Agent (WAA), a multi-agent harness through which VLMs pilot robots with basic tools, making every decision within a visual action workspace. The workspace has three properties. Contact views, selected automatically from the scene geometry, present the scene around the current interaction. Action rehearsal turns each action into an editable proposal that the agent, alone or through an Imagination Agent, previews and revises against planning feedback before execution. In-view correction closes the loop between observation, rehearsal, and low-level execution, letting the agent remove residual offsets in the view where it observes them. Through the same workspace, WAA acquires embodied procedural knowledge in two ways: it evolves multimodal skills from expert videos and human teaching under evidence-based review and consults them through a Skill Agent, and its interaction traces train smaller VLMs to pilot the same harness. On LIBERO-Pro, WAA with skills evolved only from LIBERO-90 reaches a state-of-the-art 75.6% average success, outperforming end-to-end VLAs, code-as-policy agents, and a visual-harness baseline with the same backbone; the same skills remain effective on robosuite without further learning. Fine-tuning Qwen3.5-9B on harness traces raises its out-of-domain success from 1.7% to 43.3%.
- Abstract(参考訳): 汎用視覚言語モデル(VLM)は、ロボット操作に広い知識と空間的推論をもたらすが、既存のシステムは間接的にそれらを使用したり、制約を予測したり、プログラムを書いたり、あるいは行動する世界ではなくシーンのビューを与える。
我々は、VLMが基本ツールで操縦するマルチエージェントハーネスであるWorld Action Agent(WAA)を紹介し、視覚的なアクションワークスペース内ですべての決定を行う。
ワークスペースには3つの特性がある。
シーン形状から自動的に選択されたコンタクトビューは、現在のインタラクションの周囲のシーンを表示する。
アクションリハーサルは、各アクションを、エージェントが単独またはImagination Agentを通して、実行前に計画されたフィードバックをプレビューし、修正する編集可能な提案に変換する。
インビュー修正は、観察、リハーサル、低レベルの実行の間のループを閉じ、エージェントが観察するビュー内の残留オフセットを除去する。
同じワークスペースを通じて、WAAはプロシージャの知識を2つの方法で取得する: 専門家のビデオと人間による教育からエビデンスベースのレビューに基づいて進化させ、それらをスキルエージェントを通して相談し、その相互作用は小さなVLMを訓練して同じハーネスを操縦する。
LIBERO-Proでは、LIBERO-90から進化したスキルを持つWAAは、平均75.6%の成功に達し、エンド・ツー・エンドのVLA、コード・アズ・ポリティエート、同じバックボーンを持つ視覚的ハーネスベースラインを上回った。
ハーネストレースを微調整したQwen3.5-9Bはドメイン外成功率を1.7%から43.3%に引き上げている。
関連論文リスト
- AR-WAM: A Visual-Conditioned Agent-Ready World Action Model for Robotic Manipulation [31.9606890046955]
視覚-言語-アクションモデルと世界アクションモデルはまだ操作タスクを指定するために自然言語命令に依存している。
本稿では、言語を2つの相補的な条件で置き換える視覚条件付きエージェント対応世界アクションモデルAR-WAMを提案する。
RoboTwin 2.0、RMBench、および本物のAstribot S1デュアルアームプラットフォームでは、AR-WAMは標準操作における最強のベースラインと一致する。
論文 参考訳(メタデータ) (2026-09-20T11:55:26Z) - AffordanceWAM: Affordance-Aware Joint World-Action Modeling for Robot Manipulation [61.436480565887905]
汎用的なロボット操作は、シーンがどのように進化するかを予測する必要がある。
アクションラベル付きロボットビデオは、直接制御を監督するが、コストが高く、多様性に制限がある。
本稿では,Scalr Affordance と Affordance Heatmap によるオブジェクトの空き時間を表す,空き時間を考慮した World Action Model を提案する。
論文 参考訳(メタデータ) (2026-09-16T14:07:06Z) - VIA: Visual Interface Agent for Robot Control [34.69686658431114]
VIA(Visual Interface Agent for Robot Control)は、ロボット制御をエージェントタスクとして再キャストするフレームワークである。
スクリーンショットを撮り、直感的なコマンドを出し、結果を観察し、調整することで、ブラウザベースの3Dインターフェースを介してマニピュレータを駆動する。
3つのLIBEROゴールタスクで96.7%、ロングホライゾン虹組立タスクで100%を達成している。
論文 参考訳(メタデータ) (2026-07-13T05:52:12Z) - World Pilot: Steering Vision-Language-Action Models with World-Action Priors [21.867210989881016]
Vision-Language-Action(VLA)モデルは、大規模な事前トレーニングからセマンティックグラウンドを継承する。
World Pilotは、World-Action Model(WAM)の事前設定でポリシーを強化する
World PilotはLIBERO-PlusゼロショットOODベンチマークで84.7%という最先端のトータル成功率を達成した。
論文 参考訳(メタデータ) (2026-06-10T17:59:08Z) - GEAR-VLA: Learning Geometry-Aware Action Representations for Generalizable Robotic Manipulation [49.16739604572808]
VLA(Vision-Language-Action)モデルは、強力なベンチマークパフォーマンスを実現するが、目に見えないオブジェクトによる現実世界のデプロイに苦労する。
これは、統合幾何認識の操作表現が欠如していることに起因していると我々は主張する。
一般化可能なロボット操作のための統合幾何認識行動表現を学習するためのVLAフレームワークであるGEAR-VLAを提案する。
論文 参考訳(メタデータ) (2026-06-07T09:23:16Z) - Uni-LaViRA: Language-Vision-Robot Actions Translation for Unified Embodied Navigation [60.07205156194741]
身体的なナビゲーションでは、エージェントが言語や視覚的な観察を、実際に見たことのない環境を通して実際のロボットを駆動する空間的な行動の流れにマッピングする必要がある。
統合エージェントアーキテクチャであるUni-LaViRAを4つのタスクファミリと4つの異種実ロボットに拡張する。
論文 参考訳(メタデータ) (2026-05-26T18:52:04Z) - From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data [71.22409934108924]
人間のビデオは豊富で、豊富な相互作用を捉え、現実世界の操作に多様な意味と物理的な手がかりを提供する。
この調査は、人間のビデオがビジョン・ランゲージ・アクション(VLA)モデルの効果的な知識にどのように変換されるか、統一された視点を提供する。
この領域では、非構造化動画をトレーニング可能なエピソードに構造化すること、エンボディメントと視点の不均一性の下でロボットが実行可能なアクションにビデオから制御すること、現実世界の展開性能と転送効率をよりよく予測する評価プロトコルを設計すること、の3つのオープンな課題を強調している。
論文 参考訳(メタデータ) (2026-05-18T06:19:16Z) - See Once, Then Act: Vision-Language-Action Model with Task Learning from One-Shot Video Demonstrations [20.425517993313377]
人間は一度に他人を観察するだけで、新しいスキルを身につけるのに優れた能力を持っている。
テスト時に1つの専門家によるデモビデオから効率的なタスク学習を実現する汎用的なロボット操作ポリシーであるViVLAを提案する。
提案手法は,未確認のLIBEROタスクにおいて30%以上の改善を実現し,クロス・エボディメント・ビデオでは35%以上の向上率を維持している。
論文 参考訳(メタデータ) (2025-12-08T14:25:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。