論文の概要: EmbodiedSkills: A Unified Framework for Orchestrating, Training, and Deploying VLA Agents
- arxiv url: http://arxiv.org/abs/2609.01281v1
- Date: Tue, 01 Sep 2026 14:14:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.724986
- Title: EmbodiedSkills: A Unified Framework for Orchestrating, Training, and Deploying VLA Agents
- Title(参考訳): EmbodiedSkills: VLAエージェントのオーケストレーション、トレーニング、デプロイのための統一フレームワーク
- Authors: Wei Wang, Wenqiao Zhang, Yutong Lin, Yuqian Yuan, Tianwei Lin, Jinhao Mao, Zhenxuan Fan, Mingjian Gao, Yang Dai, Wentong Li, Zheqi Lv, Zheng Dong, Yingjie Niu, Jiaqi Zhu, Jun Xiao, Chao Li, Yueting Zhuang,
- Abstract要約: 視覚言語アクション(VLA)モデルは、視覚観察と言語指示を直接ロボットアクションにマッピングする。
本稿では,各スキル決定を実行提案として扱うフレームワークであるEmbodiedSkillsを提案する。
共有可能スキルインタフェースは、ハイレベルスキル選択、バウンドローレベルVLA実行、ポストアクション検証を接続する。
- 参考スコア(独自算出の注目度): 56.25120535601186
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-language-action (VLA) models map visual observations and language instructions directly to robot actions, but long-horizon tasks require more than action prediction. An agent must coordinate perception, planning, execution, progress verification, and recovery as the physical state evolves. An action prediction or a model-generated skill decision does not, by itself, guarantee that the proposed operation is valid in the current state or that its outcome will be verified. We propose EmbodiedSkills, a unified framework that treats each skill decision as an execution proposal: the runtime checks its prerequisites before execution and verifies the outcome afterward. A shared executable-skill interface connects high-level skill selection, bounded low-level VLA execution, and post-action verification within a single agent loop. Because this interface remains fixed, low-level VLA policies can be replaced or adapted without changing the agent loop. The interface also records planning, execution, verification, and recovery events as structured trajectories, which provide supervision for individual components and can support optional online adaptation when interactive feedback is available. We instantiate EmbodiedSkills with Qwen3-VL and OpenPI/pi0.5 on RoboTwin 2.0 and LIBERO. Task-adapted low-level VLA policies achieve an average success rate of 86.20% across 50 RoboTwin 2.0 tasks and 97.40% across the four LIBERO suites. These results establish the execution performance of the task-adapted low-level VLA policies used in EmbodiedSkills. On four memory-dependent RMBench tasks, the same task-adapted execution approach achieves 12.5% average success. The framework provides a trainable and inspectable agent layer for turning these policies into closed-loop embodied systems.
- Abstract(参考訳): 視覚言語アクション(VLA)モデルは、視覚的な観察と言語指示を直接ロボットの動作にマッピングするが、長距離タスクはアクション予測以上のものを必要とする。
エージェントは、物理的な状態が進化するにつれて、認識、計画、実行、進捗検証、回復を調整する必要がある。
アクション予測やモデル生成スキル決定は、それ自体、提案された操作が現在の状態で有効であるか、あるいはその結果が検証されることを保証しない。
EmbodiedSkillsは,各スキル決定を実行提案として扱う統合フレームワークである。ランタイムは実行前にその前提条件をチェックし,その後の結果を検証する。
共有実行可能スキルインタフェースは、高いレベルのスキル選択、境界付き低レベルのVLA実行、シングルエージェントループ内のポストアクション検証を接続する。
このインターフェースは固定されているため、エージェントループを変更することなく、低レベルのVLAポリシーを置き換えたり、適応したりすることができる。
インターフェースはまた、計画、実行、検証、リカバリイベントを構造化されたトラジェクトリとして記録し、個々のコンポーネントの監視を提供し、インタラクティブなフィードバックが利用可能であれば、オプションでオンライン適応をサポートする。
我々は、RoboTwin 2.0とLIBERO上で、Qwen3-VLとOpenPI/pi0.5でEmbodiedSkillsをインスタンス化する。
タスク適応型低レベルVLAポリシーは、50のRoboTwin 2.0タスクで86.20%、4つのLIBEROスイートで97.40%という平均的な成功率を達成する。
これらの結果は、EmbodiedSkillsで使用されるタスク適応型低レベルVLAポリシーの実行性能を確立する。
4つのメモリ依存型RMBenchタスクでは、同じタスク適応型実行アプローチが平均12.5%の成功を達成している。
このフレームワークは、これらのポリシーをクローズドループの実施システムに変換するための訓練可能で検査可能なエージェント層を提供する。
関連論文リスト
- Rethink Before You Execute: Adaptive Execution for World Action Models [29.76405877028887]
世界行動モデルは、将来の行動と環境の進化を共同で予測する。
この固定された実行の地平線は実行のダイナミクスとあまり一致していないと我々は主張する。
WAMのための軽量なプラグアンドプレイ実行方式であるTempoWAMを提案する。
論文 参考訳(メタデータ) (2026-08-10T11:59:42Z) - Beyond Flat Policies: Hierarchical Post-Training for Embodied Agents in Robotic Manipulation [34.87301719899886]
視覚言語アクション(VLA)モデルは、事前訓練された視覚言語モデルを活用することで、ロボット操作において顕著な能力を示した。
既存のポストトレーニング手法は、主にVLAモデルをフラットポリシーとして最適化し、タスクの進行を明示的にモデル化し、堅牢な長距離操作を行うのが困難である。
階層型ロボット制御(HiRoC)は,ハイレベルなタスク計画と低レベルなアクション実行を分離する階層型ポストトレーニングフレームワークである。
論文 参考訳(メタデータ) (2026-08-06T13:07:56Z) - PhyAgentOS: A Self-Evolving Operating System for Embodied Agents with Decoupled Cognitive Planning and Physical Execution [49.776611937968]
我々は、スケジューリング、検証、メモリ、ベンチマーク、安全性をシステムレベルのサービスとして提供するPhyAgentOSを紹介します。
セッション中心のセッションは、スケジューリング、互換性、監督された実行、エビデンス収集、受け入れの最小単位として、アクションではなくセッションを扱う。
SessionVerifierは、実行終了とセマンティックタスク完了を、成功、失敗、または再計画のエビデンスに基づいて判断する。
ベンチマークはデプロイメントセッションと検証パスを再利用するので、結果は実際の実行に遡る。
論文 参考訳(メタデータ) (2026-07-18T04:46:53Z) - Cortex: A Bidirectionally Aligned Embodied Agent Framework for Long-horizon Manipulation [40.0334846364089]
VLA(Vision-Language-Action)モデルは、マルコフの自然が現在の観測にのみ依存するため、長い水平課題に苦しむ。
我々は,高レベルなVLMから低レベルなVLAへ,実行可能かつトラクタブルなサブタスクプランを伝達するフレームワークであるCortexを紹介する。
これにより、4k時間以上のオープンソースビデオデータの自動アノテーションと30時間のシミュレーションデータを生成することができる。
論文 参考訳(メタデータ) (2026-07-06T17:55:05Z) - PRTS: A Primitive Reasoning and Tasking System via Contrastive Representations [66.94988600664574]
我々は,目標達成型強化学習を通じて事前学習を再構築するVLA基盤モデルであるtextbfPRTS(textbfPrimitive textbfReasoning and textbfTasking textbfSystem)を提案する。
論文 参考訳(メタデータ) (2026-04-30T06:14:02Z) - Goal2Skill: Long-Horizon Manipulation with Adaptive Planning and Reflection [15.30405243180468]
長い水平な操作タスクには、永続的なメモリ、適応的なタスクの分解、実行障害からの明示的な回復が必要である。
本フレームワークは,低レベルモータ実行から高レベルセマンティック推論を明示的に分離する。
VLMベースのエージェントモジュールとして実装された高レベルプランナは、構造化されたタスクメモリを維持している。
低レベルエグゼキュータは、VLAベースのビジュモータコントローラとしてインスタンス化され、各サブタスクを実行する。
論文 参考訳(メタデータ) (2026-04-15T14:53:09Z) - Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation [95.89924101984566]
GPM(Global Prior Memory)とLCM(Local Consistency Memory)を備えたデュアルメモリVLAフレームワークOptimusVLAを紹介する。
GPMはガウスノイズを意味論的に類似した軌道から取得したタスクレベルの先行値に置き換える。
LCMは、時間的コヒーレンスと軌道の滑らかさを強制する学習された一貫性制約を注入する。
論文 参考訳(メタデータ) (2026-02-22T15:39:34Z) - AnyPos: Automated Task-Agnostic Actions for Bimanual Manipulation [24.199522837278128]
本稿では,タスク固有の条件からアクション実行を分離するタスク非依存のアクションパラダイムを提案する。
ATARAはスケーラブルなセルフ教師付きフレームワークで、人間の遠隔操作と比較して30倍以上のコレクションを高速化する。
我々はArm-Decoupled EstimationとDirection-Aware Decoderを備えた逆動的モデルであるAnyPosを提案する。
論文 参考訳(メタデータ) (2025-07-17T03:48:57Z) - Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success [100.226572152954]
視覚言語アクションモデル(VLA)のための最適化された微調整レシピを提案する。
われわれのレシピはOpenVLAの4つのタスクスイートの平均成功率を76.5%から97.1%に引き上げ、アクション生成のスループットを26$times$に向上させた。
実世界の評価において、我々の微調整のレシピにより、OpenVLAはバイマガルALOHAロボット上でデクスタラスで高周波な制御タスクをうまく実行することができる。
論文 参考訳(メタデータ) (2025-02-27T00:30:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。