論文の概要: Co-VLA: Coordination-Aware Structured Action Modeling for Dual-Arm Vision-Language-Action Systems
- arxiv url: http://arxiv.org/abs/2606.20285v1
- Date: Thu, 18 Jun 2026 14:28:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-19 18:23:39.913854
- Title: Co-VLA: Coordination-Aware Structured Action Modeling for Dual-Arm Vision-Language-Action Systems
- Title(参考訳): Co-VLA:デュアルアーム・ビジョン・ランゲージ・アクション・システムのためのコーディネーション・アウェアな構造化行動モデリング
- Authors: Yandong Wang, Jiaqian Yu, Xiongfeng Peng, Lu Xu, Yamin Mao, Weiming Li, Jaewook Yoo, Dongwook Lee, Daehyun Ji, Mingbo Zhao, Chao Zhang,
- Abstract要約: Co-VLAは協調対応のバイマニュアル操作フレームワークである。
動作生成レベルでの明示的な構造を導入する。
実験の結果、Co-VLAはモノリシックベースラインを著しく上回っている。
- 参考スコア(独自算出の注目度): 30.96972509327388
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-language-action (VLA) models show strong capabilities in single and dual-arm robotic manipulation. Prior works show coordinated bimanual behaviors can emerge from end-to-end learning, leveraging large vision-language backbones with continuous action prediction. However, as bimanual tasks become tightly coupled and execution constraints become critical, implicit coordination alone is insufficient to ensure reliable, interpretable, and stable behavior. In this work, we propose Co-VLA, a coordination-aware bimanual manipulation framework introducing explicit structural priors into VLA models. We instantiate our method on a state-of-the-art vision-language backbone by replacing its monolithic action head with a Structured Action Expert (SAE) designed for bimanual coordination. Specifically, we introduce explicit structure at the action generation level with a modular coordination-aware loss that shapes shared and residual latents according to task-specific structures. The shared latent encodes task-level coordination intent, while residual latents capture execution adjustments for each arm. At deployment, a Latent-Aware Controller (LAC) interprets the learned representations to modulate synchronization strength, execution asymmetry, smoothness, and safety constraints in real time. LAC operates at the joint-command level and remains compatible with standard control pipelines without requiring force or impedance control. Experiments across simulation and real-world benchmarks show Co-VLA significantly outperforms monolithic baselines, achieving a 27% success rate gain in tight-coordination tasks, more than doubling performance in OOD real-world scenarios (from 13% to 27%), and reducing task completion time by up to 25%.
- Abstract(参考訳): 視覚言語アクション(VLA)モデルは、シングルアームとデュアルアームのロボット操作において強力な能力を示す。
以前の研究は、協調されたバイマニュアルの振る舞いがエンドツーエンドの学習から生まれる可能性を示し、大きな視覚言語バックボーンと継続的な行動予測を活用する。
しかし、双方向タスクが密結合し、実行制約が重要になるにつれて、暗黙の調整だけで信頼性、解釈可能、安定した動作を保証するには不十分である。
本研究では,協調型双方向操作フレームワークCo-VLAを提案する。
我々は、モノリシックなアクションヘッドを双方向協調用に設計された構造化アクションエキスパート(SAE)に置き換えることで、最先端の視覚言語バックボーン上での手法をインスタンス化する。
具体的には、タスク固有の構造に従って共有および残留潜時を形作るモジュラー協調認識損失を伴う行動生成レベルでの明示的な構造を導入する。
共有潜水器はタスクレベルの調整意図を符号化し、残留潜水器は各アームの実行調整をキャプチャする。
デプロイ時に、LAC(Latent-Aware Controller)は学習した表現を解釈し、同期強度、実行非対称性、滑らかさ、安全性の制約をリアルタイムで変調する。
LACは共同コマンドレベルで動作し、力やインピーダンスの制御を必要とせず、標準的な制御パイプラインと互換性がある。
シミュレーションと実世界のベンチマークによる実験では、Co-VLAはモノリシックなベースラインを著しく上回り、27%の成功率をタイトなコーディネーションタスクで達成し、OODの実世界のシナリオのパフォーマンス(13%から27%)を倍増し、タスク完了時間を最大25%削減した。
関連論文リスト
- RotVLA: Rotational Latent Action for Vision-Language-Action Model [54.22746299071677]
本稿では,連続的な回転潜在動作表現に基づくVLAフレームワークであるRotVLAを紹介する。
潜在作用はSO(n) の元としてモデル化され、連続性、構成性、および実世界の作用力学と整合した構造的幾何学を提供する。
RotVLAはVLMバックボーンとフローマッチングアクションヘッドで構成される。
論文 参考訳(メタデータ) (2026-05-13T11:58:02Z) - Libra-VLA: Achieving Learning Equilibrium via Asynchronous Coarse-to-Fine Dual-System [15.427164345561417]
VLA(Vision-Language-Action)モデルは、汎用的なロボット操作において有望なパラダイムである。
本稿では,新しいデュアルシステムVLAアーキテクチャであるLibra-VLAを紹介する。
当社のアプローチは,オープンワールド操作に対して,スケーラブルで堅牢で応答性の高いソリューションを提供しています。
論文 参考訳(メタデータ) (2026-04-27T19:02:46Z) - DualCoT-VLA: Visual-Linguistic Chain of Thought via Parallel Reasoning for Vision-Language-Action Models [50.07453075750711]
VLA(Vision-Language-Action)モデルは、視覚的な観察と言語指示を直接ロボット行動にマッピングする。
近年の取り組みは、行動能力の前に思考でVLAモデルを育むために、Chain-of-Thought (CoT)推論を取り入れている。
並列推論機構を持つVLAモデルの視覚言語的CoT法であるDualCoT-VLAを提案する。
論文 参考訳(メタデータ) (2026-03-23T17:59:25Z) - Language-Grounded Decoupled Action Representation for Robotic Manipulation [78.42228162226839]
認識と制御を結びつけるために,Language-Grounded Decoupled Action Representation (LaDA) フレームワークを提案する。
LaDAは3つの解釈可能なアクションプリミティブ(翻訳、回転、グリップ制御)の微細な中間層を導入し、低レベルのアクションに対して明示的な意味構造を提供する。
さらに、セマンティックガイダンスによるソフトラベルのコントラスト学習の目的を用いて、類似のアクションプリミティブをタスク間で整列させ、一般化と動きの整合性を高める。
論文 参考訳(メタデータ) (2026-03-13T13:08:26Z) - AR-VLA: True Autoregressive Action Expert for Vision-Language-Action Models [36.00004339916959]
本稿では、連続因果配列として行動を生成するスタンドアロンの自己回帰(AR)アクションエキスパートを提案する。
我々の研究は、スケーラブルでコンテキスト対応のアクション生成スキーマを導入し、効果的なロボットポリシーをトレーニングするための堅牢な構造基盤を提供します。
論文 参考訳(メタデータ) (2026-03-10T18:03:29Z) - Cognition to Control - Multi-Agent Learning for Human-Humanoid Collaborative Transport [36.304887250687536]
本稿では,3層階層構造である認知制御(C2C)について述べる。
協調操作タスクの実験は、単一エージェントとエンドツーエンドのベースラインよりも成功と堅牢性を示す。
論文 参考訳(メタデータ) (2026-03-04T06:24:55Z) - From Knowing to Doing Precisely: A General Self-Correction and Termination Framework for VLA models [42.553888395227766]
本稿では、視覚言語アクション(VLA)モデルのための軽量でトレーニング不要なフレームワークを提案する。
VLA-SCTは自己修正制御ループとして動作し、データ駆動型アクションリファインメントと条件論理を組み合わせて終了する。
本手法は,LIBEROベンチマークのすべてのデータセットに対して一貫した改善を実現する。
論文 参考訳(メタデータ) (2026-02-02T08:44:40Z) - Latent Reasoning VLA: Latent Thinking and Prediction for Vision-Language-Action Models [69.58413440457828]
VLA(Vision-Language-Action)モデルは、チェーン・オブ・思想(CoT)推論の恩恵を受けるが、既存のアプローチでは高い推論オーバーヘッドが生じる。
本稿では,マルチモーダル CoT 推論を具体化するための連続潜時表現に内包する統合 VLA フレームワークである Latent Reasoning VLA (textbfLaRA-VLA) を提案する。
論文 参考訳(メタデータ) (2026-02-01T11:34:37Z) - AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation [21.23747444669735]
VLAモデル(AC2-VLA)に対するアクションコンテキスト対応適応計算を提案する。
AC2-VLAは、タイムステップ間の認識再利用、トークンプルーニング、統一メカニズム内のモデルコンポーネントの選択的な実行を適応的に行う。
ロボット操作ベンチマークの実験では、AC2-VLAはFLOPを29.4%まで減らし、最大1.79倍のスピードアップを達成した。
論文 参考訳(メタデータ) (2026-01-27T14:10:39Z) - IntentionVLA: Generalizable and Efficient Embodied Intention Reasoning for Human-Robot Interaction [51.130510883952546]
Vision-Language-Action(VLA)モデルは、事前訓練された視覚言語モデル(VLM)を活用して、ロボット制御との認識を両立させる。
カリキュラム学習パラダイムと効率的な推論機構を備えたVLAフレームワークである textbfIntentionVLA を提案する。
提案手法はまず,意図推論,空間的接地,コンパクトな具体的推論を組み合わせ,慎重に設計した推論データを活用する。
論文 参考訳(メタデータ) (2025-10-09T04:49:46Z) - HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model [54.64088247291416]
操作ポリシー設計の基本的な目的は、ロボットに人間の指示を理解し、シーンの手がかりを推論し、動的な環境で一般化されたアクションを実行することである。
近年の自己回帰的視覚言語行動(VLA)法は、視覚言語モデル(VLM)から常識推論能力を継承し、次の行動予測を行う。
拡散に基づく行動の連続的な性質と自己回帰の文脈的推論を吸収する統合フレームワークであるHybridVLAを紹介する。
論文 参考訳(メタデータ) (2025-03-13T17:59:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。