論文の概要: Opt2VLA: Force-Aware Vision-Language-Action for Contact-Rich Humanoid Whole-Body Manipulation
- arxiv url: http://arxiv.org/abs/2609.23968v1
- Date: Mon, 21 Sep 2026 00:41:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-24 16:07:41.581169
- Title: Opt2VLA: Force-Aware Vision-Language-Action for Contact-Rich Humanoid Whole-Body Manipulation
- Title(参考訳): Opt2VLA: 接触リッチヒューマノイド全体マニピュレーションのための力覚視覚制御
- Abstract要約: ヒューマノイド全身操作のための力認識型視覚言語アクションフレームワーク Opt2VLA を提案する。
動作のみの制御よりも,Opt2VLAがより正確で一貫した力制御を可能にすることを示す。
- 参考スコア(独自算出の注目度): 33.42088337668233
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Humanoid robots are expected to perform diverse human-level tasks in daily environments, many of which require precise regulation of interaction forces. While recent vision-language-action (VLA) models have shown promise for semantic planning and visuomotor control, existing humanoid systems primarily represent actions through geometric motion goals and rely on whole-body controllers focused on motion tracking, with limited explicit reasoning or control of interaction forces. This limitation is particularly relevant in contact-rich tasks, where geometrically similar motions may require different force regimes depending on the task context and where visual observations may become unreliable after contact. In this work, we present Opt2VLA, a force-aware VLA framework that introduces explicit force commands at the VLA-to-control interface for humanoid whole-body manipulation. A single multi-task VLA policy jointly predicts both geometric motion goals and continuous contact-force references, which are tracked by task-specific reinforcement learning (RL)-based whole-body controllers. To provide scalable and physically grounded supervision, we generate dynamically feasible and contact-consistent training data via whole-body trajectory optimization (TO) with explicit force references. We evaluate Opt2VLA on three contact-rich humanoid tasks and show that explicit force conditioning enables more accurate and consistent force regulation than motion-only control, while physically grounded torque supervision from TO further improves force tracking accuracy and stability. Closed-loop evaluations further demonstrate language-conditioned force modulation with Opt2VLA in simulation and on humanoid hardware.
- Abstract(参考訳): 人間型ロボットは、日々の環境において多様な人間レベルのタスクを実行することが期待されている。
近年の視覚-言語-アクション(VLA)モデルではセマンティック・プランニングと視覚運動制御が期待されているが、既存のヒューマノイド系は主に幾何学的運動目標を通した動作を表現し、モーショントラッキングに焦点を絞った全身制御に頼っている。
この制限は、幾何学的に類似した動きがタスクコンテキストによって異なる力体制を必要とする場合や、接触後に視覚的な観察が信頼できない場合など、接触に富むタスクに特に関係している。
本稿では,人体全体を操作するためのVLA-to-controlインタフェースにおいて,力認識型VLAフレームワークであるOps2VLAを紹介する。
単一のマルチタスクVLAポリシーは、タスク固有強化学習(RL)ベースの全身コントローラによって追跡される幾何学的運動目標と連続接触力参照の両方を共同で予測する。
スケーラブルで物理的に基盤付けられた監視を実現するため,全体軌道最適化(TO)により動的に実現可能かつ接触一貫性のあるトレーニングデータを生成する。
我々は,3つの接触リッチなヒューマノイドタスク上でOpt2VLAを評価し,運動のみの制御よりも明示的な力条件がより正確で一貫した力制御を可能にすることを示す。
クローズドループ評価は、シミュレーションおよびヒューマノイドハードウェア上でのOpt2VLAによる言語条件の強制変調をさらに実証する。
関連論文リスト
- TAO-Force: Unifying Force-Aware Perception and Fast-Slow Control for Contact-Rich Manipulation [8.394835304414192]
本稿では,力覚政策学習と接触制御実行を組み合わせた強制条件付きVLAフレームワークTAO-Forceを提案する。
力覚認識のために、TAO-ForceはF-FiLM(Force-conditioned Feature-wise Linear Modulation)を導入し、凍結した視覚言語バックボーンの表現にエンコードされた力フィードバックを注入する。
応答性制御には、非接触相における名跡軌跡追跡の遅い位置制御分岐と、接触相における物理的相互作用を制御する高速アプタンス制御分岐と、接触ゲート型高速スローアーキテクチャを用いる。
論文 参考訳(メタデータ) (2026-09-16T11:34:45Z) - CR-VLA-Force: Learning Control-aware Compliance VLA Model for Robust Contact-rich Robotic Manipulation [22.8919569384701]
リアクティブ制御のための制御対応VLAフレームワークを提案する。
CC-VLAモデルは、力信号シーケンスと視覚言語による融合特徴を符号化するために、MoE(Multimodal Mixed-of-experts)を使用する。
CC-VLAは, 力知覚課題の成功率を著しく向上し, 力制御精度の向上を図っている。
論文 参考訳(メタデータ) (2026-09-05T02:54:51Z) - VAIC: Vision-Guided Humanoid Agile Object Interaction Control via Decoupled Commands [56.029505206531155]
Vision Guided Agile Interaction Control (VAIC)は、現在のコントローラとヒューマノイドロボットのギャップを埋める統合フレームワークである。
まず、特権教師政策は、正確な物体運動学と正確な環境状態を用いて多様な相互作用スキルを習得する。
第二に、デプロイ可能な学生ポリシーは、全体追跡を複数の軸にまたがる速度目標に置き換えることで、これらの能力を蒸留する。
論文 参考訳(メタデータ) (2026-06-08T09:52:55Z) - ForceVLA2: Unleashing Hybrid Force-Position Control with Force Awareness for Contact-Rich Manipulation [75.39847750457626]
エンドツーエンドの視覚言語アクションフレームワークであるForceVLA2は、ハイブリッドな力配置制御と明示的な力覚を備えたロボットを装備する。
学習と評価を支援するために,5つの接触豊富なタスクに1,000の軌道を含むForceVLA2-Datasetを構築した。
実験により、ForceVLA2は接触リッチな操作における成功率と信頼性を大幅に改善することが示された。
論文 参考訳(メタデータ) (2026-03-16T12:03:58Z) - ULTRA: Unified Multimodal Control for Autonomous Humanoid Whole-Body Loco-Manipulation [55.467742403416175]
本稿では,大規模モーションキャプチャをヒューマノイドに変換する物理駆動型ニューラルネットワークを提案する。
我々は高密度参照とスパースタスク仕様の両方をサポートする統合マルチモーダルコントローラを学習する。
その結果,ULTRAは自我中心の知覚から,自律的,目標条件付き全体ロコ操作に一般化することが示された。
論文 参考訳(メタデータ) (2026-03-03T18:59:29Z) - ForceVLA: Enhancing VLA Models with a Force-aware MoE for Contact-rich Manipulation [62.58034332427291]
ForceVLAは、新しいエンドツーエンド操作フレームワークである。
外部力センシングは、VLAシステム内の第一級のモダリティとして扱う。
論文 参考訳(メタデータ) (2025-05-28T09:24:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。