論文の概要: PaCo-VLA: Passivity-Shielded Compliance Prior for Contact-Rich Vision-Language-Action Manipulation
- arxiv url: http://arxiv.org/abs/2606.00515v1
- Date: Sat, 30 May 2026 04:06:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-02 21:34:28.503762
- Title: PaCo-VLA: Passivity-Shielded Compliance Prior for Contact-Rich Vision-Language-Action Manipulation
- Title(参考訳): PaCo-VLA:コンタクトリッチビジョン・ランゲージ・アクション・マニピュレーションに先立つパッシブシールドコンプライアンス
- Abstract要約: コンタクトリッチな操作は、高レベルのセマンティック推論と高周波接触ダイナミクスの安全な制御の両方を要求する。
本稿では,VLAインタフェースを再放送する前,パスティビティ・シールドによるコンプライアンスであるPaCo-VLAを紹介する。
- 参考スコア(独自算出の注目度): 16.000925198937082
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Contact-rich manipulation demands both high-level semantic reasoning and the safe regulation of high-frequency contact dynamics. While Vision-Language-Action (VLA) models provide unprecedented semantic generalization, their low-rate outputs lack the reliability required for direct plant authority in force-sensitive tasks. To bridge this semantic-to-control gap, we introduce PaCo-VLA, a passivity-shielded compliance prior that recasts the VLA interface. Rather than trusting VLAs with direct motor commands, PaCo-VLA treats network outputs as task-level compliance proposals: semantic bindings, task stages, and admittance schedules. A high-frequency, proposal-independent passivity shield governs these proposals through energy-tank accounting and boundary checks, preventing invalid, stale, or unverified model predictions from bypassing low-level contact physics. This decoupled architecture also enables causal evaluation, isolating semantic contributions from geometric shortcuts. Extensive simulated and real-world connector-insertion experiments demonstrate that PaCo-VLA achieves superior precision over unshielded VLA baselines, sustaining zero passivity violations even under adversarial compliance shifts. This framework establishes a provably sampled-passive runtime contract at the admittance port and provides a runtime interface for deploying foundation models in contact-rich domains.
- Abstract(参考訳): コンタクトリッチな操作は、高レベルのセマンティック推論と高周波接触ダイナミクスの安全な制御の両方を要求する。
Vision-Language-Action (VLA) モデルは前例のないセマンティックな一般化を提供するが、その低レートの出力は、力に敏感なタスクにおいて直接的な植物権威に必要な信頼性を欠いている。
このセマンティック・ツー・コントロールのギャップを埋めるために、VLAインターフェースを再キャストするパスティビティ・シールドのコンプライアンスであるPaCo-VLAを導入する。
直接モーターコマンドでVLAを信頼するのではなく、PaCo-VLAはネットワーク出力をセマンティックバインディング、タスクステージ、アクセタンススケジュールといったタスクレベルのコンプライアンス提案として扱う。
高周波、提案非依存の透過性シールドは、これらの提案をエネルギータンクの会計と境界チェックを通じて制御し、無効、古い、または証明されていないモデルの予測が低レベルの接触物理をバイパスすることを防ぐ。
この疎結合アーキテクチャは、幾何学的ショートカットから因果評価、意味的コントリビューションの分離を可能にする。
広範にシミュレーションされた実世界のコネクタ挿入実験により、PaCo-VLAは非シールドVLAベースラインよりも優れた精度を達成し、対向的なコンプライアンスシフトの下でも通過率違反をゼロにすることを示した。
このフレームワークは、アプタンスポートで、実証可能なサンプル-パッシブランタイム契約を確立し、コンタクトリッチドメインに基礎モデルをデプロイするためのランタイムインターフェースを提供する。
関連論文リスト
- CR-VLA-Force: Learning Control-aware Compliance VLA Model for Robust Contact-rich Robotic Manipulation [22.8919569384701]
リアクティブ制御のための制御対応VLAフレームワークを提案する。
CC-VLAモデルは、力信号シーケンスと視覚言語による融合特徴を符号化するために、MoE(Multimodal Mixed-of-experts)を使用する。
CC-VLAは, 力知覚課題の成功率を著しく向上し, 力制御精度の向上を図っている。
論文 参考訳(メタデータ) (2026-09-05T02:54:51Z) - Partial Skeleton Visibility for Action Recognition: A Constrained Field-of-View Approach [60.596944437968524]
partialVisGraphは、制約されたフィールド・オブ・ビューの下で、堅牢なスケルトンベースのアクション認識のための新しいフレームワークである。
部分的な可視性の下では、最先端の精度を一貫して達成し、厳しいFoV制限のあるサブセットでは68.8%まで上昇する。
提案手法は,非拘束環境下でのスケルトンに基づく行動理解を実現するための,原則的かつ実践的な経路を提供する。
論文 参考訳(メタデータ) (2026-07-01T10:03:11Z) - Think Less, Act Early: Reinforced Latent Reasoning with Early Exit in Vision-Language-Action Models [3.4519796338615225]
観測不能な潜伏変数の列として推論をモデル化する新しいVision-Language-Action(VLA)フレームワークを提案する。
本稿では,遅延状態生成を逐次決定プロセスとして扱う強化学習に基づくデノゲーション機構を提案する。
具体化決定ベンチマークの実験により、AVA-VLAは明示的なCoT法よりも6倍の速度アップを達成することが示された。
論文 参考訳(メタデータ) (2026-06-13T04:16:18Z) - VLAConf: Calibrated Task-Success Confidence for Vision-Language-Action Models [7.329348634749636]
本稿では,ビジョン・ランゲージ・アクション(VLA)モデルのための一級識別信頼フレームワークであるVLAConfを提案する。
凍結事前訓練されたVLA内部表現を利用することで、VLAConfは1回の前方通過でステップワイズ異常スコアを直接推定する。
LIBEROベンチマークの実験により、VLAConfはポストホックキャリブレーションのために構築された信頼信号の品質を大幅に向上することが示された。
論文 参考訳(メタデータ) (2026-05-28T08:42:12Z) - VLA-ATTC: Adaptive Test-Time Compute for VLA Models with Relative Action Critic Model [54.35791816657227]
適応型テスト時間計算でVLAモデルを実現するフレームワークである textbfVLA-ATTC' を導入する。
VLA-ATTCは、不確実性に基づく認知クラッチ'を用いて、反射的実行からTTC熟考フェーズへ動的に移行する。
LIBERO-LONGベンチマークでは、VLA-ATTCはSOTAモデルPI0.5の故障率を50%以上削減する。
論文 参考訳(メタデータ) (2026-05-02T02:13:11Z) - AIVV: Neuro-Symbolic LLM Agent-Integrated Verification and Validation for Trustworthy Autonomous Systems [6.586256098975453]
Agent-Integrated Verification and Validation (AIVV)は,大規模言語モデル(LLM)を検討外ループとしてデプロイするハイブリッドフレームワークである。
評議会代理人は、あいまいさと真の失敗を意味的に検証することで協調的な検証を行う。
無人水中車両(UUV)の時系列シミュレータの実験では、AIVがHITL V&Vプロセスのデジタル化に成功した。
論文 参考訳(メタデータ) (2026-04-02T19:25:18Z) - DualCoT-VLA: Visual-Linguistic Chain of Thought via Parallel Reasoning for Vision-Language-Action Models [50.07453075750711]
VLA(Vision-Language-Action)モデルは、視覚的な観察と言語指示を直接ロボット行動にマッピングする。
近年の取り組みは、行動能力の前に思考でVLAモデルを育むために、Chain-of-Thought (CoT)推論を取り入れている。
並列推論機構を持つVLAモデルの視覚言語的CoT法であるDualCoT-VLAを提案する。
論文 参考訳(メタデータ) (2026-03-23T17:59:25Z) - Enabling Dynamic Tracking in Vision-Language-Action Models via Time-Discrete and Time-Continuous Velocity Feedforward [11.066720921275648]
視覚言語アクション(VLA)モデルは、ロボット操作に非常に有望である。
厳格な産業用ロボットへの展開は、コンプライアンスと応答性の本質的にのトレードオフのため、依然として困難である。
本稿では、このトレードオフを解決するために、速度フィードフォワード項をVLAポリシーに統合することの重要性を示す。
論文 参考訳(メタデータ) (2026-03-17T07:50:00Z) - VISA: Value Injection via Shielded Adaptation for Personalized LLM Alignment [24.492954219955788]
細調整と大言語モデル(LLM)のトレードオフをナビゲートするクローズドループフレームワークを提案する。
VISAは高精度な値検出器、セマンティック・ツー・バリュー・トランスレータ、コア・バリュー・リライターを備えている。
実験により,本手法は,実際の一貫性と汎用性を保ちながら,モデルの値表現を正確に制御できることが実証された。
論文 参考訳(メタデータ) (2026-03-05T05:12:26Z) - OmniVL-Guard: Towards Unified Vision-Language Forgery Detection and Grounding via Balanced RL [63.388513841293616]
既存の偽造検出手法は、現実世界の誤報に多いインターリーブされたテキスト、画像、ビデオを扱うのに失敗する。
このギャップを埋めるため,本論文では,オムニバス・ビジョン言語による偽造検出と接地のための統一フレームワークの開発を目標としている。
我々は、OmniVL-Guardという、オムニバス視覚言語による偽造検出と接地のためのバランスの取れた強化学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-11T09:41:36Z) - Latent Reasoning VLA: Latent Thinking and Prediction for Vision-Language-Action Models [69.58413440457828]
VLA(Vision-Language-Action)モデルは、チェーン・オブ・思想(CoT)推論の恩恵を受けるが、既存のアプローチでは高い推論オーバーヘッドが生じる。
本稿では,マルチモーダル CoT 推論を具体化するための連続潜時表現に内包する統合 VLA フレームワークである Latent Reasoning VLA (textbfLaRA-VLA) を提案する。
論文 参考訳(メタデータ) (2026-02-01T11:34:37Z) - CompliantVLA-adaptor: VLM-Guided Variable Impedance Action for Safe Contact-Rich Manipulation [35.15898666328117]
本稿では,視覚言語モデル (VLM) を用いた最先端のビジョン・ランゲージ・アクション (VLA) モデルを拡張した CompliantVLA-adaptor を提案する。
既存のVLAシステム(例えば、RTT、Pi0.5、OpenVLA-oft)は典型的には出力位置を出力するが、力覚的な適応が欠如しており、接触、コンプライアンス、不確実性を含む物理的タスクにおいて、安全でないまたは失敗した相互作用をもたらす。
我々の手法はVLAのベースラインよりも複雑なコンタクトリッチなタスクのスイートの方が優れていることを実証する。
論文 参考訳(メタデータ) (2026-01-21T23:52:40Z) - IntentionVLA: Generalizable and Efficient Embodied Intention Reasoning for Human-Robot Interaction [51.130510883952546]
Vision-Language-Action(VLA)モデルは、事前訓練された視覚言語モデル(VLM)を活用して、ロボット制御との認識を両立させる。
カリキュラム学習パラダイムと効率的な推論機構を備えたVLAフレームワークである textbfIntentionVLA を提案する。
提案手法はまず,意図推論,空間的接地,コンパクトな具体的推論を組み合わせ,慎重に設計した推論データを活用する。
論文 参考訳(メタデータ) (2025-10-09T04:49:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。