論文の概要: Harness VLA: Steering Frozen VLAs into Reliable Manipulation Primitives via Memory-Guided Agents
- arxiv url: http://arxiv.org/abs/2607.08448v3
- Date: Wed, 15 Jul 2026 16:40:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 14:31:40.667658
- Title: Harness VLA: Steering Frozen VLAs into Reliable Manipulation Primitives via Memory-Guided Agents
- Title(参考訳): Harness VLA: メモリガイド剤による冷凍VLAの信頼性向上
- Abstract要約: 本稿では,凍結したVLAを再試行可能なコンタクトリッチプリミティブとして公開するメモリ拡張エージェントフレームワークであるHarness VLAを紹介する。
このフレームワークは、タスク固有の実行トレース、グローバルな成功ルール、障害モデルから、これらの固定プリミティブの動作範囲を学習する。
テーブルトップ、家庭のキッチン、クリーンでランダムなバイマダル操作、ハーネスVLAは最強のベースラインを38.6から25.4ポイント改善している。
- 参考スコア(独自算出の注目度): 23.94713093511847
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Language-conditioned manipulation requires both precise contact-rich control and robust reasoning over language, scenes, and long horizons. End-to-end Vision-Language-Action (VLA) models provide strong local visuomotor skills, but they are trained on in-distribution task trajectories and often fail under deployment perturbations such as semantic retargeting, goal re-binding, spatial-layout shifts, and unstable local contacts. LLM coding agents provide complementary semantic and compositional reasoning, but purely analytic primitives struggle with irregular grasping, constrained placement, and articulated-object interaction. We present Harness VLA, a memory-augmented agentic framework that exposes a frozen VLA as a retryable contact-rich primitive and composes it with a small fixed library of analytic primitives for grounding, staging, transport, navigation, and release. Rather than expanding the skill library, the harness learns the operating range of these fixed primitives from task-specific execution traces, global success rules, and failure models. By lifting semantic re-grounding, non-contact execution, and VLA re-staging to the planner while reserving the frozen VLA for local contact-rich phases, Harness VLA extends pretrained VLAs beyond their original trajectory distribution without finetuning. Across perturbed tabletop, household kitchen, and clean-to-randomized bimanual manipulation, Harness VLA improves over the strongest relevant baselines by 38.6 and 25.4 percentage points on LIBERO-Pro and RoboCasa365, respectively, and reaches 58.4% on RoboTwin C2R.
- Abstract(参考訳): 言語条件による操作は、正確な接触豊富な制御と、言語、シーン、長い地平線に対する堅牢な推論の両方を必要とする。
VLA(End-to-end Vision-Language-Action)モデルは、強力な局所振動子スキルを提供するが、分散タスクトラジェクトリで訓練され、セマンティックリターゲティング、ゴールリバインド、空間的レイアウトシフト、不安定なローカルコンタクトなどのデプロイメントの摂動下で失敗することが多い。
LLMコーディングエージェントは、相補的な意味論的および構成的推論を提供するが、純粋に解析的なプリミティブは、不規則な把握、制約された配置、明瞭なオブジェクト間相互作用に苦しむ。
本稿では,凍結したVLAを再試行可能なコンタクトリッチプリミティブとして公開し,グラウンド,ステージング,トランスポート,ナビゲーション,リリースのための解析プリミティブの小さな固定ライブラリで構成するメモリ拡張エージェントフレームワークであるHarness VLAを紹介する。
スキルライブラリを拡張する代わりに、ハーネスはタスク固有の実行トレース、グローバルな成功ルール、障害モデルから、これらの固定プリミティブの動作範囲を学習する。
局所的な接触豊富な位相で凍結したVLAを保ちながら、セマンティックリグラウンド、非接触実行、VLAをプランナーに再ステージすることで、Harness VLAは、微調整なしで本来の軌跡分布を超えて事前訓練されたVLAを拡張する。
混乱したテーブルトップ、家庭のキッチン、クリーンでランダムなバイマダル操作を含むハーネスVLAは、それぞれLIBERO-ProとRoboCasa365で38.6および25.4ポイント、RoboTwin C2Rで58.4%となっている。
関連論文リスト
- HAF: Adapting Generalist VLAs to Humanoid Whole-Body Loco-manipulation via Hierarchical Action Flow and Spectral Latent RL [56.014913786737104]
本稿では,HAF(Humanoid Adaptation Framework)を導入し,市販の汎用VLAファンデーションモデルをヒューマノイド全体のロコ操作に転送する。
HAF-VLAは、事前訓練されたフローマッチングVLA上に構築された階層型アクションフロージェネレータである。
HaF-Steerは、フローマッチングの可逆性とDCTに基づく次元削減を活用する、オフラインからオフラインまでの潜時パイプラインである。
論文 参考訳(メタデータ) (2026-08-17T17:22:33Z) - ViTaR: Visuo-Tactile Residual Adaptation for Foundation VLA Manipulation [4.374415463111511]
動作生成型知覚入力から実行変調器への触覚フィードバックを再構成するViTaRを提案する。
接点の多い7つのタスクにまたがるUniVTACベンチマークでは、ViTaRは平均61.3%の成功を達成し、凍結したVLAベースよりも30.6ポイント改善された。
論文 参考訳(メタデータ) (2026-08-16T15:46:11Z) - TORL-VLA: Tactile Guided Online Reinforcement Learning for Contact-Rich Manipulation [24.661831588991898]
TORL-VLAは、触覚フィードバックとポリシーの強化を組み合わせた、コンタクトリッチな操作のためのオンライン強化学習フレームワークである。
本手法では, 触覚由来のレンチ認識型VLAを用いて, 参照動作と将来のレンチシーケンスを予測する。
探索的政策と人為的介入の混成データから学習を安定させるために,介入検閲された評論家を紹介する。
論文 参考訳(メタデータ) (2026-06-08T11:05:05Z) - PHASER: Phase-Aware and Semantic Experience Replay for Vision-Language-Action Models [34.954808072081676]
本稿では,アーキテクチャに依存しない連続学習フレームワークPHASERを紹介する。
フェーズRは、すべてのサブスキルに等しいメモリサポートを保証するために、フェーズ中心のキャパシティアロケーションを使用する。
また、教師なし動作信号変化点検出とVLMに基づくセマンティック検証を組み合わせた軽量パイプラインであるAuto-PCを統合する。
論文 参考訳(メタデータ) (2026-06-02T13:04:15Z) - PRTS: A Primitive Reasoning and Tasking System via Contrastive Representations [66.94988600664574]
我々は,目標達成型強化学習を通じて事前学習を再構築するVLA基盤モデルであるtextbfPRTS(textbfPrimitive textbfReasoning and textbfTasking textbfSystem)を提案する。
論文 参考訳(メタデータ) (2026-04-30T06:14:02Z) - AnchorRefine: Synergy-Manipulation Based on Trajectory Anchor and Residual Refinement for Vision-Language-Action Models [60.04879435087352]
視覚言語アクション(VLA)ポリシーは、単一の統一空間内でアクションを生成する。
本稿では,VLAの動作モデリングを軌跡アンカーと残留精細化に分解する階層的フレームワークであるAnchorRefineを提案する。
LIBERO、CALVIN、および実ロボットタスクの実験では、AnchorRefineは回帰ベースと拡散ベースの両方のVLAバックボーンを一貫して改善している。
論文 参考訳(メタデータ) (2026-04-20T04:25:24Z) - Jump-Start Reinforcement Learning with Vision-Language-Action Regularization [1.2599533416395767]
強化学習(RL)は、ロボット操作のための高周波閉ループ制御を可能にする。
現在の制限は、高速かつ正確な操作において直接の使用を妨げる。
探索と学習効率を向上させるために,VLAJS(Vision-Language-Action Jump-Starting)を提案する。
論文 参考訳(メタデータ) (2026-04-15T11:17:54Z) - Towards Human-Like Manipulation through RL-Augmented Teleoperation and Mixture-of-Dexterous-Experts VLA [62.16042475700567]
本稿では,遠隔操作データ収集を簡易化する共有自律型アシスタントIMCopilotを紹介する。
我々は、不均一な力と触覚モーダルを予め訓練されたVLAバックボーンにシームレスに統合するアーキテクチャであるMoDE-VLAを提案する。
我々は,複雑度を増大させる4つの課題に対するアプローチの有効性を検証し,厳密な接触量の多い課題におけるベースラインよりも2倍の成功率の向上を実証した。
論文 参考訳(メタデータ) (2026-03-09T09:02:30Z) - LiLo-VLA: Compositional Long-Horizon Manipulation via Linked Object-Centric Policies [54.150202739999806]
LiLo-VLAは、新しいロングホライゾンタスクに対してゼロショットのモジュラリティをトレーニングすることなく実現できるモジュラーフレームワークである。
LIBERO-Long++とUltra-Longという2つの課題からなる21タスクのシミュレーションベンチマークを導入する。
これらのシミュレーションでは、LiLo-VLAは平均成功率69%を達成し、Pi0.5を41%、OpenVLA-OFTを67%上回った。
論文 参考訳(メタデータ) (2026-02-25T03:33:39Z) - From Knowing to Doing Precisely: A General Self-Correction and Termination Framework for VLA models [42.553888395227766]
本稿では、視覚言語アクション(VLA)モデルのための軽量でトレーニング不要なフレームワークを提案する。
VLA-SCTは自己修正制御ループとして動作し、データ駆動型アクションリファインメントと条件論理を組み合わせて終了する。
本手法は,LIBEROベンチマークのすべてのデータセットに対して一貫した改善を実現する。
論文 参考訳(メタデータ) (2026-02-02T08:44:40Z) - Affordance Field Intervention: Enabling VLAs to Escape Memory Traps in Robotic Manipulation [25.496791183299692]
Affordance Field Intervention (AFI)は、SAFをオンデマンドプラグインとして使用してVLA動作をガイドする軽量なハイブリッドフレームワークである。
VLAバックボーンの平均改善率は23.5%である。
論文 参考訳(メタデータ) (2025-12-08T11:57:13Z) - Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies [62.653984010274485]
VLA(Vision-Language-Action)モデルは、画像や命令をロボットアクションにマッピングするために、大きな視覚言語バックボーンを適応させる。
prevailingAsは、固定された左から右への順序で自動回帰的にアクションを生成するか、バックボーンの外側で分離または拡散ヘッドをアタッチする。
本稿では離散拡散を伴う離散化作用チャンクをモデル化する統一変換器ポリシである離散拡散VLAを提案する。
論文 参考訳(メタデータ) (2025-08-27T17:39:11Z) - Adversarial Attacks on Robotic Vision Language Action Models [118.02118618146568]
視覚言語行動モデル(VLA)に対する敵対的攻撃について検討する。
我々のアルゴリズムの主な貢献は、完全な制御権限を得るためのLLMジェイルブレイク攻撃の適応と応用である。
LLMのジェイルブレイク文学とは大きく異なるのは、現実世界の攻撃は害の概念と意味的に結びついている必要はないからである。
論文 参考訳(メタデータ) (2025-06-03T19:43:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。