論文の概要: Never Too Late for Force: Accelerating VLA Post-Training with Reactive Force Injection
- arxiv url: http://arxiv.org/abs/2607.14236v1
- Date: Wed, 15 Jul 2026 18:01:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:32.878664
- Title: Never Too Late for Force: Accelerating VLA Post-Training with Reactive Force Injection
- Title(参考訳): フォースには遅すぎる - リアクティブフォースインジェクションによるVLAポストトレーニングの高速化
- Abstract要約: LIFT (Late Injection of Force for VLA Post-Training) は、事前訓練されたVLAポリシーに接触反応性を追加する、フォース対応のポストトレーニングフレームワークである。
元のアクションエキスパートの横にリアクティブアクションエキスパートを移植し、因果力記憶とゼロdクロスアテンションを通じて最近の6Dエンドエフェクターフォースを注入することで、実行中にアクションをリフレッシュすることができる。
視覚のみのポストトレーニングよりも高速に学習し、パフォーマンスに到達する一方で、リアクティブフォースメモリとオンライン修正データは、堅牢なコンタクトリッチな操作において重要であることを示している。
- 参考スコア(独自算出の注目度): 45.91238887425509
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Pretrained vision-language-action (VLA) policies provide strong language-conditioned manipulation knowledge, but they remain largely vision-driven and can struggle once manipulation enters contact states where the scene is occluded, depth is ambiguous, or small force errors push execution off the offline demonstration distribution. We present LIFT (Late Reactive Injection of Force for VLA Post-Training), a force-aware post-training framework that adds contact reactivity to a pretrained VLA policy while preserving its general manipulation knowledge. LIFT grafts a reactive action expert beside the original action expert, initializes it from pretrained action weights, and injects recent 6D end-effector force through causal force memory and zero-initialized cross attention, enabling actions to be refreshed during execution. To address the policy-dependent distribution shift of contact feedback, LIFT further couples reactive force injection with an online DAgger loop that trains on a mixture of offline task-alignment data and human-corrected online rollouts. Across towel folding, book insertion, and Hanoi ring placement, LIFT learns faster and reaches higher performance than vision-only post-training, while ablations show that reactive force memory and online corrective data are both important for robust contact-rich manipulation. Our code and data will be publicly available.
- Abstract(参考訳): 事前訓練された視覚言語アクション(VLA)ポリシーは、強い言語条件の操作知識を提供するが、それらは主に視覚駆動であり、シーンが閉鎖されたり、深さが曖昧であったり、小さな力によるエラーがオフラインのデモ配信から実行を押し出すような接触状態に入ると、操作が困難になる。
本稿では,VLA後訓練のための遅延反応注入(Late Reactive Injection of Force for VLA Post-Training)について述べる。
LIFTは、元のアクションエキスパートの横にリアクティブアクションエキスパートを移植し、トレーニング済みのアクションウェイトから初期化し、因果力記憶とゼロ初期化クロスアテンションを通じて最近の6Dエンドエフェクター力を注入し、実行中にアクションをリフレッシュすることができる。
接触フィードバックの方針に依存した分散シフトに対処するため、LIFTはさらに、オフラインタスクアライメントデータとヒューマン修正されたオンラインロールアウトの混在をトレーニングするオンラインDAggerループに、リアクティブな力注入を結合する。
LIFTは、タオル折り畳み、本の挿入、ハノイ環の配置において、視覚のみのポストトレーニングよりも高速に学習し、より高いパフォーマンスを達成する。
コードとデータは公開されます。
関連論文リスト
- ReForce: Learning Force-aware Retargeting for Dexterous Manipulation [9.525202879335618]
ReForceは、人間の動きと力を、意図した接触を再現するロボットアクションに変える、フォース対応のリターゲティング手法だ。
オンラインフォース対応の遠隔操作とオフラインデータ変換の両方をサポートする。
紙カップの握りやトング操作といったコンタクトリッチなタスクに対して、力追跡誤差の低減と、より強力なマルチフィンガーコンタクトエンゲージメントを実現する。
論文 参考訳(メタデータ) (2026-08-16T06:13:14Z) - Beyond Implicit Force: Evaluating Explicit Force-Torque Proxies in Action Chunking with Transformers [27.33711271960601]
変圧器を用いたアクションチャンキング (ACT) は, きめ細かい操作において高い性能を示した。
多くのデプロイメントでは、リーダとフォロワの遠隔操作を通じてデモを収集する。
本稿では,ACTの見かけの力覚は,この隠れた相互作用キューに依存するかを検討する。
論文 参考訳(メタデータ) (2026-07-16T05:16:05Z) - TORL-VLA: Tactile Guided Online Reinforcement Learning for Contact-Rich Manipulation [24.661831588991898]
TORL-VLAは、触覚フィードバックとポリシーの強化を組み合わせた、コンタクトリッチな操作のためのオンライン強化学習フレームワークである。
本手法では, 触覚由来のレンチ認識型VLAを用いて, 参照動作と将来のレンチシーケンスを予測する。
探索的政策と人為的介入の混成データから学習を安定させるために,介入検閲された評論家を紹介する。
論文 参考訳(メタデータ) (2026-06-08T11:05:05Z) - FAWAM: Force-Aware World Action Models for Closed-Loop Contact-Rich Manipulation [15.60337615237323]
本稿では,力覚的世界行動モデルであるFAWAMを提案する。
実世界の実験では、FAWAMは視覚のみのベースラインより36.25%、既存のフォース対応ベースラインより21.25%向上している。
論文 参考訳(メタデータ) (2026-06-07T10:26:03Z) - ForceFlow: Learning to Feel and Act via Contact-Driven Flow Matching [53.30290192030814]
ForceFlowは、フローマッチングに基づいて構築された、フォース対応のリアクティブフレームワークである。
ForceFlowは、強力なベースラインであるForceVLAよりも37%の成功率の向上を実現している。
また、接触力の自己調節において、正確な力信号予測と優れた性能を示す。
論文 参考訳(メタデータ) (2026-05-11T13:27:00Z) - ImplicitRDP: An End-to-End Visual-Force Diffusion Policy with Structural Slow-Fast Learning [52.86018040861575]
本稿では,単一のネットワークに視覚計画と反応力制御を統合した,一貫したエンドツーエンドの視覚力拡散政策を提案する。
本稿では,非同期な視覚と力のトークンを同時に処理するための因果的注意力を利用した構造的スローフォールストラーニングを紹介する。
コンタクトリッチタスクの実験では、ImplicitRDPは視覚のみのベースラインと階層的なベースラインの両方で著しく優れていた。
論文 参考訳(メタデータ) (2025-12-11T18:59:46Z) - ForceVLA: Enhancing VLA Models with a Force-aware MoE for Contact-rich Manipulation [62.58034332427291]
ForceVLAは、新しいエンドツーエンド操作フレームワークである。
外部力センシングは、VLAシステム内の第一級のモダリティとして扱う。
論文 参考訳(メタデータ) (2025-05-28T09:24:25Z) - FACTR: Force-Attending Curriculum Training for Contact-Rich Policy Learning [70.65987250853311]
フォースフィードバックは、ほとんどのロボットアームで簡単に利用できるが、遠隔操作や政策学習では一般的には使われない。
本稿では,低コストで直感的で双方向な遠隔操作システムを提案し,従者アームの外部力を教師アームに伝える。
次に、FACTRというカリキュラムを利用した政策学習手法を導入し、学習を通して視覚入力を劣化させ、強度を低下させる。
論文 参考訳(メタデータ) (2025-02-24T18:59:07Z) - Offline-to-Online Reinforcement Learning via Balanced Replay and
Pessimistic Q-Ensemble [135.6115462399788]
深いオフライン強化学習により、オフラインデータセットから強力なロボットエージェントをトレーニングすることが可能になった。
状態-作用分布シフトは、微調整中に厳しいブートストラップエラーを引き起こす可能性がある。
本稿では,オンライン上で遭遇したサンプルを優先しながら,ほぼ政治的なサンプルの使用を奨励するバランスの取れたリプレイ方式を提案する。
論文 参考訳(メタデータ) (2021-07-01T16:26:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。