論文の概要: ARP: Enhancing Quantized Skill Abstractions via Visual Alignment and Iterative Refinement for Robotic Manipulation
- arxiv url: http://arxiv.org/abs/2606.22480v1
- Date: Sun, 21 Jun 2026 12:49:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-25 14:51:20.301632
- Title: ARP: Enhancing Quantized Skill Abstractions via Visual Alignment and Iterative Refinement for Robotic Manipulation
- Title(参考訳): ARP:ロボットマニピュレーションのための視覚的アライメントと反復的リファインメントによる量子スキル抽象化の強化
- Abstract要約: アラインド・リファインメント・ポリシー(ARP)は、実行レベルのリファインメントとセマンティックグラウンドを結合する。
ARPはLIBEROとMeta-Worldベンチマークで最先端のパフォーマンスを達成する。
- 参考スコア(独自算出の注目度): 12.782646427089967
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Learning visuomotor policies for long-horizon manipulation remains a fundamental challenge. Recent skill-based imitation learning methods based on discrete quantization have shown promising results by representing complex behaviors as temporally extended skills. However, most existing approaches primarily encode action trajectories into latent skills, yielding weak visual-semantic grounding and limiting the ability to leverage visual observations for skill selection. Moreover, discrete tokenization inevitably incurs precision errors during continuous action generation. To alleviate these issues, we propose Aligned Refinement Policy (ARP), a discrete-skill framework that couples semantic grounding with execution-level refinement. Specifically, ARP introduces (i) a visual--action alignment objective that contrastively aligns visual embeddings with pre-quantized action representations in a shared latent space while preserving a state-independent skill decoder, and (ii) a lightweight Iterative Residual Head (IRH) that performs a two-step refinement to recover fine-grained control for precise execution. Extensive experiments show that ARP achieves state-of-the-art performance on the LIBERO and Meta-World benchmarks. Moreover, real-robot experiments on the Kuavo 4 Pro humanoid platform further validate its effectiveness, yielding consistent performance gains over several baselines on two challenging manipulation tasks.
- Abstract(参考訳): ロングホライゾン操作のためのビズモータ政策の学習は、依然として根本的な課題である。
離散量子化に基づく近年のスキルベース模倣学習法は、複雑な振る舞いを時間的に拡張したスキルとして表現することで、有望な結果を示している。
しかし、既存のほとんどのアプローチは、主に行動軌跡を潜在スキルにエンコードし、弱い視覚的セマンティックグラウンド化をもたらし、スキル選択に視覚的観察を活用する能力を制限する。
さらに、離散トークン化は、連続的なアクション生成中に必然的に精度エラーを引き起こす。
これらの問題を緩和するため、我々は、個別スキルフレームワークであるアラインド・リファインメント・ポリシー(ARP)を提案する。
特に ARP は
一 状態非依存のスキルデコーダを保ちながら、共有潜在空間において、視覚的埋め込みと予め列挙された行動表現とを対照的に整合させる視覚行動アライメント目標
(II) 厳密な実行のためのきめ細かい制御を回復するために2段階の精錬を行う軽量な反復残差ヘッド(IRH)。
大規模な実験により、ALPはLIBEROとMeta-Worldベンチマークで最先端のパフォーマンスを達成した。
さらに、Kuavo 4 Proのヒューマノイドプラットフォームにおける実ロボット実験は、その効果をさらに検証し、2つの困難な操作タスクに対して、いくつかのベースラインで一貫したパフォーマンス向上をもたらす。
関連論文リスト
- ExToken: Structured Exploration for Efficient Vision-Language-Action Reinforcement Fine-tuning [53.17987412112712]
強化学習(Reinforcement Learning, RL)は、複雑な操作タスクにおけるビジョン・ランゲージ・アクション(VLA)モデルを改善する重要な可能性を示している。
本稿では,現在のVLA-RLフレームワークにおける探索の停滞ボトルネックについて検討する。
本稿では,VLA ポリシーを個別の行動事前に規定する簡易かつ汎用的なフレームワークである RL Exploration Token (ExToken) を紹介する。
論文 参考訳(メタデータ) (2026-07-14T16:04:41Z) - MSACT: Multistage Spatial Alignment for Stable Low-Latency Fine Manipulation [4.439585594082787]
実世界の微視的操作、特に双方向操作では、低レイテンシ制御と安定した視覚的位置決めが必要となる。
ACTのようなアクションチャンキングポリシーは、低レイテンシの実行とデータ効率を可能にするが、空間的一貫性を明示することなく、密集した視覚的特徴に依存している。
安定な2次元アテンションポイントを抽出し,時間的アライメントロスを伴う将来のアテンションシーケンスを共同で予測する多段階空間アテンションモジュールを提案する。
論文 参考訳(メタデータ) (2026-05-01T07:35:15Z) - See, Plan, Rewind: Progress-Aware Vision-Language-Action Models for Robust Robotic Manipulation [59.07792608884117]
本稿では,See, Plan, Rewind (SPR)について紹介する。
SPRは、現在の状態と今後のマイルストーンを見て、次の2Dウェイポイントに向けて軌道を計画し、障害時に回復可能な状態に戻すという、継続的なコアサイクルを通じて運用される。
SPRは、OpenVLA-OFTとUniVLAを上回る最小のパフォーマンス低下で最先端のロバスト性を達成する。
論文 参考訳(メタデータ) (2026-03-10T07:22:51Z) - Act, Think or Abstain: Complexity-Aware Adaptive Inference for Vision-Language-Action Models [7.802379200026965]
認識状態の複雑さに基づいてVLA実行を動的にルーティングする適応型フレームワークを提案する。
我々のアプローチは、VLAの視覚言語バックボーンを、パラメトリックおよび非パラメトリック推定器のアンサンブルに潜伏埋め込みを投影することにより、アクティブな検出ツールに変換する。
論文 参考訳(メタデータ) (2026-03-05T13:14:41Z) - \ extsc{NaVIDA}: Vision-Language Navigation with Inverse Dynamics Augmentation [50.027425808733994]
textscNaVIDAは、ポリシー学習とアクショングラウンドの視覚力学と適応実行を結合した統合VLNフレームワークである。
textscNaVIDAは、チャンクベースの逆ダイナミクスによるトレーニングを強化し、視覚変化と対応するアクションの因果関係を学習する。
実験の結果,textscNaVIDAはパラメータが少ない最先端の手法に比べてナビゲーション性能が優れていることがわかった。
論文 参考訳(メタデータ) (2026-01-26T06:16:17Z) - PosA-VLA: Enhancing Action Generation via Pose-Conditioned Anchor Attention [92.85371254435074]
PosA-VLAフレームワークは、ポーズ条件付き監視を通じて視覚的注意を保ち、タスク関連領域に対するモデルの認識を一貫して導く。
本手法は,多様なロボット操作ベンチマークにおいて,正確かつ時間効率のよい動作を実施できることを示す。
論文 参考訳(メタデータ) (2025-12-03T12:14:29Z) - SemanticVLA: Semantic-Aligned Sparsification and Enhancement for Efficient Robotic Manipulation [65.6201974979119]
本稿では,効率的なロボットマニピュレーションのためのセマンティックスペーシフィケーション・エンハンスメントを実現する新しいVLAフレームワークSemanticVLAを提案する。
SemanticVLAはOpenVLA on LIBEROベンチマークを21.1%上回り、トレーニングコストと推論遅延を3.0倍と2.7倍に削減した。
論文 参考訳(メタデータ) (2025-11-13T17:24:37Z) - Adaptive Residual-Update Steering for Low-Overhead Hallucination Mitigation in Large Vision Language Models [13.32858759983739]
LVLM(Large Vision-Language Models)は、しばしばオブジェクト幻覚に悩まされ、視覚入力と矛盾するテキストを生成する。
この問題を緩和するための既存の推論時間の介入は、難しいトレードオフをもたらします。
本稿では,LVLMを視覚的に生成するフレームワークであるResidual-Update Directed Decoding Regulation(RUDDER)を提案する。
論文 参考訳(メタデータ) (2025-11-13T13:29:38Z) - TD-JEPA: Latent-predictive Representations for Zero-Shot Reinforcement Learning [63.73629127832652]
本稿では,TDに基づく潜在予測表現を教師なしRLに活用するTD-JEPAを紹介する。
TD-JEPAは、明示的な状態とタスクエンコーダ、ポリシー条件付きマルチステップ予測器、パラメータ化されたポリシーのセットを潜時空間で直接訓練する。
実証的には、TD-JEPAは13のデータセットにわたる移動、ナビゲーション、操作のタスクにおいて、最先端のベースラインをマッチまたは上回る。
論文 参考訳(メタデータ) (2025-10-01T10:21:18Z) - CDP: Towards Robust Autoregressive Visuomotor Policy Learning via Causal Diffusion [35.77529453723351]
拡散政策(DP)は、ロボットが行動拡散を通じて専門家のデモンストレーションを模倣することで複雑な行動を学ぶことを可能にする。
本稿では, 過去の行動系列を条件付け, 行動予測を強化するトランスフォーマーに基づく新しい拡散モデルであるCausal Diffusion Policy (CDP)を提案する。
論文 参考訳(メタデータ) (2025-06-17T17:59:12Z) - Visual Prompt Tuning in Null Space for Continual Learning [51.96411454304625]
既存のプロンプトチューニング手法は、継続学習(CL)における印象的な性能を示す。
本稿では,従来のタスクの特徴に代表される部分空間に直交する方向のプロンプトを調整し,各タスクを学習することを目的とする。
実際には、即時勾配予測を実装するために、実効的なヌル空間に基づく近似解が提案されている。
論文 参考訳(メタデータ) (2024-06-09T05:57:40Z) - Sequential Action-Induced Invariant Representation for Reinforcement
Learning [1.2046159151610263]
視覚的障害を伴う高次元観察からタスク関連状態表現を正確に学習する方法は、視覚的強化学習において難しい問題である。
本稿では,逐次動作の制御信号に従うコンポーネントのみを保持するために,補助学習者によってエンコーダを最適化した逐次行動誘発不変表現(SAR)法を提案する。
論文 参考訳(メタデータ) (2023-09-22T05:31:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。