論文の概要: PALM: Progress-Aware Policy Learning via Affordance Reasoning for Long-Horizon Robotic Manipulation
- arxiv url: http://arxiv.org/abs/2601.07060v1
- Date: Sun, 11 Jan 2026 21:00:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-23 08:17:40.734977
- Title: PALM: Progress-Aware Policy Learning via Affordance Reasoning for Long-Horizon Robotic Manipulation
- Title(参考訳): PALM:長軸ロボットマニピュレーションのためのAffordance Reasoningによるプログレッシブ・アウェア・ポリシー学習
- Abstract要約: PALMは、インタラクション中心のアベイランス推論とサブタスクプログレスキューに関するポリシー学習を構築する。
Palmはシミュレーションや実世界の実験において、一貫してベースラインを上回っている。
- 参考スコア(独自算出の注目度): 27.791908160098625
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent advancements in vision-language-action (VLA) models have shown promise in robotic manipulation, yet they continue to struggle with long-horizon, multi-step tasks. Existing methods lack internal reasoning mechanisms that can identify task-relevant interaction cues or track progress within a subtask, leading to critical execution errors such as repeated actions, missed steps, and premature termination. To address these challenges, we introduce PALM, a VLA framework that structures policy learning around interaction-centric affordance reasoning and subtask progress cues. PALM distills complementary affordance representations that capture object relevance, contact geometry, spatial placements, and motion dynamics, and serve as task-relevant anchors for visuomotor control. To further stabilize long-horizon execution, PALM predicts continuous within-subtask progress, enabling seamless subtask transitions. Across extensive simulation and real-world experiments, PALM consistently outperforms baselines, achieving a 91.8% success rate on LIBERO-LONG, a 12.5% improvement in average length on CALVIN ABC->D, and a 2x improvement over real-world baselines across three long-horizon generalization settings.
- Abstract(参考訳): 視覚言語アクション(VLA)モデルの最近の進歩はロボット操作において有望であることを示しているが、長い水平・多段階のタスクに苦戦し続けている。
既存のメソッドには、タスク関連インタラクションのキューを識別したり、サブタスク内で進捗を追跡できる内部推論機構が欠如しており、繰り返しアクションや失敗ステップ、早期終了といった致命的な実行エラーにつながる。
これらの課題に対処するために,対話中心のアベイランス推論とサブタスクプログレスキューを中心とした政策学習を構築するVLAフレームワークであるPALMを紹介した。
PALMは、オブジェクトの関連性、接触幾何学、空間配置、運動力学をキャプチャする補完的な空白表現を蒸留し、ビジュモータ制御のためのタスク関連アンカーとして機能する。
長期実行をさらに安定させるために、PALMは連続的なサブタスク内進行を予測し、シームレスなサブタスク遷移を可能にする。
CALVIN ABC->Dの平均長を12.5%改善し、3つの長距離一般化設定で現実世界のベースラインを2倍改善した。
関連論文リスト
- Beyond Flat Policies: Hierarchical Post-Training for Embodied Agents in Robotic Manipulation [34.87301719899886]
視覚言語アクション(VLA)モデルは、事前訓練された視覚言語モデルを活用することで、ロボット操作において顕著な能力を示した。
既存のポストトレーニング手法は、主にVLAモデルをフラットポリシーとして最適化し、タスクの進行を明示的にモデル化し、堅牢な長距離操作を行うのが困難である。
階層型ロボット制御(HiRoC)は,ハイレベルなタスク計画と低レベルなアクション実行を分離する階層型ポストトレーニングフレームワークである。
論文 参考訳(メタデータ) (2026-08-06T13:07:56Z) - HIPIF: Hierarchical Planning and Information Folding for Long-Horizon LLM Agent Learning [51.95194664412812]
大規模言語モデル(LLM)は、幅広いタスクにまたがる自律エージェントとして強力な能力を示している。
長期LLMエージェント学習のための階層的計画と情報フォールディング(HIPIF)を提案する。
HIPIFはエージェントをエンドツーエンドにトレーニングし、明示的なサブゴールの周りに長い水平実行を組織すると同時に、完了したサブゴール履歴を折り畳み、長いコンテキスト干渉を減らす。
論文 参考訳(メタデータ) (2026-06-09T07:35:14Z) - PHASER: Phase-Aware and Semantic Experience Replay for Vision-Language-Action Models [34.954808072081676]
本稿では,アーキテクチャに依存しない連続学習フレームワークPHASERを紹介する。
フェーズRは、すべてのサブスキルに等しいメモリサポートを保証するために、フェーズ中心のキャパシティアロケーションを使用する。
また、教師なし動作信号変化点検出とVLMに基づくセマンティック検証を組み合わせた軽量パイプラインであるAuto-PCを統合する。
論文 参考訳(メタデータ) (2026-06-02T13:04:15Z) - Make Your VLA More Robust Without More Data By Interleaving Motion Planning [3.8626902908968863]
本稿では、モデルに基づくモーションプランニングをVisionLanguageAction(VLA)モデルと統合し、さらなるトレーニングをすることなくロバスト性を改善するフレームワークを提案する。
BEHAVIOR-1Kベンチマークに対する我々のアプローチを評価し,トップエンド対エンドのVLAベースライン上でのタスク進捗を113%改善したことを示す。
論文 参考訳(メタデータ) (2026-05-31T03:52:53Z) - ProgVLA: Progress-Aware Robot Manipulation Skill Learning [13.001629637153583]
本稿では,厳密な計算およびメモリ予算下でのロボット操作のための,コンパクトな視覚言語アクション(VLA)モデルであるProgVLAを提案する。
2段階のPerceiver再サンプリングスキームを持つマルチモーダルエンコーダは、可変長の視覚、言語、固有受容ストリームを、制御可能なコンテキストトークンの固定セットに圧縮する。
前進ヘッドの補助セットは、オフラインの強化学習目標を用いて訓練され、正規化された残地目標に対する批判を共同で学習する。
論文 参考訳(メタデータ) (2026-05-27T09:44:46Z) - PRTS: A Primitive Reasoning and Tasking System via Contrastive Representations [66.94988600664574]
我々は,目標達成型強化学習を通じて事前学習を再構築するVLA基盤モデルであるtextbfPRTS(textbfPrimitive textbfReasoning and textbfTasking textbfSystem)を提案する。
論文 参考訳(メタデータ) (2026-04-30T06:14:02Z) - Long-Horizon Manipulation via Trace-Conditioned VLA Planning [55.80061850746898]
LoHo-Manipは、短い水平VLA実行を専用のタスク管理VLMを介して長い水平命令にスケールするフレームワークである。
LoHo-Manipは、サブタスクシーケンスと明示的な完了+残り分割を軽量言語メモリとして組み合わせた、進捗対応の残計画を予測する。
実行器VLAは、レンダリングされたトレースの条件に適合し、長い水平決定を繰り返しローカル制御に変換する。
論文 参考訳(メタデータ) (2026-04-23T17:59:04Z) - ProgressVLA: Progress-Guided Diffusion Policy for Vision-Language Robotic Manipulation [57.07494675832939]
ロボット操作のための既存の視覚言語アクション(VLA)モデルは、進歩意識を欠いている。
本研究では,textbf vla という新しいモデルを提案し,タスク進捗の推定と統合について検討する。
CALVINとLIBEROベンチマークの実験は、実世界のロボットの展開とともに、成功率の大幅な改善を一貫して示している。
論文 参考訳(メタデータ) (2026-03-29T12:38:11Z) - RoboClaw: An Agentic Framework for Scalable Long-Horizon Robotic Tasks [28.827331437876452]
データ収集、ポリシー学習、タスク実行を単一のVLM駆動コントローラで統合するエージェントロボットフレームワークであるRoboClawを提案する。
ポリシーレベルでは、RoboClaw氏はEntangled Action Pairs(EAP)を紹介している。
デプロイ中、同じエージェントが高レベルの推論を行い、学習されたポリシープリミティブを動的にオーケストレーションして長期のタスクを遂行する。
論文 参考訳(メタデータ) (2026-03-12T05:22:59Z) - Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation [95.89924101984566]
GPM(Global Prior Memory)とLCM(Local Consistency Memory)を備えたデュアルメモリVLAフレームワークOptimusVLAを紹介する。
GPMはガウスノイズを意味論的に類似した軌道から取得したタスクレベルの先行値に置き換える。
LCMは、時間的コヒーレンスと軌道の滑らかさを強制する学習された一貫性制約を注入する。
論文 参考訳(メタデータ) (2026-02-22T15:39:34Z) - EVOLVE-VLA: Test-Time Training from Environment Feedback for Vision-Language-Action Models [57.75717492488268]
VLA(Vision-Language-Action)モデルは、大きな言語モデルを活用することで高度なロボット操作を行う。
Supervised Finetuning (SFT) では、タスク毎の数百のデモ、厳格に軌跡を記憶すること、デプロイメント条件がトレーニングから逸脱したときに適応できないことなどが求められている。
EVOLVE-VLA(EVOLVE-VLA)は、VLAが最小またはゼロのタスク固有のデモで環境相互作用を通じて継続的に適応できるテストタイムトレーニングフレームワークである。
論文 参考訳(メタデータ) (2025-12-16T18:26:38Z) - Learning Affordances at Inference-Time for Vision-Language-Action Models [50.93181349331096]
ロボット工学において、VLA(Vision-Language-Action Model)は複雑な制御タスクを解くための有望な道を提供する。
本稿では,VLAの低レベルポリシーを過去の経験を条件とした高レベルVLMに接続するLITEN(Learning from Inference-Time Execution)を紹介する。
提案手法は,低レベルVLAの計画の生成と実行を行う推論フェーズと,その結果を反映した評価フェーズとを反復する。
論文 参考訳(メタデータ) (2025-10-22T16:43:29Z) - PARL-MT: Learning to Call Functions in Multi-Turn Conversation with Progress Awareness [57.020401590532686]
マルチターン関数呼び出しのためのLLMトレーニングに進捗認識を明示的に組み込むフレームワークであるPARL-MTを導入する。
PARL-MTは既存の手法よりも優れており、堅牢で効率的なマルチターン関数呼び出しの実現における進捗認識の有効性を強調している。
論文 参考訳(メタデータ) (2025-09-27T09:32:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。