論文の概要: PriGo: Test-Time Primitive Guidance to Diffusion and Flow Policies for Adaptive Robotic Manipulation
- arxiv url: http://arxiv.org/abs/2607.07076v1
- Date: Wed, 08 Jul 2026 07:08:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 22:50:30.310664
- Title: PriGo: Test-Time Primitive Guidance to Diffusion and Flow Policies for Adaptive Robotic Manipulation
- Title(参考訳): PriGo: 適応型ロボットマニピュレーションのための拡散・フローポリシに対する試験時間プライミティブガイダンス
- Abstract要約: PriGoは、堅牢なロボット操作のためのプリミティブ誘導テストタイム適応フレームワークである。
本稿では,観測結果から直接原始分布を推定する軽量プリミティブ予測モジュールPANetを紹介する。
以前のプリミティブ条件のアプローチとは異なり、PriGoは完全にテスト時に動作し、事前訓練された拡散とフローポリシーにシームレスに統合できる。
- 参考スコア(独自算出の注目度): 28.358317763869664
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Imitation learning has enabled remarkable progress in robotic manipulation, especially with diffusion and flow-based policies that generate complex visuomotor behaviors directly from demonstrations. Yet, despite their strong performance, these policies often fail to generalize across tasks and environments. A key reason is that existing policies tend to imitate superficial action correlations rather than the underlying intent. Inspired by the compositional structure of human behaviors, we propose PriGo, a primitive-guided test-time adaptive framework for robust robotic manipulation. PriGo introduces PANet, a lightweight primitive prediction module that infers primitive distributions directly from observations. We further propose a differentiable primitive guidance mechanism that refines generated actions during inference, steering trajectories toward semantically consistent behaviors. Unlike prior primitive-conditioned approaches, PriGo operates entirely at test time and can be seamlessly integrated into pretrained diffusion and flow policies without retraining. Extensive experiments on LIBERO, CALVIN, SIMPLER, and real-world robotic tasks demonstrate that PriGo consistently improves robustness, long-horizon execution, and generalization ability across both diffusion and flow-based policies.
- Abstract(参考訳): 模倣学習はロボット操作において顕著な進歩をもたらしており、特に拡散とフローベースの政策は、デモから直接複雑な視覚運動行動を生成する。
しかし、その強いパフォーマンスにもかかわらず、これらのポリシーはタスクや環境をまたいだ一般化に失敗することが多い。
主要な理由は、既存の政策が根底にある意図よりも表面的な行動相関を模倣する傾向があることである。
人間の行動の構成構造に着想を得て,ロバストなロボット操作のためのプリミティブ誘導テスト時間適応フレームワークPriGoを提案する。
PriGoは、観測から直接原始分布を推測する軽量プリミティブ予測モジュールであるPANetを導入した。
さらに、推論中に生成された動作を洗練し、意味的に一貫した行動に向けて軌道を操る、微分可能なプリミティブガイダンス機構を提案する。
以前のプリミティブ条件のアプローチとは異なり、PriGoは完全にテスト時に動作し、事前訓練された拡散とフローポリシーにシームレスに統合できる。
LIBERO, CALVIN, SIMPLER, および実世界のロボットタスクに関する大規模な実験は、PriGoが安定して堅牢性、長距離実行、拡散とフローベースのポリシーをまたいだ一般化能力を向上させることを示した。
関連論文リスト
- FlowDAgger: Human-in-the-Loop Adaptation of Generative Robot Policies in Latent Space [15.351960740594201]
FlowDAggerは、潜伏空間における人間の介入から凍結した生成ロボットポリシーを適用するためのサンプルおよび計算効率のよい方法である。
私たちのキーとなるアイデアはアクション・インバージョン(アクション・インバージョン)です。
本研究では,FlowDAggerのシミュレーションおよび実世界のバイマニュアルおよびシングルアーム操作について評価する。
論文 参考訳(メタデータ) (2026-07-09T19:07:33Z) - Adapting Generalist Robot Policies with Semantic Reinforcement Learning [59.009122725071386]
ジェネラリストロボットポリシーは、大規模な事前訓練から多様な行動のレパートリーを学ぶ。
本稿では,オンラインインタラクションを通じて,このプロンプト空間を最適化するためのセマンティック・アクション強化学習(SARL)を提案する。
我々は、SARLが基本的に新しい機能をアンロックしていることを示します。
論文 参考訳(メタデータ) (2026-06-30T17:00:33Z) - From Attacks to Curricula: Learnability-Guided Adversarial Training for Safe Autonomous Driving [56.30087557121323]
AlignADVは学習性誘導型クローズドループ対向トレーニングフレームワークである。
敵のシナリオを解決可能で能力に整合したカリキュラムに変換する。
実験の結果、最大40.6%のトレーニングステップが短縮された。
論文 参考訳(メタデータ) (2026-06-12T02:13:55Z) - LAFP: Preserving Latent Action Structure in Latent Policy Learning via Flow Matching [15.922360971421654]
スケーラブルな潜在ポリシー学習のための潜在アクションフローポリシー(LAFP)を提案する。
LAFPは、下流の模倣学習タスクにおいて、従来手法よりも一貫して優れている。
LAFPは1倍のオーバヘッドを発生させる。
論文 参考訳(メタデータ) (2026-06-09T07:49:49Z) - Referring-Aware Visuomotor Policy Learning for Closed-Loop Manipulation [91.20850436220267]
Referring-Aware Visuomotor Policy(ReV)について紹介する。
ReVは、人間または高レベルの推論プランナーによって提供されるスパース参照ポイントを組み込む。
これは、専門家のデモンストレーションにターゲットの摂動を適用することでのみ訓練される。
論文 参考訳(メタデータ) (2026-04-07T07:41:11Z) - Encoding Predictability and Legibility for Style-Conditioned Diffusion Policy [1.1549572298362782]
効率性と透明な動きのバランスを取ることは、人間とロボットのコラボレーションにおける中核的な課題である。
本稿では,事前学習した拡散モデルに対して,妥当性と効率を両立させるモジュラーフレームワークであるStyle-Conditioned Diffusion Policy (SCDP)を提案する。
操作作業やナビゲーション作業におけるSCDPの評価を行い,不明瞭な環境下での可視性を向上するとともに,可視性が不要な場合の最適効率を保っていることを示す。
論文 参考訳(メタデータ) (2026-03-17T10:55:44Z) - GraspLDP: Towards Generalizable Grasping Policy via Latent Diffusion [44.168491831527355]
本稿では,模倣学習を通じて学習した操作ポリシーの把握精度の向上と一般化に焦点を当てた。
既存の把握のための模倣学習技術は、しばしば不正確な把握の実行、空間的一般化の制限、オブジェクトの一般化の不足に悩まされる。
論文 参考訳(メタデータ) (2026-02-26T10:56:01Z) - Flow Policy Gradients for Robot Control [67.61978635211048]
フローマッチングポリシ勾配は、より表現力のあるポリシのトレーニングと微調整に有効である。
我々は、スクラッチからトレーニングを行う際に、フロー表現をどのように活用するかを示し、ベースラインよりもきめ細やかな堅牢性を改善する。
論文 参考訳(メタデータ) (2026-02-02T18:56:49Z) - Sample from What You See: Visuomotor Policy Learning via Diffusion Bridge with Observation-Embedded Stochastic Differential Equation [28.95872004551021]
拡散モデルによる模倣学習は、多モーダルな動作分布を捉えることにより、ロボット制御が進歩する。
既存のアプローチでは、拡散過程自体のダイナミックスにそれらを組み込むのではなく、デノナイジングネットワークへの高レベルな条件付け入力として観測を扱います。
本稿では,拡散ブリッジの定式化を通じて微分方程式内に観測を埋め込む生成的ビズモータポリシであるブリッジポリシーを紹介する。
論文 参考訳(メタデータ) (2025-12-08T06:47:32Z) - Dense Policy: Bidirectional Autoregressive Learning of Actions [51.60428100831717]
本稿では,行動予測における自己回帰的政策の新たなパラダイムを確立するために,Dense Policyと呼ばれる双方向拡張学習手法を提案する。
軽量なエンコーダのみのアーキテクチャを使用して、アクションシーケンスを初期単一フレームからターゲットシーケンスへ粗い方法で反復的に展開する。
実験により、我々の密集した政策は自己回帰学習能力に優れており、既存の全体的生成ポリシーを超越できることが示された。
論文 参考訳(メタデータ) (2025-03-17T14:28:08Z) - Augmenting Reinforcement Learning with Behavior Primitives for Diverse
Manipulation Tasks [17.13584584844048]
本研究では,MAnipulation Primitive-augmented reinforcement LEarning (MAPLE)を導入した。
我々は、プリミティブを巻き込み、それらの実行を入力パラメータでインスタンス化する階層的なポリシーを開発する。
我々は、MAPLEが、シミュレーション操作タスクのスイートにおいて、ベースラインアプローチをかなりのマージンで上回ることを示す。
論文 参考訳(メタデータ) (2021-10-07T17:44:33Z) - Guided Uncertainty-Aware Policy Optimization: Combining Learning and
Model-Based Strategies for Sample-Efficient Policy Learning [75.56839075060819]
従来のロボットのアプローチは、環境の正確なモデル、タスクの実行方法の詳細な説明、現在の状態を追跡するための堅牢な認識システムに依存している。
強化学習アプローチは、タスクを記述するための報酬信号だけで、生の感覚入力から直接操作することができるが、非常にサンプル非効率で脆弱である。
本研究では,ロボットの知覚・運動パイプラインにおける不正確さを克服できる一般的な手法を得るために,モデルに基づく手法の強みと学習に基づく手法の柔軟性を組み合わせる。
論文 参考訳(メタデータ) (2020-05-21T19:47:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。