論文の概要: Keypose Exploration: Efficient Automatic Trajectory Labelling and Cross-Embodiment Policy Transfer
- arxiv url: http://arxiv.org/abs/2606.29028v1
- Date: Sat, 27 Jun 2026 17:48:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:15.763033
- Title: Keypose Exploration: Efficient Automatic Trajectory Labelling and Cross-Embodiment Policy Transfer
- Title(参考訳): 鍵となる探索:効率的な自動軌道ラベリングとクロス・エボデーメント・ポリシー・トランスファー
- Abstract要約: 本稿では,グリップ関連タスクのための自動軌道ラベリングパイプラインを提案する。
我々は、キーポーズ条件を利用してデモンストレーション分布を介入するキーポーズ誘導拡散政策を訓練する。
2つのロボミクス的タスクの実験により、ラベル付きデータは標準のDPベースラインと一致するポリシーを生成することが示された。
- 参考スコア(独自算出の注目度): 30.1882064544866
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Keypose-based manipulation decomposes tasks into critical waypoints to simplify policy learning for long-horizon tasks, but existing approaches rely on task-specific heuristics or manual annotation to extract keyposes from demonstrations. We present an automatic trajectory labelling pipeline for grasp-related tasks. This pipeline combines vision-language models (VLMs) for semantic event detection with classical trajectory analysis for precise temporal alignment, requiring VLM inference only on one single demo among repeating ones per task. Using the labelled data, we train a keypose-guided Diffusion Policy (DP) that exploits keypose conditioning to intervene demonstration distributions. We explore the possibility to apply this property for cross-embodiment transfer: candidate keyposes are sampled and filtered via a reachability map, steering the policy toward kinematically feasible keyposes for the target robot. As a preliminary feasibility study, experiments on two robomimic tasks show that the labelled data produces policies matching a standard DP baseline, and that reachability-filtered keypose conditioning may benefit zero-shot transfer on the multimodal insertion task when feasible candidates are available.
- Abstract(参考訳): キーポーズベースの操作は、長い水平タスクのポリシー学習を単純化するために、タスクをクリティカルな視点に分解するが、既存のアプローチは、デモからキーポジションを抽出するためにタスク固有のヒューリスティックや手動アノテーションに依存している。
本稿では,グリップ関連タスクのための自動軌道ラベリングパイプラインを提案する。
このパイプラインは、セマンティックイベント検出のための視覚言語モデル(VLM)と、正確な時間的アライメントのための古典的なトラジェクトリ分析を組み合わせる。
ラベル付きデータを用いて、キーポーズ条件を利用してデモ分布を介入するキーポーズ誘導拡散ポリシー(DP)を訓練する。
そこで本研究では, 対象ロボットに対して, 動的に実現可能なキーポーズに対するポリシーを定式化して, 候補キーポーズをサンプリングし, 到達可能性マップを介してフィルタリングする手法を提案する。
予備的な実現可能性調査として、2つのロボミクスタスクの実験により、ラベル付きデータは標準DPベースラインに適合するポリシーを生成し、到達可能性フィルタされたキープレース条件付けは、候補が利用可能であれば、マルチモーダル挿入タスクにおけるゼロショット転送に有効であることを示した。
関連論文リスト
- TapSampling: Inference-Time Sampling with a Task-Progress-Understanding Verifier for Robotic Manipulation [61.35569005726248]
既存の具体的制御研究は、トレーニングデータとモデルサイズをスケールすることで、顕著なパフォーマンス向上を示す。
拡散や自己回帰モデルのような非決定論的生成モデルは、エンボディドコントロールの分野で広く採用されている。
推測時間サンプリングのためのプラグイン・アンド・プレイフレームワークである textbfTapSampling を提案する。
論文 参考訳(メタデータ) (2026-05-25T08:03:31Z) - Model Specific Task Similarity for Vision Language Model Selection via Layer Conductance [92.72779885657373]
本稿では,視覚エンコーダの内部関数力学におけるモデル選択の基盤となるフレームワークを提案する。
提案手法は,各タスクをレイヤワイドコンダクタンスにより表現し,エントロピー正規化アライメントによる目標条件付きブロック重要度分布を導出する。
そこで本研究では,DCD(Directional Conductance Divergence)という,ソースタスクが対象の機能ブロックをいかに効果的にカバーするかを定量化する非対称な指標を提案する。
論文 参考訳(メタデータ) (2026-02-01T17:29:43Z) - Correspondence-Oriented Imitation Learning: Flexible Visuomotor Control with 3D Conditioning [11.847696426774732]
本研究では,3次元のフレキシブルなタスク表現を持つビジュモータ制御のための条件付きポリシー学習フレームワークであるImitation-Oriented Learning (COIL)を紹介する。
COILはタスク、オブジェクト、動作パターンをまたいで一般化し、疎密な仕様と密な仕様の両方の下での現実世界の操作タスクの従来の方法と比べて、優れた粒度を達成する。
論文 参考訳(メタデータ) (2025-12-05T18:50:17Z) - RDD: Retrieval-Based Demonstration Decomposer for Planner Alignment in Long-Horizon Tasks [21.341051218915535]
本稿では,デモをサブタスクに自動的に分解するデモデコンポザを提案する。
本手法は,シミュレーションおよび実世界のタスクにおいて,最先端のサブタスクデコンポーザよりも優れる。
論文 参考訳(メタデータ) (2025-10-16T17:59:37Z) - Zero-Shot Whole-Body Humanoid Control via Behavioral Foundation Models [71.34520793462069]
教師なし強化学習(RL)は、複雑な環境下で幅広い下流タスクを解くことができる事前学習エージェントを目標としている。
本稿では,ラベルのない行動データセットからトラジェクトリを模倣するための,教師なしRLの正規化アルゴリズムを提案する。
我々は,この手法の有効性を,挑戦的なヒューマノイド制御問題において実証する。
論文 参考訳(メタデータ) (2025-04-15T10:41:11Z) - PATFinger: Prompt-Adapted Transferable Fingerprinting against Unauthorized Multimodal Dataset Usage [19.031839603738057]
マルチモーダルデータセットは、クロスモーダルセマンティクスを提供することで、事前訓練されたビジョン適応モデルに活用することができる。
本稿では,PATFingerと呼ばれる新しいプロンプト言語変換可能なフィンガープリント手法を提案する。
提案手法では,モデルにトリガを学習させる代わりに,固有データセット属性を指紋として利用する。
論文 参考訳(メタデータ) (2025-04-15T09:53:02Z) - Inference-Time Policy Steering through Human Interactions [54.02655062969934]
推論中、人間はしばしばポリシー実行ループから取り除かれる。
本稿では,人間のインタラクションを活用して生成するサンプリングプロセスにバイアスを与える推論時ポリシーステアリングフレームワークを提案する。
提案手法は,アライメントと分布シフトの最良のトレードオフを実現する。
論文 参考訳(メタデータ) (2024-11-25T18:03:50Z) - MATCH POLICY: A Simple Pipeline from Point Cloud Registration to Manipulation Policies [25.512068008948603]
MATCH POLICYは、高精度なピックと配置タスクを解決するパイプラインである。
アクション推論をポイントクラウド登録タスクに転送する。
非常に高いサンプル効率と、目に見えない構成への一般化性を実現する。
論文 参考訳(メタデータ) (2024-09-23T20:09:43Z) - Towards Unified Token Learning for Vision-Language Tracking [65.96561538356315]
本稿では,VL追跡をトークン生成タスクとして用いた「textbfMMTrack」という,視覚言語(VL)追跡パイプラインを提案する。
提案フレームワークは,言語記述と境界ボックスを離散トークン列にシリアライズする。
この新しい設計パラダイムでは、全てのトークンクエリが望ましいターゲットを認識し、ターゲットの空間座標を直接予測するために必要となる。
論文 参考訳(メタデータ) (2023-08-27T13:17:34Z) - Planning to Practice: Efficient Online Fine-Tuning by Composing Goals in
Latent Space [76.46113138484947]
汎用ロボットは、現実世界の非構造環境において困難なタスクを完了するために、多様な行動レパートリーを必要とする。
この問題に対処するため、目標条件強化学習は、コマンド上の幅広いタスクの目標に到達可能なポリシーを取得することを目的としている。
本研究では,長期的課題に対する目標条件付き政策を実践的に訓練する手法であるPlanning to Practiceを提案する。
論文 参考訳(メタデータ) (2022-05-17T06:58:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。