論文の概要: One-Policy-Fits-All: Geometry-Aware Action Latents for Cross-Embodiment Manipulation
- arxiv url: http://arxiv.org/abs/2603.14522v1
- Date: Sun, 15 Mar 2026 17:59:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-21 18:33:56.830691
- Title: One-Policy-Fits-All: Geometry-Aware Action Latents for Cross-Embodiment Manipulation
- Title(参考訳): 1-Policy-Fits-All: クロス・エボディメント・マニピュレーションのための幾何学的行動遅延剤
- Abstract要約: ロボット操作のスケーラビリティ向上には,クロス・エボディメント操作が不可欠である。
我々は,複数の実施形態をまたいだ多目的政策を学習可能なフレームワークであるOneFits-All(OPFA)を提案する。
- 参考スコア(独自算出の注目度): 51.66470249744105
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Cross-embodiment manipulation is crucial for enhancing the scalability of robot manipulation and reducing the high cost of data collection. However, the significant differences between embodiments, such as variations in action spaces and structural disparities, pose challenges for joint training across multiple sources of data. To address this, we propose One-Policy-Fits-All (OPFA), a framework that enables learning a single, versatile policy across multiple embodiments. We first learn a Geometry-Aware Latent Representation (GaLR), which leverages 3D convolution networks and transformers to build a shared latent action space across different embodiments. Then we design a unified latent retargeting decoder that extracts embodiment-specific actions from the latent representations, without any embodiment-specific decoder tuning. OPFA enables end-to-end co-training of data from diverse embodiments, including various grippers and dexterous hands with arbitrary degrees of freedom, significantly improving data efficiency and reducing the cost of skill transfer. We conduct extensive experiments across 11 different end-effectors. The results demonstrate that OPFA significantly improves policy performance in diverse settings by leveraging heterogeneous embodiment data. For instance, cross-embodiment co-training can improve success rates by more than 50% compared to single-source training. Moreover, by adding only a few demonstrations from a new embodiment (e.g., eight), OPFA can achieve performance comparable to that of a well-trained model with 72 demonstrations.
- Abstract(参考訳): ロボット操作のスケーラビリティを高め、データ収集のコストを下げるためには、クロス・エボディメント操作が不可欠である。
しかし,動作空間の変動や構造的差異などの実施形態の違いは,複数のデータソースをまたいだ共同トレーニングの課題を提起する。
この問題に対処するため,我々は,複数の実施形態にまたがる単一多目的政策を学習可能なフレームワークであるOne-Policy-Fits-All (OPFA)を提案する。
我々はまず,3次元畳み込みネットワークとトランスフォーマーを活用して,異なる実施形態にまたがる共用潜在動作空間を構築するGaLR(Geometry-Aware Latent Representation)を学習する。
そこで我々は、エンボディメント固有のデコーダチューニングを使わずに、エンボディメント固有の動作を潜在表現から抽出する統合ラテント再ターゲットデコーダを設計する。
OPFAは、さまざまなグリップや器用な手など、さまざまな実施形態からのデータのエンドツーエンドのコトレーニングを任意の自由度で実現し、データ効率を大幅に改善し、スキル移行のコストを低減します。
11種類のエンドエフェクターにまたがって広範な実験を行っている。
その結果,OPFAは不均一な実施データを活用することにより,多種多様な環境下での政策性能を著しく向上することが示された。
例えば、クロスエボディメントのコトレーニングは、シングルソースのトレーニングに比べて50%以上成功率を向上させることができる。
さらに、新しいエボディメント(例:8)からいくつかのデモを追加することで、OPFAは72のデモを持つよく訓練されたモデルに匹敵するパフォーマンスを達成することができる。
関連論文リスト
- Geometric Entropy: When Trajectory Diversity Helps and Hurts in Imitation Learning [16.153147572760883]
本研究では,実演における軌道形状の多様性がモデル,タスク,データスケール間での模倣学習(IL)のパフォーマンスに与える影響について検討する。
本稿では,移動軌跡の内在的な多様性を定量化するタスク非依存の指標であるGeometric Entropy (H_G)を紹介する。
論文 参考訳(メタデータ) (2026-06-18T19:02:08Z) - X-DiffVLA: X-Embodied Diffusion Action Heads for Vision-Language-Action Models [39.033717938466246]
本稿では,X-DiffVLA(拡散型VLAモデル)を提案する。
X-DiffVLAは拡散モデルの生成的強度を利用して、クロスボディーデータセットの多様性と潜時相関をキャプチャすることができる。
X-DiffVLAは,それぞれ15.3%,12.5%の改善が得られた。
論文 参考訳(メタデータ) (2026-05-24T12:41:34Z) - Fints: Efficient Inference-Time Personalization for LLMs with Fine-Grained Instance-Tailored Steering [49.212940215720884]
本稿では,ユーザデータからサンプルレベルの干渉を生成し,モデルの前方通過に注入してパーソナライズするステアリングフレームワークを提案する。
本手法は,対話モードやコンテキスト長の異なる環境において,ロバスト性を保ちながら,高速シフト環境におけるパーソナライズ性能を著しく向上させる。
論文 参考訳(メタデータ) (2025-10-31T06:01:04Z) - Align-Then-stEer: Adapting the Vision-Language Action Models through Unified Latent Guidance [63.33213516925946]
textbfAlign-Then-stEer(textttATE)は,新しいデータ効率,プラグアンドプレイ適応フレームワークである。
我々の研究は、新しいロボットプラットフォームやタスクにVLAモデルをデプロイする実用性を大幅に向上させる、汎用的で軽量なソリューションを提供する。
論文 参考訳(メタデータ) (2025-09-02T07:51:59Z) - Is Diversity All You Need for Scalable Robotic Manipulation? [50.747150672933316]
ロボット学習におけるデータ多様性の役割について,従来の「より多様な方がよい」という直観に固執する3つの重要な次元(タスク),実施形態(ロボットの使用方法),専門家(専門家)を用いて検討する。
タスクの多様性は、タスクごとのデモンストレーション量よりも重要であり、多様な事前学習タスクから新しい下流シナリオへの移行に有効であることを示す。
本稿では,速度のあいまいさを緩和する分散デバイアス法を提案する。GO-1-Proは,2.5倍の事前学習データを用いて,15%の性能向上を実現している。
論文 参考訳(メタデータ) (2025-07-08T17:52:44Z) - Towards Unified Modeling in Federated Multi-Task Learning via Subspace Decoupling [23.642760378344335]
Federated Multi-Task Learning (FMTL) は、複数のクライアントがローカルデータを交換することなく異種タスクを実行できる。
既存のFMTLメソッドのほとんどは、各クライアント用にパーソナライズされたモデルを構築することに集中しており、複数の異種タスクの集約を統一モデルにサポートできない。
マルチタスクモデル統合に特化して設計された更新構造対応アグリゲーション手法であるFedDEAを提案する。
論文 参考訳(メタデータ) (2025-05-30T03:53:21Z) - Universal Actions for Enhanced Embodied Foundation Models [25.755178700280933]
我々はUniversal Action Spaceで動作する新しい基礎モデリングフレームワークUniActを紹介する。
我々の学習した普遍行動は、共有された構造的特徴を利用して、多様なロボット間での一般的な原子の挙動を捉えます。
0.5BでのUniActのインスタンス化は、様々な実世界およびシミュレーションロボットの広範囲な評価において、14倍のSOTAを具現化した基礎モデルより優れている。
論文 参考訳(メタデータ) (2025-01-17T10:45:22Z) - Contrastive Learning Via Equivariant Representation [19.112460889771423]
CLeVERは,任意の複雑性の増大戦略に適合する,新しい異種コントラスト学習フレームワークである。
実験結果から,CLeVERは実用自然画像から同変情報を効果的に抽出し,組み込んだ。
論文 参考訳(メタデータ) (2024-06-01T01:53:51Z) - A Novel Cross-Perturbation for Single Domain Generalization [54.612933105967606]
単一ドメインの一般化は、モデルが単一のソースドメインでトレーニングされたときに未知のドメインに一般化する能力を高めることを目的としている。
トレーニングデータの限られた多様性は、ドメイン不変の特徴の学習を妨げ、結果として一般化性能を損なう。
トレーニングデータの多様性を高めるために,CPerbを提案する。
論文 参考訳(メタデータ) (2023-08-02T03:16:12Z) - Revisiting Consistency Regularization for Semi-Supervised Learning [80.28461584135967]
そこで我々は,FeatDistLossというシンプルな手法により,一貫性の規則化を改良したフレームワークを提案する。
実験結果から,本モデルは様々なデータセットや設定のための新しい技術状態を定義する。
論文 参考訳(メタデータ) (2021-12-10T20:46:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。