論文の概要: Scaling Bimanual Household Manipulation from 1,500 hours of Demonstrations to On-Policy Corrections
- arxiv url: http://arxiv.org/abs/2609.03591v1
- Date: Thu, 03 Sep 2026 09:37:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 18:28:39.005068
- Title: Scaling Bimanual Household Manipulation from 1,500 hours of Demonstrations to On-Policy Corrections
- Title(参考訳): 1500時間の実証から公共交通機関の矯正まで
- Abstract要約: 日常的な作業をカバーする多彩なバイマニュアル操作のデモを1500時間実施する。
我々はこの包括的コーパスを用いて、強力な視覚言語アクション(VLA)モデルであるXR-2を訓練する。
本研究では,専門家による実証データの量の変化と,リアルタイムの人的介入によるDAgger修正データに対するポストトレーニングの2つの重要なスケーリング軸について検討する。
- 参考スコア(独自算出の注目度): 20.699475306823462
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Learning generalist policies for robust bimanual manipulation is bottlenecked by the scarcity of high quality large scale human demonstration data. In this work, we release 1,500 hours of diverse bimanual manipulation demonstrations covering everyday household tasks, and use this comprehensive corpus to train XR-2, a powerful vision-language-action (VLA) model. Enabled by a purpose built high throughput data pipeline and a carefully designed multi stage training paradigm, XR-2 attains strong manipulation performance in our systematic experiments while retaining favorable training efficiency and high data utilization. We further study two critical scaling axes: varying the amount of expert demonstration data, and post training on DAgger correction data from real time human interventions. In both settings, task success rate improves steadily over the data ranges we probe, exhibiting a clear consistent scaling trend at our current data scale. These results validate both the learning capacity of XR-2 and the promising scaling properties of the released dataset, which we open source to support reproducible research on bimanual robot manipulation learning.
- Abstract(参考訳): 堅牢な双方向操作のための一般主義的な政策の学習は、高品質な大規模人間の実演データの不足によってボトルネックとなる。
本研究は,日常業務を対象とした多彩なバイマニュアル操作デモを1500時間実施し,この包括的コーパスを用いて,強力な視覚言語行動(VLA)モデルであるXR-2を訓練する。
高スループットデータパイプラインと慎重に設計されたマルチステージトレーニングパラダイムによって実現されたXR-2は、良好なトレーニング効率と高データ利用を維持しながら、系統実験において強力な操作性能を実現する。
さらに、専門家によるデモンストレーションデータの量の変化と、リアルタイムの人間介入によるDAgger修正データに対するポストトレーニングの2つの重要なスケーリング軸について検討する。
両方の設定において、タスクの成功率は調査対象のデータ範囲よりも着実に改善され、現在のデータスケールで明確な一貫性のあるスケーリング傾向が示されます。
これらの結果は、XR-2の学習能力とリリースデータセットの有望なスケーリング特性の両方を検証し、双方向ロボット操作学習における再現可能な研究を支援するためにオープンソースとして公開した。
関連論文リスト
- Representation-Conditioned Diffusion Models for Guided Training Data Generation [1.9517610560768623]
生成深層学習により生成した合成画像データセットに基づいて学習したモデルの分類性能を評価する。
我々は,DINOv2,DINOv3,CLIPの学習表現を条件とした潜時拡散モデルを用いた。
この表現条件付き定式化は,クラス条件付き生成を大きなマージンで大幅に上回ることを示す。
論文 参考訳(メタデータ) (2026-05-26T17:32:50Z) - Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward [54.708851958671794]
オフラインとオンラインの両方のデータ選択のための最適化戦略を組み合わせた,データ効率のよいポリシ最適化パイプラインを提案する。
オフラインフェーズでは、多様性、影響、適切な難易度に基づいて、トレーニングサンプルの高品質なサブセットをキュレートする。
オンラインRLVRトレーニングにおいて、探索可能性の低いサンプルを動的にフィルタリングするサンプルレベルの探索性指標を導入する。
論文 参考訳(メタデータ) (2025-09-01T10:04:20Z) - Is Diversity All You Need for Scalable Robotic Manipulation? [50.747150672933316]
ロボット学習におけるデータ多様性の役割について,従来の「より多様な方がよい」という直観に固執する3つの重要な次元(タスク),実施形態(ロボットの使用方法),専門家(専門家)を用いて検討する。
タスクの多様性は、タスクごとのデモンストレーション量よりも重要であり、多様な事前学習タスクから新しい下流シナリオへの移行に有効であることを示す。
本稿では,速度のあいまいさを緩和する分散デバイアス法を提案する。GO-1-Proは,2.5倍の事前学習データを用いて,15%の性能向上を実現している。
論文 参考訳(メタデータ) (2025-07-08T17:52:44Z) - LEAD: Iterative Data Selection for Efficient LLM Instruction Tuning [22.242445543184264]
我々は,標準トレーニングループ内でサンプルユーティリティを完全に正確に推定する,効率的な反復的データ選択フレームワークであるLEADを提案する。
実験の結果、LEADは最先端の手法を著しく上回り、平均モデル性能は6.1%-10.8%向上し、トレーニングデータの2.5%しか使用せず、全体のトレーニング時間を5-10倍短縮した。
論文 参考訳(メタデータ) (2025-05-12T10:57:51Z) - How to Achieve Higher Accuracy with Less Training Points? [2.1834099301440526]
本稿では,学習セットにどのトレーニングサンプルを含めるべきかを決定するための影響関数に基づく手法を提案する。
当社のアプローチでは、データセット全体のトレーニングに匹敵するパフォーマンスを示しながら、データの10%しか使用していません。
論文 参考訳(メタデータ) (2025-04-18T09:38:26Z) - AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems [88.05152114775498]
AgiBot Worldは、217のタスクにまたがる100万以上のトラジェクトリを5つのデプロイメントシナリオで構成した大規模なプラットフォームである。
AgiBot Worldは高品質で多様なデータ配信を保証する。
GO-1は、現実世界のデクスタラスタスクや長距離タスクにおいて例外的な能力を示す。
論文 参考訳(メタデータ) (2025-03-09T15:40:29Z) - Efficient Grammatical Error Correction Via Multi-Task Training and
Optimized Training Schedule [55.08778142798106]
原文と修正文のアライメントを利用する補助タスクを提案する。
我々は,各タスクをシーケンス・ツー・シーケンス問題として定式化し,マルチタスク・トレーニングを行う。
トレーニングに使用されるデータセットの順序や、データセット内の個々のインスタンスでさえ、最終的なパフォーマンスに重要な影響を与える可能性があることが分かりました。
論文 参考訳(メタデータ) (2023-11-20T14:50:12Z) - Multi-dataset Training of Transformers for Robust Action Recognition [75.5695991766902]
動作認識のための複数のデータセットをうまく一般化することを目的として,ロバストな特徴表現の課題について検討する。
本稿では、情報損失と投影損失という2つの新しい損失項を設計した、新しいマルチデータセットトレーニングパラダイムであるMultiTrainを提案する。
本研究では,Kineetics-400,Kineetics-700,Moments-in-Time,Activitynet,Some-something-v2の5つの課題データセットに対して,本手法の有効性を検証する。
論文 参考訳(メタデータ) (2022-09-26T01:30:43Z) - Fix your Models by Fixing your Datasets [0.6058427379240697]
現在の機械学習ツールは、データ品質を改善するための合理化されたプロセスを欠いている。
そこで,本研究では,データセットにノイズや誤認のあるサンプルを見つけるための体系的枠組みを提案する。
2つのFortune 500企業のプライベートエンタープライズデータセットと同様に、当社のフレームワークの有効性を公開してみます。
論文 参考訳(メタデータ) (2021-12-15T02:41:50Z) - A Framework for Efficient Robotic Manipulation [79.10407063260473]
単一のロボットアームがピクセルからスパースリワード操作ポリシーを学習できることを示します。
デモは10回しかなく、単一のロボットアームがピクセルからスパースリワード操作のポリシーを学習できることを示しています。
論文 参考訳(メタデータ) (2020-12-14T22:18:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。