論文の概要: Data Pyramid for Embodied Manipulation
- arxiv url: http://arxiv.org/abs/2607.24744v1
- Date: Mon, 27 Jul 2026 17:59:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.550918
- Title: Data Pyramid for Embodied Manipulation
- Title(参考訳): 生体内マニピュレーションのためのデータピラミッド
- Abstract要約: 身体的エージェントは、物理的状態や行動と観察を混同するデータを必要とする。
具体化されたデータエコシステムは、5つの補完的なソースにまたがる“ピラミド”として組織化しています。
- 参考スコア(独自算出の注目度): 135.16063649795234
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multimodal foundation models learned to see and to speak by consuming the whole internet. Embodied agents admit no such shortcut, since they require data that couple observations with physical states and actions. These signals can be provided, to varying degrees, by multiple data sources. In this work, we organize the embodied data ecosystem as a "pyramid" spanning five complementary sources: real-robot data, UMI-style data, egocentric and exocentric data, simulation data, and general vision-language data. We organize the pyramid around the tension between scalability and robot alignment, and further characterize each source in terms of data quality, diversity, reusability, and physical fidelity. We then analyze recent embodied foundation models through the lens of their data recipes, examining how different sources are selected, aligned, and mixed during pretraining. For embodied brain models, vision-language-action models, and world-action models alike, we relate data composition to capabilities in perception, reasoning, planning, action generation, and world prediction. We close by discussing six open challenges: building large-scale tactile datasets, collecting failure and recovery data, developing scalable data-collection pipelines, aligning actions across embodiments, leveraging egocentric data for dexterous manipulation, and designing principled data recipes for robot learning. We hope this work paves the foundation for the design of next-generation embodied systems.
- Abstract(参考訳): マルチモーダル・ファンデーション・モデルは、インターネット全体を消費することで、見たり話したりすることを学びました。
身体的エージェントは、物理的状態や行動と同時観測するデータを必要とするため、そのようなショートカットは認めない。
これらの信号は、複数のデータソースによって、様々な程度に提供することができる。
本研究では,実ロボットデータ,UMIスタイルのデータ,エゴセントリック・エキソセントリックデータ,シミュレーションデータ,一般視覚言語データという,5つの相補的なソースにまたがる「ピラミド」として具体化されたデータエコシステムを整理する。
スケーラビリティとロボットアライメントの緊張関係にまつわるピラミッドを整理し、データ品質、多様性、再利用性、物理的忠実度の観点から各ソースを特徴付ける。
次に、データレシピのレンズを通して、最近の実施基盤モデルを解析し、事前トレーニング中に、どのように異なるソースが選択され、調整され、混合されるかを調べる。
具体的脳モデル、視覚言語行動モデル、世界行動モデルについては、データ構成を知覚、推論、計画、行動生成、世界予測の能力に関連付ける。
大規模な触覚データセットの構築、障害とリカバリデータ収集、スケーラブルなデータ収集パイプラインの開発、エボディメント間のアクションの整合化、エゴセントリックなデータを活用した巧妙な操作、ロボット学習のための原則化されたデータレシピの設計。
この研究が次世代のエンボディシステムの設計の基礎となることを願っている。
関連論文リスト
- HumanoidMimicGen: Data Generation for Loco-Manipulation via Whole-Body Planning [52.022681285103126]
我々はHumanoid MimicGenについて述べる。
本手法は,少数の実演から新しい状態へ,接触に富んだ全身スキルを適応させる。
我々は、HumanoidMimicGenが生成したデータと協調してトレーニングされた全身ビズモータポリシーが、実世界のデータでのみトレーニングされたものよりも20%優れていたことを示す。
論文 参考訳(メタデータ) (2026-05-26T21:57:11Z) - SoftMimicGen: A Data Generation System for Scalable Robot Learning in Deformable Object Manipulation [45.71119158785489]
我々は、変形可能なオブジェクト操作タスクのための自動データ生成パイプラインであるSoftMimicGenを紹介する。
本稿では,多種多様な変形可能な物体を含む高忠実度シミュレーション環境について紹介する。
我々はSoftMimicGenを適用し、タスクスイート全体にわたってデータセットを生成し、データからハイパフォーマンスなポリシーをトレーニングし、データ生成システムを体系的に分析する。
論文 参考訳(メタデータ) (2026-03-26T17:58:40Z) - What Matters in Learning from Large-Scale Datasets for Robot Manipulation [12.703188997313223]
我々はこの質問に答えるために大規模なデータセット合成研究を行っている。
既存のデータセットの多様性の共通源を手続き的にエミュレートするデータ生成フレームワークを開発した。
カメラのポーズや空間配置は、収集における多様性と検索におけるアライメントの両方にとって重要な次元であることがわかった。
論文 参考訳(メタデータ) (2025-06-16T14:25:29Z) - Diffusion-Driven Inertial Generated Data for Smartphone Location Classification [6.24709220163167]
スマートフォンの位置認識のための拡散駆動型特定力生成データを提案する。
以上の結果から, 拡散に基づく生成モデルは, 特定の力信号の特徴を捉えることに成功していることがわかった。
論文 参考訳(メタデータ) (2025-04-20T10:14:36Z) - DreamMask: Boosting Open-vocabulary Panoptic Segmentation with Synthetic Data [61.62554324594797]
オープンな語彙設定でトレーニングデータを生成する方法と、実データと合成データの両方でモデルをトレーニングする方法を探索するDreamMaskを提案する。
一般的に、DreamMaskは大規模なトレーニングデータの収集を著しく単純化し、既存のメソッドのプラグイン・アンド・プレイ・エンハンスメントとして機能する。
例えば、COCOで訓練しADE20Kで試験すると、ドリームマスクを装備したモデルは以前の最先端の2.1% mIoUよりも優れていた。
論文 参考訳(メタデータ) (2025-01-03T19:00:00Z) - Can-Do! A Dataset and Neuro-Symbolic Grounded Framework for Embodied Planning with Large Multimodal Models [85.55649666025926]
具体的計画能力を評価するために設計されたベンチマークデータセットであるCan-Doを紹介する。
私たちのデータセットには400のマルチモーダルサンプルが含まれており、それぞれが自然言語のユーザ指示、環境を描写した視覚イメージ、状態変化、対応するアクションプランで構成されています。
ニューログラウンド(NeuroGround)は、まず認識された環境状態において計画生成を基礎とし、次に象徴的な計画エンジンを活用してモデル生成計画を強化する、ニューログラウンド(NeuroGround)を提案する。
論文 参考訳(メタデータ) (2024-09-22T00:30:11Z) - Data Augmentation in Human-Centric Vision [54.97327269866757]
本研究では,人間中心型視覚タスクにおけるデータ拡張手法の包括的分析を行う。
それは、人物のReID、人間のパーシング、人間のポーズ推定、歩行者検出など、幅広い研究領域に展開している。
我々の研究は、データ拡張手法をデータ生成とデータ摂動の2つの主なタイプに分類する。
論文 参考訳(メタデータ) (2024-03-13T16:05:18Z) - Application of Federated Learning in Building a Robust COVID-19 Chest
X-ray Classification Model [0.0]
フェデレートラーニング(FL)は、すべてのデータを中央サーバに移動させることなく、AIモデルの一般化を支援する。
我々は、新型コロナウイルスの有無を予測するバイナリ分類問題を解決するために、ディープラーニングモデルを訓練した。
論文 参考訳(メタデータ) (2022-04-22T05:21:50Z) - MetaGraspNet: A Large-Scale Benchmark Dataset for Vision-driven Robotic
Grasping via Physics-based Metaverse Synthesis [78.26022688167133]
本稿では,物理に基づくメタバース合成による視覚駆動型ロボットグルーピングのための大規模ベンチマークデータセットを提案する。
提案するデータセットには,10万の画像と25種類のオブジェクトが含まれている。
また,オブジェクト検出とセグメンテーション性能を評価するためのデータセットとともに,新しいレイアウト重み付け性能指標を提案する。
論文 参考訳(メタデータ) (2021-12-29T17:23:24Z) - A Note on Data Biases in Generative Models [16.86600007830682]
生成モデルの性能に及ぼすデータセット品質の影響について検討する。
生成モデルによりデータセットの社会的バイアスがどのように再現されるかを示す。
本稿では,写真,油絵,アニメなどの多様なデータセット間の非ペア転送を通じて,クリエイティブな応用を提示する。
論文 参考訳(メタデータ) (2020-12-04T10:46:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。