論文の概要: JoyAI-RA 0.1: A Foundation Model for Robotic Autonomy
- arxiv url: http://arxiv.org/abs/2604.20100v2
- Date: Thu, 23 Apr 2026 04:10:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-24 14:40:06.039371
- Title: JoyAI-RA 0.1: A Foundation Model for Robotic Autonomy
- Title(参考訳): JoyAI-RA 0.1:ロボットオートノミーの基礎モデル
- Abstract要約: JoyAI-RAは、汎用的なロボット操作に適した、視覚言語対応の基盤モデルである。
JoyAI-RAは、特に人間の操作とロボット制御の間において、具体化のギャップを埋める。
シミュレーションと実世界のベンチマークの両方で最先端の手法よりも優れています。
- 参考スコア(独自算出の注目度): 90.77129709149574
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Robotic autonomy in open-world environments is fundamentally limited by insufficient data diversity and poor cross-embodiment generalization. Existing robotic datasets are often limited in scale and task coverage, while relatively large differences across robot embodiments impede effective behavior knowledge transfer. To address these challenges, we propose JoyAI-RA, a vision-language-action (VLA) embodied foundation model tailored for generalizable robotic manipulation. JoyAI-RA presents a multi-source multi-level pretraining framework that integrates web data, large-scale egocentric human manipulation videos, simulation-generated trajectories, and real-robot data. Through training on heterogeneous multi-source data with explicit action-space unification, JoyAI-RA effectively bridges embodiment gaps, particularly between human manipulation and robotic control, thereby enhancing cross-embodiment behavior learning. JoyAI-RA outperforms state-of-the-art methods in both simulation and real-world benchmarks, especially on diverse tasks with generalization demands.
- Abstract(参考訳): オープンワールド環境におけるロボットの自律性は、データ多様性の欠如とクロス・エボディメントの一般化の欠如によって根本的に制限されている。
既存のロボットデータセットは、スケールやタスクのカバレッジに制限されることが多いが、ロボットの体格間での比較的大きな違いは、効果的な行動知識の伝達を妨げる。
これらの課題に対処するために,汎用ロボット操作に適した視覚言語アクション(VLA)を具現化した基礎モデルであるJoyAI-RAを提案する。
JoyAI-RAは、Webデータ、大規模な人間操作ビデオ、シミュレーション生成トラジェクトリ、実ロボットデータを統合するマルチソースのマルチレベル事前トレーニングフレームワークを提供する。
JoyAI-RAは、異種多元データと明示的な行動空間の統合によるトレーニングを通じて、特に人間の操作とロボット制御の間において、エボデーメントギャップを効果的に橋渡しし、クロスボデーメント行動学習を強化する。
JoyAI-RAは、シミュレーションと実世界のベンチマークにおいて、特に一般化要求のある様々なタスクにおいて、最先端の手法よりも優れている。
関連論文リスト
- RoboSynChallenge: Mastering Real-World Dexterity via Generalizing Synthesized Manipulation Skills [90.48218237655708]
RoboSynChallengeは、幅広い能力、データ効率、適応可能な操作システムの開発を促進することを目的としている。
Challengeは、大規模な合成データ生成と、標準化された現実世界のロボット評価を統合する。
論文 参考訳(メタデータ) (2026-08-12T04:29:00Z) - ComSim: Building Scalable Real-World Robot Data Generation via Compositional Simulation [90.4702774169675]
本稿では,古典シミュレーションとニューラルシミュレーションを組み合わせた合成シミュレーションというハイブリッド手法を提案する。
提案手法では,少数の実世界のデータを活用するクローズドループ・リアル・シモン・リアル・データ拡張パイプラインを利用する。
我々はニューラルシミュレーターをトレーニングし、古典的なシミュレーションビデオを現実世界の表現に変換し、現実の環境で訓練されたポリシーモデルの精度を向上させる。
論文 参考訳(メタデータ) (2026-04-13T12:25:45Z) - RoboGene: Boosting VLA Pre-training via Diversity-Driven Agentic Framework for Real-World Task Generation [37.52152452548065]
RoboGeneは多様な物理的に可能な操作タスクを生成するために設計されたエージェントフレームワークである。
広範に定量的な分析と大規模な実世界の実験を行い、18k軌道のデータセットを収集した。
結果は、RoboGeneが最先端の基礎モデルよりも大幅に優れていることを示している。
論文 参考訳(メタデータ) (2026-02-18T13:29:43Z) - MiVLA: Towards Generalizable Vision-Language-Action Model with Human-Robot Mutual Imitation Pre-training [102.850162490626]
人間のロボットによる相互模倣事前学習による視覚-言語-行動モデルであるMiVLAを提案する。
MiVLAは、最先端のVLAよりも優れた、強力な改良された一般化能力を実現する。
論文 参考訳(メタデータ) (2025-12-17T12:59:41Z) - HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies [83.41714103649751]
具体的インテリジェンスモデルの開発は、高品質なロボットのデモデータへのアクセスに依存する。
異種多種多様なロボットデータを扱うための視覚言語アクションフレームワークであるHiMoE-VLAを提案する。
HiMoE-VLAは既存のVLAベースラインよりも一貫したパフォーマンス向上を示し、高い精度と堅牢な一般化を実現している。
論文 参考訳(メタデータ) (2025-12-05T13:21:05Z) - H-RDT: Human Manipulation Enhanced Bimanual Robotic Manipulation [27.585828712261232]
H-RDT(Human to Robotics Diffusion Transformer)は、人間の操作データを利用してロボット操作能力を向上する新しいアプローチである。
私たちの重要な洞察は、大規模なエゴセントリックな人間操作ビデオとペアの3Dハンドポーズアノテーションが、自然な操作戦略を捉えたリッチな行動優先を提供するということです。
本研究では,(1)大規模な人間操作データに対する事前トレーニング,(2)モジュール型アクションエンコーダとデコーダを用いたロボット固有のデータに対するクロスエボディメント微調整という2段階の訓練パラダイムを導入する。
論文 参考訳(メタデータ) (2025-07-31T13:06:59Z) - Capability-Aware Shared Hypernetworks for Flexible Heterogeneous Multi-Robot Coordination [1.5970870882365]
マルチロボットチームのための能力認識共有ハイパーネットワークス(CASH)を提案する。
CASHは、ハイパーネットワークを使用してフレキシブルな共有ポリシを効率的に学習する、ソフトウェイト共有アーキテクチャである。
トレーニングとゼロショットの一般化の両方において、CASHは性能とサンプル効率の点で、ベースラインアーキテクチャを一貫して上回っていることを示す。
論文 参考訳(メタデータ) (2025-01-10T15:39:39Z) - Semantically Controllable Augmentations for Generalizable Robot Learning [40.89398799604755]
ロボット操作の現実に見えないシナリオへの一般化には、トレーニング中にさまざまなデータセットを公開する必要がある。
本稿では,意味制御可能な拡張とロボットデータセットの高速乗算のための生成的拡張フレームワークを提案する。
論文 参考訳(メタデータ) (2024-09-02T05:25:34Z) - Scaling Cross-Embodied Learning: One Policy for Manipulation, Navigation, Locomotion and Aviation [49.03165169369552]
さまざまな種類のロボットにまたがって単一のポリシーを訓練することによって、ロボット学習はより広範囲で多様なデータセットを活用することができる。
そこで我々はCrossFormerを提案する。CrossFormerはスケーラブルでフレキシブルなトランスフォーマーベースのポリシーで、どんな実施形態からでもデータを消費できる。
我々は、同じネットワークウェイトがシングルアームとデュアルアームの操作システム、車輪付きロボット、クワッドコプター、四足歩行など、非常に異なるロボットを制御できることを実証した。
論文 参考訳(メタデータ) (2024-08-21T17:57:51Z) - Transferring Foundation Models for Generalizable Robotic Manipulation [82.12754319808197]
インターネット規模の基盤モデルによって生成された言語推論セグメンテーションマスクを効果的に活用する新しいパラダイムを提案する。
提案手法は,オブジェクトのポーズを効果的かつ堅牢に知覚し,サンプル効率のよい一般化学習を可能にする。
デモは提出されたビデオで見ることができ、より包括的なデモはlink1またはlink2で見ることができます。
論文 参考訳(メタデータ) (2023-06-09T07:22:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。