論文の概要: Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack
- arxiv url: http://arxiv.org/abs/2606.14409v1
- Date: Fri, 12 Jun 2026 12:45:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-15 16:00:42.900589
- Title: Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack
- Title(参考訳): Hy-Embodied-0.5-VLA:ビジョン・ランゲージ・アクションモデルから実世界のロボット学習スタックへ
- Abstract要約: Hy-Embodied-0.5-VLAは、完全なロボット学習スタックにまたがるエンドツーエンドシステムである。
データ収集、モデル設計、継続的な事前トレーニング、教師付き微調整、RLポストトレーニング、実環境展開などが含まれる。
- 参考スコア(独自算出の注目度): 68.26410985517266
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: In this report, we present Hy-Embodied-0.5-VLA, abbreviated as HyVLA-0.5, an end-to-end system that spans the full robot learning stack: data collection, model design, continued pre-training and supervised fine-tuning, RL post-training, and real-world deployment. Each component serves a distinct role in this stack.
- Abstract(参考訳): 本稿では,Hy-Embodied-0.5-VLA(Hy-Embodied-0.5-VLA,略称HyVLA-0.5)について述べる。
各コンポーネントは、このスタックで異なる役割を担います。
関連論文リスト
- Beyond Data Scaling: Representation-Centric Continued Pre-training for Vision-Language-Action Models [120.24139942108405]
ロボットデータのスケーリングは、一般のVision-Language-Action(VLA)モデルを構築する上で重要である。
固定されたロボットデータ予算の下では、継続した事前訓練は限られた軌道を伝達可能な視覚行動知識に変換する必要がある。
本稿では,VLA指向のVLMバックボーンであるVLActを提案する。
論文 参考訳(メタデータ) (2026-08-27T17:59:40Z) - Generalization of World Models under Environmental Variability for Vision-based Quadrotor Navigation [10.364779390403337]
世界モデルは、環境がどのように進化するかを予測する学習された生成モデルであり、サンプル効率のよいロボット学習のための有望なツールとなっている。
本研究では,視覚に基づく四角形ナビゲーションをテストベッド問題とし,環境ランダム性の異なるDreamerV3ベースの世界モデルを訓練する。
そして、すべての世界モデルと関連するナビゲーションポリシーを、すべてのセンサーが切断される前に実際の感覚入力を2.5秒だけ受信するオープンループランなど、目に見えない環境で実際の四角形に展開します。
以上の結果から,SSL事前トレーニング中の世界モデルロバスト性はsim-to-realの強い予測因子であることが示された。
論文 参考訳(メタデータ) (2026-06-03T15:38:36Z) - DIAL: Decoupling Intent and Action via Latent World Modeling for End-to-End VLA [72.9197085473598]
DIALはハイレベルな意思決定と低レベルなモーター実行を、差別化可能な潜在意図ボトルネックを通じてブリッジするフレームワークである。
VLMベースのSystem-2は、VLMのネイティブな特徴空間内で、潜伏した視覚的フォレストによって潜伏世界モデリングを行う。
軽量のSystem-1ポリシーでは、この予測された意図と現在の観測結果を正確にロボットの動作にデコードする。
論文 参考訳(メタデータ) (2026-03-31T15:02:27Z) - GigaBrain-0.5M*: a VLA That Learns From World Model-Based Reinforcement Learning [44.63316677431278]
我々は、世界モデルに基づく強化学習を通して訓練されたVLAモデルである textitGigaBrain-0.5M* を提案する。
textitGigaBrain-0.5M*はTextitGigaBrain-0.5上に構築されている。
論文 参考訳(メタデータ) (2026-02-12T15:55:19Z) - World-VLA-Loop: Closed-Loop Learning of Video World Model and VLA Policy [55.03832008486675]
World-VLA-Loopは、世界モデルとVision-Language-Action (VLA) ポリシーの共同改良のためのクローズドループフレームワークである。
本研究では,将来観測と報奨信号の同時予測により,高忠実度インタラクティブシミュレータとして機能する状態認識型ビデオワールドモデルを提案する。
論文 参考訳(メタデータ) (2026-02-06T08:57:55Z) - Green-VLA: Staged Vision-Language-Action Model for Generalist Robots [0.0]
我々は,グリーンヒューマノイドロボット上での現実的な展開を実現するための,段階的ビジョン・ランゲージ・アクション・フレームワークであるGreen-VLAを紹介した。
我々は、時間的アライメントと品質フィルタリングを備えたスケーラブルなデータ処理パイプラインを結合し、統一されたエンボディメント対応アクションインターフェースを使用する。
Simpler BRIDGE WidowXとCALVIN ABC-Dの実験は、実ロボットの評価と同様に、RLアライメントによる強力な一般化と性能向上を示す。
論文 参考訳(メタデータ) (2026-01-31T22:13:23Z) - Galaxea Open-World Dataset and G0 Dual-System VLA Model [55.756245350141675]
実生活と作業環境に記録された大規模で多様なロボット行動のコレクションを提示する。
すべてのデモは、一貫したロボットエンボディメントを使用して収集され、正確なサブタスクレベルの言語アノテーションと組み合わせられる。
G0は、クロス・エボディメント・プレトレーニング、シングル・エボディメント・プレトレーニング、タスク固有のポスト・トレーニングという3段階のカリキュラムを使って訓練されている。
論文 参考訳(メタデータ) (2025-08-30T18:04:19Z) - MoRE: Unlocking Scalability in Reinforcement Learning for Quadruped Vision-Language-Action Models [34.138699712315]
本稿では、四足歩行ロボットのためのロボット専門家(MoRE)の混合であるビジョンアクション(VLA)モデルを提案する。
MoREは、複数の低ランク適応モジュールを、密集したマルチモーダルな大規模言語モデルの中で異なる専門家として統合する。
実験によると、MoREは6つの異なるスキルで全てのベースラインを上回り、アウト・オブ・ディストリビューションシナリオにおいて優れた一般化能力を示す。
論文 参考訳(メタデータ) (2025-03-11T03:13:45Z) - TraceVLA: Visual Trace Prompting Enhances Spatial-Temporal Awareness for Generalist Robotic Policies [95.30717188630432]
VLAモデルの行動予測のための時空間認識を容易にするために,視覚的トレースプロンプトを導入する。
我々は,これまでに収集した150Kロボット操作トラジェクトリのデータセットに基づいてOpenVLAを微調整し,新しいTraceVLAモデルを開発した。
4B Phi-3-Vision に基づくコンパクトな VLA モデルを提案する。
論文 参考訳(メタデータ) (2024-12-13T18:40:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。