論文の概要: GigaBrain-0.5M*: a VLA That Learns From World Model-Based Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2602.12099v1
- Date: Thu, 12 Feb 2026 15:55:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-02-13 21:07:25.906878
- Title: GigaBrain-0.5M*: a VLA That Learns From World Model-Based Reinforcement Learning
- Title(参考訳): GigaBrain-0.5M*:世界モデルに基づく強化学習から学ぶVLA
- Abstract要約: 我々は、世界モデルに基づく強化学習を通して訓練されたVLAモデルである textitGigaBrain-0.5M* を提案する。
textitGigaBrain-0.5M*はTextitGigaBrain-0.5上に構築されている。
- 参考スコア(独自算出の注目度): 44.63316677431278
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-language-action (VLA) models that directly predict multi-step action chunks from current observations face inherent limitations due to constrained scene understanding and weak future anticipation capabilities. In contrast, video world models pre-trained on web-scale video corpora exhibit robust spatiotemporal reasoning and accurate future prediction, making them a natural foundation for enhancing VLA learning. Therefore, we propose \textit{GigaBrain-0.5M*}, a VLA model trained via world model-based reinforcement learning. Built upon \textit{GigaBrain-0.5}, which is pre-trained on over 10,000 hours of robotic manipulation data, whose intermediate version currently ranks first on the international RoboChallenge benchmark. \textit{GigaBrain-0.5M*} further integrates world model-based reinforcement learning via \textit{RAMP} (Reinforcement leArning via world Model-conditioned Policy) to enable robust cross-task adaptation. Empirical results demonstrate that \textit{RAMP} achieves substantial performance gains over the RECAP baseline, yielding improvements of approximately 30\% on challenging tasks including \texttt{Laundry Folding}, \texttt{Box Packing}, and \texttt{Espresso Preparation}. Critically, \textit{GigaBrain-0.5M$^*$} exhibits reliable long-horizon execution, consistently accomplishing complex manipulation tasks without failure as validated by real-world deployment videos on our \href{https://gigabrain05m.github.io}{project page}.
- Abstract(参考訳): 視覚言語アクション(VLA)モデルは、現在の観測から直接多段階のアクションチャンクを予測し、制約のあるシーン理解と将来の予測能力の弱さによって固有の制限に直面している。
対照的に、Webスケールビデオコーパスで事前訓練されたビデオワールドモデルは、堅牢な時空間推論と正確な将来予測を示し、VLA学習の自然な基盤となっている。
そこで本研究では,世界モデルに基づく強化学習を通じて学習したVLAモデルであるtextit{GigaBrain-0.5M*}を提案する。
これは1万時間以上のロボット操作データに基づいて事前トレーニングされており、その中間バージョンは現在、国際RoboChallengeベンチマークで第1位である。
\textit{GigaBrain-0.5M*} はさらに、世界モデルベースの強化学習を \textit{RAMP} (Reinforcement leArning via world Model-conditioned Policy) を通じて統合し、堅牢なクロスタスク適応を実現する。
実験結果から, RECAPベースラインに対して, \textit{RAMP} が大幅な性能向上を達成し, \texttt{Laundry Folding} や \texttt{Box Packing} , \texttt{Espresso Preparation} などの課題に対して約 30 % の改善が得られた。
批判的に言えば、 \textit{GigaBrain-0.5M$^*$} は信頼性の高いロングホライゾン実行を示し、我々の \href{https://gigabrain05m.github.io}{project page} 上の実世界のデプロイビデオによって検証されるように、失敗することなく複雑な操作タスクを一貫して達成している。
関連論文リスト
- WorldDiT: A Unified Diffusion Architecture for World and Action Modeling [8.370690859866412]
WorldDiTは、アクション生成とビジュアルワールドモデリングを結合した統合拡散トランスフォーマーアーキテクチャである。
トレーニング中、単一の拡散トランスフォーマーが連続的なアクションチャンクを生成し、将来のカメラフレームから正規化されたRGBパッチターゲットを予測する。
論文 参考訳(メタデータ) (2026-07-27T00:55:10Z) - InternVLA-A1.5: Unifying Understanding, Latent Foresight, and Action for Compositional Generalization [81.9611022323101]
本稿では,VQAとサブタスク予測のトレーニングを継続するネイティブVLMバックボーン上にポリシを構築するInternVLA-A1.5について述べる。
将来の予測は、学習可能な予測トークンの小さなセットが、凍結事前学習されたビデオ生成モデルの監督の下で、タスク関連の将来をコンパクトな遅延コードに凝縮する潜時予測問題として再放送される。
InternVLA-A1.5は、1.2Mのロボットエピソードと3Mのマルチモーダルサンプルで事前訓練され、6つのシミュレーションベンチマークで最高の結果を得る。
論文 参考訳(メタデータ) (2026-07-06T12:25:30Z) - Light-WAM: Efficient World Action Models with State-Fusion Action Decoding [15.384126562001027]
Light-WAMは、効率的なロボット操作のための軽量なワールドアクションモデルである。
コンパクトなビデオバックボーンで構築され、ダウンサンプリングされた潜在空間で将来のビデオ監視を行う。
実験により、Light-WAMはLIBERO上で強力な性能を維持し、RoboTwin 2.0上で使用可能なマルチタスク性能を実現している。
論文 参考訳(メタデータ) (2026-06-06T15:58:12Z) - World-Language-Action Model for Unified World Modeling, Language Reasoning, and Action Synthesis [37.19737492128721]
我々は,新しい基礎モデルのクラスとして,世界言語アクションモデルを提案する。
WLAはテキストのインストラクション、画像、ロボットステートを入力として、テキストのサブタスク、サブゴールイメージ、ロボットアクションを共同で予測する。
We show that WLA-0 achieve a state-of-the-the-art multi-task and long-horizon learning abilities、例えば、RoboTwin2.0 Clean の92.94%、RMBench の56.5%の成功率。
論文 参考訳(メタデータ) (2026-06-04T10:23:01Z) - DIAL: Decoupling Intent and Action via Latent World Modeling for End-to-End VLA [72.9197085473598]
DIALはハイレベルな意思決定と低レベルなモーター実行を、差別化可能な潜在意図ボトルネックを通じてブリッジするフレームワークである。
VLMベースのSystem-2は、VLMのネイティブな特徴空間内で、潜伏した視覚的フォレストによって潜伏世界モデリングを行う。
軽量のSystem-1ポリシーでは、この予測された意図と現在の観測結果を正確にロボットの動作にデコードする。
論文 参考訳(メタデータ) (2026-03-31T15:02:27Z) - Do World Action Models Generalize Better than VLAs? A Robustness Study [25.418384276142223]
視覚言語アクション(VLA)は、様々なロボットタスクで顕著な成功を収めた。
世界行動モデル(WAM)は、将来の状態を予測するために大量のビデオデータに基づいて訓練された世界モデルに基づいて構築される。
LIBERO-Plus と RoboTwin 2.0-Plus のベンチマークにおいて,様々な視覚的・言語的摂動による性能評価を行った。
論文 参考訳(メタデータ) (2026-03-23T15:13:15Z) - VLAW: Iterative Co-Improvement of Vision-Language-Action Policy and World Model [87.75549463328836]
本研究の目的は、反復的なオンラインインタラクションにより、視覚言語アクション(VLA)モデルの性能と信頼性を向上させることである。
本稿では,実世界のロールアウトデータを用いて,世界モデルの忠実度を向上する簡易な反復改善アルゴリズムを提案する。
基本方針よりも39.2%の絶対成功率向上と、生成した合成ロールアウトによるトレーニングによる11.6%の改善を実現している。
論文 参考訳(メタデータ) (2026-02-12T15:21:47Z) - A Pragmatic VLA Foundation Model [66.76609538850478]
我々はLingBot-VLAを開発し、9つの人気のデュアルアームロボット構成から約2万時間のリアルタイムデータを収集した。
我々のモデルは競争相手よりも明らかな優位性を実現し、その強靭な性能と広範な一般化性を示している。
ロボット学習の分野を前進させるために、コード、ベースモデル、ベンチマークデータへのオープンアクセスを提供する。
論文 参考訳(メタデータ) (2026-01-26T17:08:04Z) - InternVLA-A1: Unifying Understanding, Generation and Action for Robotic Manipulation [77.07565723756119]
InternVLA-A1は動的予測機能を備えた視覚言語モデルである。
我々は、実世界のロボットデータ、合成シミュレーションデータ、人間のビデオなどを用いて、これらのモデルを異種データソース上で事前訓練する。
InternVLA-A1を実世界の12のロボットタスクとシミュレーションベンチマークで評価した。
論文 参考訳(メタデータ) (2026-01-05T18:54:29Z) - STORM: Search-Guided Generative World Models for Robotic Manipulation [10.365032830677162]
STORMはロボット操作における時間的推論のためのフレームワークである。
拡散に基づくアクション生成、条件付きビデオ予測、検索ベースの計画を統合する。
ストームは視覚的に計画を立て、解釈可能でフォアサイト駆動の意思決定を可能にする。
論文 参考訳(メタデータ) (2025-12-20T19:40:25Z) - Evo-1: Lightweight Vision-Language-Action Model with Preserved Semantic Alignment [13.582337741042773]
VLA(Vision-Language-Action)モデルは、知覚、言語、制御を統一し、ロボットがマルチモーダル理解を通じて多様なタスクを実行できる強力なフレームワークとして登場した。
現行のVLAモデルは一般に大量のパラメータを含んでおり、大規模なロボットデータの事前トレーニングに大きく依存しているため、トレーニング中に高い計算コストがかかり、リアルタイム推論へのデプロイが制限される。
本稿では,ロボットデータを事前学習することなく高い性能を維持しつつ,計算を削減し,デプロイメント効率を向上させる軽量VLAモデルであるEvo-1を提案する。
論文 参考訳(メタデータ) (2025-11-06T17:07:49Z) - Latent Action Pretraining Through World Modeling [1.988007188564225]
自己教師型手法で模倣学習モデルを事前学習するためのモデルに依存しないフレームワークであるLAWMを提案する。
当社のフレームワークは,タスクや環境,実施環境の移動に有効であるように設計されています。
論文 参考訳(メタデータ) (2025-09-22T21:19:10Z) - Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos [66.62109400603394]
本稿では,大規模な人体ビデオで訓練された視覚・言語・行動モデルであるBeing-H0を紹介する。
提案手法は,人間のビデオからの大規模VLA事前学習,3次元推論のための物理空間アライメント,ロボット作業のためのポストトレーニング適応を組み合わせた,新しいトレーニングパラダイムである物理インストラクションチューニングに重点を置いている。
本研究では,手の動き生成と指示の結果としてのBeat-H0の卓越性を実証的に示すとともに,モデルやデータサイズにもよく対応している。
論文 参考訳(メタデータ) (2025-07-21T13:19:09Z) - SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics [37.82471658370026]
視覚言語モデル(VLM)は、豊富な視覚的および言語的知識を符号化した大規模マルチモーダルデータセットで事前訓練された。
SmolVLAは、トレーニングと推論の両方のコストを大幅に削減する、小さく、効率的で、コミュニティ主導のVLAである。
論文 参考訳(メタデータ) (2025-06-02T16:30:19Z) - FLARE: Robot Learning with Implicit World Modeling [87.81846091038676]
$textbfFLARE$は、予測潜在世界モデリングをロボットポリシー学習に統合する。
$textbfFLARE$は最先端のパフォーマンスを実現し、これまでのポリシー学習のベースラインを最大26%上回っている。
この結果は、暗黙の世界モデリングと高周波ロボット制御を組み合わせた汎用的でスケーラブルなアプローチとして$textbfFLARE$を確立した。
論文 参考訳(メタデータ) (2025-05-21T15:33:27Z) - RLVR-World: Training World Models with Reinforcement Learning [41.04369775904968]
検証可能な報酬で強化学習を活用する統合フレームワークであるRLVR-Worldを提案する。
我々は,テキストゲーム,Webナビゲーション,ロボット操作など,ドメイン間の言語およびビデオベースの世界モデルにおいて,大幅なパフォーマンス向上を示す。
論文 参考訳(メタデータ) (2025-05-20T05:02:53Z) - OTTER: A Vision-Language-Action Model with Text-Aware Visual Feature Extraction [95.6266030753644]
Vision-Language-Action(VLA)モデルは、視覚的な観察と言語指示に基づいてロボット行動を予測することを目的としている。
既存のアプローチでは、視覚的特徴と言語的特徴が独立して下流ポリシーに供給されるため、微調整済みの視覚言語モデル(VLM)が必要である。
本稿では,テキスト認識による視覚的特徴抽出によって既存のアライメントを活用する新しいVLAアーキテクチャOTTERを提案する。
論文 参考訳(メタデータ) (2025-03-05T18:44:48Z) - Boosting Continual Learning of Vision-Language Models via Mixture-of-Experts Adapters [65.15700861265432]
本稿では,視覚言語モデルを用いた漸進的学習における長期的忘れを緩和するパラメータ効率の連続学習フレームワークを提案する。
提案手法では,Mixture-of-Experts (MoE)アダプタの統合により,事前学習したCLIPモデルの動的拡張を行う。
視覚言語モデルのゼロショット認識能力を維持するために,分布判別オートセレクタを提案する。
論文 参考訳(メタデータ) (2024-03-18T08:00:23Z) - STORM: Efficient Stochastic Transformer based World Models for
Reinforcement Learning [82.03481509373037]
近年,モデルに基づく強化学習アルゴリズムは視覚入力環境において顕著な有効性を示している。
本稿では,強力なモデリングと生成機能を組み合わせた効率的な世界モデルアーキテクチャであるTransformer-based wORld Model (STORM)を紹介する。
Stormは、Atari 100$kベンチマークで平均126.7%の人的パフォーマンスを達成し、最先端のメソッドの中で新しい記録を樹立した。
論文 参考訳(メタデータ) (2023-10-14T16:42:02Z) - Seer: Language Instructed Video Prediction with Latent Diffusion Models [43.708550061909754]
テキスト条件付きビデオ予測(TVP)は,一般的なロボットポリシー学習を促進する上で不可欠な課題である。
時間軸に沿って,事前訓練されたテキスト・ツー・イメージ(T2I)の安定拡散モデルを膨らませることで,サンプルモデルと計算効率のよいtextbfSeerを提案する。
適応設計のアーキテクチャにより、Seerは高忠実でコヒーレントで命令に準拠したビデオフレームを生成することができる。
論文 参考訳(メタデータ) (2023-03-27T03:12:24Z) - Unifying Language Learning Paradigms [96.35981503087567]
データセットやセットアップ全体にわたって普遍的に有効である事前学習モデルのための統一的なフレームワークを提案する。
本研究では, 事前学習対象を相互に配置し, 異なる対象間の補間を効果的に行う方法を示す。
また,テキスト内学習において,ゼロショットSuperGLUEで175B GPT-3,ワンショット要約でT5-XXLの性能を3倍に向上させた。
論文 参考訳(メタデータ) (2022-05-10T19:32:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。