論文の概要: Closing the Lab-to-Store Gap: A Data-Efficient Post-Training and Experience-Driven Learning VLA Framework for Retail Humanoids
- arxiv url: http://arxiv.org/abs/2607.20345v1
- Date: Wed, 22 Jul 2026 16:30:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 18:51:38.156225
- Title: Closing the Lab-to-Store Gap: A Data-Efficient Post-Training and Experience-Driven Learning VLA Framework for Retail Humanoids
- Title(参考訳): Lab-to-Storeギャップのクローズ:リテールヒューマノイドのためのデータ効率の良いポストトレーニングと経験駆動学習VLAフレームワーク
- Authors: Roger Sala Sisó, Tiago Silvério, Jakob Sand, Tran Nguyen Le,
- Abstract要約: 本稿では,Unitree G1-Edu ヒューマノイドロボットとGR00T N1.6 ファンデーションモデルを用いて,スーパーマーケットチップの補充作業におけるシステムレベルのアプローチを提案する。
ディードは、(1)制御周波数アライメント、データキュレーション、タスク関連視覚強調表示、およびVLA依存度を低減したデータ効率後学習パイプライン、(2)テキストベースアドバンストプレフィックスとビジョン言語値関数を介してRECAPから適応された実世界の経験駆動改善の研究、(3)内外分布行動を研究するための潜時空間分析ツールからなる。
- 参考スコア(独自算出の注目度): 0.14680035572775532
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Closing the gap between benchmark performance and reliable real-world operation remains a central challenge for Vision-Language-Action (VLA) humanoid robots, which must handle execution errors, distribution shifts, and environmental variability. This paper presents DEED (Data-Efficient Post-Training and Experience-Driven Learning), a systems-level approach evaluated on a supermarket chip-restocking task using a Unitree G1-Edu humanoid robot and the GR00T N1.6 foundation model. DEED comprises three key components: (1) a data-efficient post-training pipeline with control-frequency alignment, data curation, task-relevant visual highlighting, and reduced VLA dependence; (2) a real-world study of experience-driven refinement, adapted from RECAP via a text-based advantage prefix and a vision-language value function; and (3) a latent-space analysis tool for studying in- and out-of-distribution behavior. Our results suggest that bridging the lab-to-store gap is primarily a systems integration challenge rather than an architectural one: careful data design and targeted post-training can transform a policy that fails under naive fine-tuning into a competent real-world system using only a single GPU.
- Abstract(参考訳): VLA(Vision-Language-Action)ヒューマノイドロボットは、実行エラー、分散シフト、環境変動を処理しなければならない。
本稿では,Unitree G1-Edu ヒューマノイドロボットとGR00T N1.6 ファンデーションモデルを用いて,スーパーマーケットチップの補充作業におけるシステムレベルのアプローチであるDEED(Data-Efficient Post-Training and Experience-Driven Learning)を提案する。
DEEDは,(1)制御周波数アライメント,データキュレーション,タスク関連視覚強調表示,およびVLA依存度を低減した学習後パイプライン,(2)テキストベースのアドバンテージプレフィックスとビジョン言語値関数を介してRECAPから適応された実世界における経験駆動改善の研究,(3)イン・オブ・アウト・ディストリビューション行動を研究するための潜時空間分析ツールである。
注意深いデータ設計と目標とするポストトレーニングは、素早い微調整の下で失敗するポリシを、1つのGPUのみを使用して、有能な現実世界システムに変換することが可能です。
関連論文リスト
- VISTA: Vision-Grounded and Physics-Validated Adaptation of UMI data for VLA Training [52.05483137072975]
Universal Manipulation Interface (UMI)は、ハードウェア固有の遠隔操作なしでスケーラブルな実世界のロボットデータ収集を可能にする。
VISTAは、この2つのギャップを3つの相乗的コンポーネントを通して橋渡しするフレームワークである。
我々は,物理検証パイプライン,UMI-VQA,検証された軌道データ,コミュニティのための事前学習モデルをリリースする。
論文 参考訳(メタデータ) (2026-06-03T10:38:45Z) - HoloBrain-0 Technical Report [24.68330043768013]
HoloBrain-0はVLA(Vision-Language-Action)フレームワークである。
本システムの中核となるVLAアーキテクチャは,マルチビューカメラパラメータやキネマティックな記述を含む,ロボットのエンボディメントを明示的に組み込んだ新しいアーキテクチャである。
1) 強力な事前トレーニングされたVLA基盤、(2) 複数のシミュレーションスイートと実世界のタスクのためのトレーニング後のチェックポイント、(3) データキュレーション、モデルトレーニング、デプロイメントのためのフルスタックのVLAインフラストラクチャであるRoboOrchardを含む、HoloBrainエコシステム全体をオープンソースにしています。
論文 参考訳(メタデータ) (2026-02-12T15:21:04Z) - Rethinking Visual-Language-Action Model Scaling: Alignment, Mixture, and Regularization [65.37179698521766]
VLA(Vision-Language-Action)モデルは、ジェネラリストロボットの制御を強く約束する。
標準的な「スケールデータ」レシピがロボット工学に翻訳されるかどうかはまだ不明だ。
本稿では,多様なロボットを対象とした事前学習のためのコアトレーニング選択を再考する,VLAスケーリングの体系的かつ制御された研究を提案する。
論文 参考訳(メタデータ) (2026-02-10T12:25:43Z) - Edge-Optimized Vision-Language Models for Underground Infrastructure Assessment [1.5124107808802705]
本稿では,地下欠陥のエンドツーエンド要約のための新しい2段階パイプラインを提案する。
私たちの軽量なRAPID-SCANセグメンテーションモデルと、エッジコンピューティングプラットフォームにデプロイされた微調整されたビジョンランゲージモデルを組み合わせています。
この結果から,自動欠陥検出とインフラストラクチャ保守のための実用的な洞察とのギャップを埋めるために,エッジデプロイ可能な統合AIシステムの可能性が示唆された。
論文 参考訳(メタデータ) (2026-02-03T17:03:46Z) - Human-in-the-loop Online Rejection Sampling for Robotic Manipulation [55.99788088622936]
Hi-ORSは、オンライン微調整中に負の報酬を得たサンプルをフィルタリングすることで、値推定を安定化する。
Hi-ORSは、わずか1.5時間でコンタクトリッチな操作をマスターするためのpiベースのポリシーを微調整する。
論文 参考訳(メタデータ) (2025-10-30T11:53:08Z) - Learning To Defer To A Population With Limited Demonstrations [13.40222956306532]
本稿では,L2D(L2D)システムを人口に遅延させる学習の実践的展開を妨げる重要なデータ不足に対処する。
メタラーニングを用いて,少数のデモンストレーションから専門家固有の埋め込みを生成する,コンテキスト対応の半教師付きフレームワークを導入する。
論文 参考訳(メタデータ) (2025-10-22T08:18:02Z) - A Data-Centric Revisit of Pre-Trained Vision Models for Robot Learning [67.72413262980272]
事前訓練された視覚モデル(PVM)は現代のロボティクスの基本であるが、その最適構成は定かではない。
セマンティック・ボトルネックを導入してオブジェクト中心の表現を誘導する手法であるSlotMIMを開発した。
提案手法は,画像認識,シーン理解,ロボット学習評価において,従来の作業よりも大幅に改善されている。
論文 参考訳(メタデータ) (2025-03-10T06:18:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。