論文の概要: GloVLA: Let Geometry Move and Local VLA Interact for Robust Object-Centric Manipulation in Unstructured Environments
- arxiv url: http://arxiv.org/abs/2609.06256v1
- Date: Sat, 05 Sep 2026 20:48:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-12 06:21:00.349151
- Title: GloVLA: Let Geometry Move and Local VLA Interact for Robust Object-Centric Manipulation in Unstructured Environments
- Title(参考訳): GloVLA:非構造環境におけるロバスト物体中心マニピュレーションのための幾何移動と局所VLA相互作用
- Abstract要約: 視覚言語アクション(VLA)モデルは、言語条件のロボット操作において有望な一般化を示す。
単一エンドツーエンドのVLAポリシーは、タスク関連領域へのエンドエフェクタの長距離輸送を同時に解決する必要がある。
オブジェクト中心の操作を2つの補完的な状態に明確に分離するハイブリッドフレームワークであるGloVLAを紹介する。
- 参考スコア(独自算出の注目度): 15.479388607422736
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Vision-language-action (VLA) models have shown promising generalization for language-conditioned robot manipulation, but deploying them in unstructured environments remains challenging. A single end-to-end VLA policy must simultaneously solve long-range transport of the end effector to task-relevant regions and short-horizon, contact-rich interaction upon arrival. This formulation is inefficient and brittle: small visual shifts, distractors, clutter, occlusions, or unfavorable initial gripper poses can push the policy outside the local state distribution in which it was trained, leading to task failure. We introduce GloVLA, a hybrid framework that explicitly separates object-centric manipulation into two complementary regimes: a geometric transport controller moves the end-effector into interaction-centric handoff regions, and local VLA policies handle only the short-horizon interaction phases. GloVLA is model-agnostic and can be integrated with different VLA backbones with no additional demonstrations and no changes to the action space or success predicate. Experiments on standard LIBERO and LIBERO-Plus Object tasks together with a newly introduced LIBERO-Challenge benchmark ettings with clutter, distractors,illumination changes, visual shifts, and obstruction show that GloVLA improves task success and substantially lowers VLA inference cost compared with full end-to-Challenge, full-trajectory GR00T N1.6execution degrades to 20.9% average success while GloVLA retains 88.5%; on a physical UR10e, overall success improves from 35.6% to 90.0% while mean inference time is more than halved. Videos and additional results are available at https://glovla-project.github.io/
- Abstract(参考訳): 視覚言語アクション(VLA)モデルでは、言語条件のロボット操作には有望な一般化が示されているが、それらを非構造化環境で展開することは依然として困難である。
単一エンドツーエンドのVLAポリシーは、タスク関連領域へのエンドエフェクタの長距離輸送と、到着時に短水平でコンタクトリッチな相互作用を同時に解決する必要がある。
この定式化は非効率で脆く、小さな視覚的シフト、邪魔者、散らかし、オクルージョン、または好ましくない初期グリップポーズは、訓練されたローカルな状態分布の外でポリシーをプッシュし、タスクの失敗につながる。
本稿では,オブジェクト中心の操作を2つの相補的な状態に明確に分離するハイブリッドフレームワークであるGloVLAを紹介する。
GloVLAはモデルに依存しないため、異なるVLAバックボーンと統合することができ、追加のデモは行わず、アクション空間の変更や成功予測は行わない。
標準の LIBERO と LIBERO-Plus Object タスクと、新たに導入された LIBERO-Challenge ベンチマークエッティング、イントラクタ、照明変更、視覚的シフト、障害物による実験により、GloVLA はタスクの成功を改善し、完全なエンド・ツー・チャンジに比べて VLA の推論コストを大幅に低下させ、GloVLA は 88.5% を維持し、実際の UR10e では、全体の成功は 35.6% から 90.0% に改善され、平均推論時間は 0.5 以上である。
ビデオと追加結果はhttps://glovla-project.github.io/で公開されている。
関連論文リスト
- Beyond Data Scaling: Representation-Centric Continued Pre-training for Vision-Language-Action Models [120.24139942108405]
ロボットデータのスケーリングは、一般のVision-Language-Action(VLA)モデルを構築する上で重要である。
固定されたロボットデータ予算の下では、継続した事前訓練は限られた軌道を伝達可能な視覚行動知識に変換する必要がある。
本稿では,VLA指向のVLMバックボーンであるVLActを提案する。
論文 参考訳(メタデータ) (2026-08-27T17:59:40Z) - CLAP: Direct VLM-to-VLA Adaptation via Language-Action Grounding [16.03159066719039]
CLAP(Causal Language-Action Prediction)は、自然言語アクション記述で各数値アクションシーケンスをプリペイドする。
CLAP は 0.8B, 2B, 4B で,単一の VLM 系統からオープンウェイトでマルチスケールのコンパクト VLA ファミリとしてリリースする。
論文 参考訳(メタデータ) (2026-07-09T22:34:11Z) - Semi-Supervised Vision-Language-Action Model [17.893249958828218]
VLA(Vision-Language-Action)モデルは、ロボットが視覚的な観察や言語指示から直接アクションを予測することを可能にするが、それらを新しい環境に適用することは、コストのかかるアクションラベルによるデモンストレーションに依存する。
限定的な監視信号の下で準教師付きVLA適応について検討し、少数の軌道だけがロボットの動作を含み、残りの軌道はアクション未ラベルの視覚言語観測を提供する。
標準的な半教師あり学習とは異なり、視覚的に接地し、言語に一貫性があり、物理的に実現可能で、時間的に安定な動作信号である。
論文 参考訳(メタデータ) (2026-06-19T14:42:52Z) - GEAR-VLA: Learning Geometry-Aware Action Representations for Generalizable Robotic Manipulation [49.16739604572808]
VLA(Vision-Language-Action)モデルは、強力なベンチマークパフォーマンスを実現するが、目に見えないオブジェクトによる現実世界のデプロイに苦労する。
これは、統合幾何認識の操作表現が欠如していることに起因していると我々は主張する。
一般化可能なロボット操作のための統合幾何認識行動表現を学習するためのVLAフレームワークであるGEAR-VLAを提案する。
論文 参考訳(メタデータ) (2026-06-07T09:23:16Z) - RotVLA: Rotational Latent Action for Vision-Language-Action Model [54.22746299071677]
本稿では,連続的な回転潜在動作表現に基づくVLAフレームワークであるRotVLAを紹介する。
潜在作用はSO(n) の元としてモデル化され、連続性、構成性、および実世界の作用力学と整合した構造的幾何学を提供する。
RotVLAはVLMバックボーンとフローマッチングアクションヘッドで構成される。
論文 参考訳(メタデータ) (2026-05-13T11:58:02Z) - AtomVLA: Scalable Post-Training for Robotic Manipulation via Predictive Latent World Models [9.608633915316252]
VLA(Vision-Language-Action)モデルでは、一般化可能なロボット操作の可能性を示している。
現在のパラダイムは、教師付き微調整中の粗大でハイレベルなタスク命令に依存している。
スケーラブルなオフライン後トレーニングパイプラインと統合された,最初のサブタスク対応VLAフレームワークである方法を提案する。
論文 参考訳(メタデータ) (2026-03-09T15:52:48Z) - LiLo-VLA: Compositional Long-Horizon Manipulation via Linked Object-Centric Policies [54.150202739999806]
LiLo-VLAは、新しいロングホライゾンタスクに対してゼロショットのモジュラリティをトレーニングすることなく実現できるモジュラーフレームワークである。
LIBERO-Long++とUltra-Longという2つの課題からなる21タスクのシミュレーションベンチマークを導入する。
これらのシミュレーションでは、LiLo-VLAは平均成功率69%を達成し、Pi0.5を41%、OpenVLA-OFTを67%上回った。
論文 参考訳(メタデータ) (2026-02-25T03:33:39Z) - Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation [95.89924101984566]
GPM(Global Prior Memory)とLCM(Local Consistency Memory)を備えたデュアルメモリVLAフレームワークOptimusVLAを紹介する。
GPMはガウスノイズを意味論的に類似した軌道から取得したタスクレベルの先行値に置き換える。
LCMは、時間的コヒーレンスと軌道の滑らかさを強制する学習された一貫性制約を注入する。
論文 参考訳(メタデータ) (2026-02-22T15:39:34Z) - OpenVLA: An Open-Source Vision-Language-Action Model [131.74098076670103]
我々は、970kの現実世界のロボットデモの多様なコレクションに基づいて訓練されたオープンソースのVLAであるOpenVLAを紹介した。
OpenVLAは汎用的な操作の強力な結果を示し、RT-2-X (55B) のようなクローズドモデルよりも16.5%高い絶対的なタスク成功率を示した。
モデルチェックポイント、微調整ノートブック、そしてOpen X-Embodimentデータセット上で大規模にVLAをトレーニングするためのビルトインサポートを備えたPyTorchをリリースしています。
論文 参考訳(メタデータ) (2024-06-13T15:46:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。