論文の概要: GeoBridge-VLA: Geometry-Aware Residual Adaptation for Vision-Language-Action Models
- arxiv url: http://arxiv.org/abs/2610.05026v1
- Date: Sun, 04 Oct 2026 07:42:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-11 06:56:46.747679
- Title: GeoBridge-VLA: Geometry-Aware Residual Adaptation for Vision-Language-Action Models
- Title(参考訳): GeoBridge-VLA:ビジュアル・ランゲージ・アクション・モデルのための幾何学的残差適応
- Abstract要約: 視覚-言語-アクション(VLA)モデルは、視覚-言語事前学習から意味情報を符号化するが、操作には正確な空間的推論も必要である。
予め学習したVLAの凍結した視覚エンコーダから幾何学的特徴を学習するための2段階のGeoBridge-VLAを提案する。
- 参考スコア(独自算出の注目度): 1.6537468371816468
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-language-action (VLA) models encode semantic information from vision-language pretraining, but manipulation also requires precise spatial reasoning. We present GeoBridge-VLA, a two-stage method for learning geometric features from a pretrained VLA's frozen visual encoder and using them for action prediction. Stage I trains a feature bridge and geometry decoder with depth supervision. Stage II freezes these modules and trains a gated residual interface together with the action-side projections and action expert. The residual augments the existing visual tokens without adding a second image encoder or increasing the token count. Deployment requires RGB, robot state, and language, but no depth observations. Under matched evaluation conditions, GeoBridge-VLA achieves 70.9% success on LIBERO, compared with 60.0% for SmolVLA. Disabling the residual in the same trained checkpoint reduces success from 70.90% to 69.85%, with mixed effects across suites. On a physical ROBOTIS OMY robot, GeoBridge-VLA succeeds in 148 of 200 trials (74.0%) across four tasks, compared with 108 of 200 (54.0%) for SmolVLA.
- Abstract(参考訳): 視覚-言語-アクション(VLA)モデルは、視覚-言語事前学習から意味情報を符号化するが、操作には正確な空間的推論も必要である。
予め訓練されたVLAの凍結した視覚エンコーダから幾何学的特徴を学習し,それを用いて行動予測を行う2段階のGeoBridge-VLAを提案する。
ステージ1は、深度監視を備えた特徴橋と幾何デコーダを訓練する。
Stage IIはこれらのモジュールを凍結し、アクションサイドプロジェクションとアクションエキスパートと一緒にゲートされた残留インターフェースをトレーニングする。
残余は、第2の画像エンコーダを追加したり、トークン数を増やすことなく、既存のビジュアルトークンを増強する。
デプロイにはRGB、ロボットの状態、言語が必要ですが、詳細な観察は必要ありません。
一致した評価条件下では、GeoBridge-VLAは、SmolVLAの60.0%に比べて、LIBEROで70.9%の成功を達成している。
同じ訓練されたチェックポイントで残余を無効にすると、70.90%から69.85%に減少し、スイート全体での混合効果がある。
物理ロボットRobotIS OMYでは、GeoBridge-VLAは4つのタスクで200の試験のうち148の試験(74.0%)で成功し、SmolVLAでは108の試験(54.0%)で成功している。
関連論文リスト
- Robo-Harness K1: Harnessing Robot-Use Agents via Perception Augmentation [61.15247763568461]
本稿では,ロボット利用エージェントフレームワークであるRobo-Harness K1を紹介する。
一致した LIBERO-PRO タスクでは、Gemini 3.7 Flash with K1 が 77.8% に達し、GPT-6 Astra の 61.1% を RGB のみのハーネスで上回った。
RoboTwin では Easy で 32.0%、Hard で 28.0% を達成し、視覚的および環境的な摂動に対するレジリエンスを示している。
論文 参考訳(メタデータ) (2026-09-24T11:16:18Z) - GEAR-VLA: Learning Geometry-Aware Action Representations for Generalizable Robotic Manipulation [49.16739604572808]
VLA(Vision-Language-Action)モデルは、強力なベンチマークパフォーマンスを実現するが、目に見えないオブジェクトによる現実世界のデプロイに苦労する。
これは、統合幾何認識の操作表現が欠如していることに起因していると我々は主張する。
一般化可能なロボット操作のための統合幾何認識行動表現を学習するためのVLAフレームワークであるGEAR-VLAを提案する。
論文 参考訳(メタデータ) (2026-06-07T09:23:16Z) - Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments [96.23886784364997]
身体的な知性は、操作やナビゲーションといった個々のタスクのための特別なモデルを通してしばしば研究される。
本稿では,Qwenの視覚言語モデリングスタックを連続的な動作と軌道生成に拡張した統一的な基礎モデルであるQwen-VLAを提案する。
論文 参考訳(メタデータ) (2026-05-28T17:36:31Z) - Uni-LaViRA: Language-Vision-Robot Actions Translation for Unified Embodied Navigation [60.07205156194741]
身体的なナビゲーションでは、エージェントが言語や視覚的な観察を、実際に見たことのない環境を通して実際のロボットを駆動する空間的な行動の流れにマッピングする必要がある。
統合エージェントアーキテクチャであるUni-LaViRAを4つのタスクファミリと4つの異種実ロボットに拡張する。
論文 参考訳(メタデータ) (2026-05-26T18:52:04Z) - Not All Features Are Created Equal: A Mechanistic Study of Vision-Language-Action Models [2.5338045371474816]
VLA(Vision-Language-Action)モデルは、単一のアーキテクチャにおける知覚、言語、運動制御を組み合わせたモデルである。
394,000回以上のロールアウトエピソードにまたがる80M--7Bパラメータに,アクティベーションインジェクション,スパースオートエンコーダ,線形プローブを適用した。
論文 参考訳(メタデータ) (2026-03-19T17:59:55Z) - DepthVLA: Enhancing Vision-Language-Action Models with Depth-Aware Spatial Reasoning [35.44151923549777]
VLA(Vision-Language-Action)モデルは最近、印象的な一般化と言語誘導操作機能を示している。
視覚言語モデル(VLM)から受け継いだ空間的推論の制限による空間的推論の精度の低下
本稿では,プレトレーニングした深度予測モジュールを通じて空間認識を明示的に組み込んだ,シンプルで効果的なVLAアーキテクチャであるDepthVLAを提案する。
論文 参考訳(メタデータ) (2025-10-15T10:09:00Z) - BridgeVLA: Input-Output Alignment for Efficient 3D Manipulation Learning with Vision-Language Models [37.699828966838986]
BridgeVLAは、3D入力を複数の2D画像に投影し、VLMバックボーンとの入力アライメントを保証する新しい3D VLAモデルである。
アクション予測に2Dヒートマップを使用し、一貫した2次元画像空間内の入力空間と出力空間を統一する。
10以上のタスクで96.8%の成功率を達成することができ、1タスクにつき3つの軌道しか持たず、異常なサンプル効率を誇示している。
論文 参考訳(メタデータ) (2025-06-09T17:36:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。