論文の概要: Latent Bridge: Feature Delta Prediction for Efficient Dual-System Vision-Language-Action Model Inference
- arxiv url: http://arxiv.org/abs/2605.02739v1
- Date: Mon, 04 May 2026 15:37:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-05 20:33:50.383075
- Title: Latent Bridge: Feature Delta Prediction for Efficient Dual-System Vision-Language-Action Model Inference
- Title(参考訳): ラテントブリッジ:高能率デュアルシステム・ビジョン・ランゲージ・アクションモデル推論のための特徴デルタ予測
- Authors: Yudong Liu, Yuan Li, Zijia Tang, Yuxi Zheng, Yueqian Lin, Qinsi Wang, Yi Li, Shuangjun Liu, Shuai Zhang, Taotao Jing, Dashan Gao, Ning Bi, Jingwei Sun, Yiran Chen, Hai Li,
- Abstract要約: 本稿では,VLM出力の時間差を推定する軽量モデルであるLatent Bridgeを提案する。
ラテントブリッジは95-100%の性能維持を実現し、VLMコールを50-75%削減し、エピソード当たり1.65-1.73xネットのスピードアップを実現している。
- 参考スコア(独自算出の注目度): 22.977205925809134
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Dual-system Vision-Language-Action (VLA) models achieve state-of-the-art robotic manipulation but are bottlenecked by the VLM backbone, which must execute at every control step while producing temporally redundant features. We propose Latent Bridge, a lightweight model that predicts VLM output deltas between timesteps, enabling the action head to operate on predicted outputs while the expensive VLM backbone is called only periodically. We instantiate Latent Bridge on two architecturally distinct VLAs: GR00T-N1.6 (feature-space bridge) and π0.5 (KV-cache bridge), demonstrating that the approach generalizes across VLA designs. Our task-agnostic DAgger training pipeline transfers across benchmarks without modification. Across four LIBERO suites, 24 RoboCasa kitchen tasks, and the ALOHA sim transfer-cube task, Latent Bridge achieves 95-100% performance retention while reducing VLM calls by 50-75%, yielding 1.65-1.73x net per-episode speedup.
- Abstract(参考訳): デュアルシステム・ビジョン・ランゲージ・アクション(VLA)モデルは最先端のロボット操作を実現するが、VLMバックボーンによってボトルネックとなる。
我々は,VLM出力デルタを時間ステップ間で予測し,高価なVLMバックボーンが周期的にのみ呼ばれるのに対して,アクションヘッドが予測出力で動作できるようにする軽量モデルであるLatent Bridgeを提案する。
アーキテクチャ的に異なる2つのVLA上に、GR00T-N1.6 (Feature-space bridge) とπ0.5 (KV-cache bridge) というラテントブリッジをインスタンス化し、アプローチがVLA設計全体にわたって一般化されることを実証した。
タスクに依存しないDAggerトレーニングパイプラインは、変更せずにベンチマーク間で転送されます。
4つのLIBEROスイート、24のRoboCasaキッチンタスク、ALOHA simトランスファーキュータスクでラテントブリッジは95-100%のパフォーマンス維持を実現し、VLMコールを50-75%削減し、エピソード当たり1.65-1.73xネットのスピードアップを実現した。
関連論文リスト
- A1: A Fully Transparent Open-Source, Adaptive and Efficient Truncated Vision-Language-Action Model [112.9420001646428]
VLA(Vision-Language-Action)モデルは、オープンワールドロボット操作の強力なパラダイムとして登場したが、実際の展開はコストに制約されることが多い。
我々は、低コストで高スループットな推論のために設計された、完全にオープンソースで透明なVLAフレームワークであるA1を提示する。
A1は最先端の成功率を達成すると同時に、推論コストを大幅に削減する。
論文 参考訳(メタデータ) (2026-04-07T10:18:40Z) - dVLA: Diffusion Vision-Language-Action Model with Multimodal Chain-of-Thought [66.78110237549087]
VLA(Vision-Language-Action)モデルは、ロボット工学の次世代パラダイムとして登場しつつある。
単一システムにおける視覚認識,言語推論,ロボット制御を統一する拡散型VLAであるdVLAを紹介する。
論文 参考訳(メタデータ) (2025-09-30T02:36:11Z) - SpecVLM: Fast Speculative Decoding in Vision-Language Models [14.243294546325714]
投機的復号化は自己回帰型大規模言語モデル(LLM)を高速化する強力な方法である
視覚言語モデル(VLM)の投機的復号化について検討する。
1.5--2.3xのエンドツーエンドの高速化を完全自己回帰推論で実現する実用システムであるSpecVLMを紹介する。
論文 参考訳(メタデータ) (2025-09-15T11:53:56Z) - OpenVLA: An Open-Source Vision-Language-Action Model [131.74098076670103]
我々は、970kの現実世界のロボットデモの多様なコレクションに基づいて訓練されたオープンソースのVLAであるOpenVLAを紹介した。
OpenVLAは汎用的な操作の強力な結果を示し、RT-2-X (55B) のようなクローズドモデルよりも16.5%高い絶対的なタスク成功率を示した。
モデルチェックポイント、微調整ノートブック、そしてOpen X-Embodimentデータセット上で大規模にVLAをトレーニングするためのビルトインサポートを備えたPyTorchをリリースしています。
論文 参考訳(メタデータ) (2024-06-13T15:46:55Z) - An Empirical Study of Training End-to-End Vision-and-Language
Transformers [50.23532518166621]
我々はMETER(textbfMultimodal textbfEnd-to-end textbfTransformtextbfER)を提案する。
具体的には、視覚エンコーダ(例えば、CLIP-ViT、Swin変換器)、テキストエンコーダ(例えば、RoBERTa、DeBERTa)、マルチモーダルフュージョン(例えば、マージアテンション対共振器)である。
論文 参考訳(メタデータ) (2021-11-03T17:55:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。