論文の概要: SLIP-VLA: Single-Step Latent Imagination for Policy Learning in Vision-Language-Action Models
- arxiv url: http://arxiv.org/abs/2609.33575v1
- Date: Sun, 27 Sep 2026 13:53:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-05 15:38:34.522079
- Title: SLIP-VLA: Single-Step Latent Imagination for Policy Learning in Vision-Language-Action Models
- Title(参考訳): SLIP-VLA:ビジョン・ランゲージ・アクション・モデルにおける政策学習のための1ステップ遅延イマジネーション
- Abstract要約: SLIP-VLAは,将来的な行動予測のための単一ステップ遅延ImaginationをVLAモデルに装備する政策学習フレームワークである。
SLIP-VLAは様々なシミュレーションベンチマークや実世界の操作タスクにまたがって最先端のパフォーマンスを実現している。
- 参考スコア(独自算出の注目度): 16.7490265550198
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-Language-Action models are increasingly effective for robotic manipulation, yet most predict actions directly from current observations without explicitly modeling future scene evolution. Recent methods introduce future prediction to improve action generation, but dense future modeling often requires expensive iterative denoising, while one-step alternatives can underperform their multi-step counterparts. To reconcile efficient future modeling with strong action performance, we present SLIP-VLA, a policy learning framework that equips VLA models with a Single-Step Latent Imagination for future-aware action prediction. SLIP-VLA obtains temporally dense future latent representations with a single denoising update, and we improve the perceptual sufficiency of these representations by aligning intermediate latents with future geometric and semantic features. We further improve their control sufficiency through action-conditioned latent world modeling and inverse dynamics modeling, explicitly coupling latent transitions with robot actions. SLIP-VLA achieves state-of-the-art performance across diverse simulation benchmarks and real-world manipulation tasks, while its single-step latent imagination takes only 12 ms.
- Abstract(参考訳): ビジョン・ランゲージ・アクションモデルはロボット操作にますます効果的になるが、ほとんどの場合、将来のシーンの進化を明示的にモデル化することなく、現在の観測から直接行動を予測する。
近年の手法では, 行動生成を改善するための予測手法が提案されているが, 複雑な将来のモデリングには高コストの反復的復調が必要となる場合が多い。
本稿では,行動予測のための単一ステップ遅延ImaginationをVLAモデルに組み込んだ政策学習フレームワークSLIP-VLAを提案する。
SLIP-VLAは, 時間的に密度の高い将来の潜伏表現を1つの復調アップデートで取得し, 中間潜伏表現と将来の幾何学的・意味的特徴を整合させることにより, これらの表現の知覚的充足性を改善する。
動作条件付き潜伏世界モデリングと逆ダイナミクスモデリングにより,ロボットの動作と潜伏遷移を明示的に結合することで,制御効率をさらに向上する。
SLIP-VLAは様々なシミュレーションベンチマークや実世界の操作タスクにまたがって最先端のパフォーマンスを実現している。
関連論文リスト
- MoWAM: Explicit Future Motion Prediction for Efficient World Action Models [38.28877145670457]
MoWAMは、将来の動画生成を明示的な将来の動き予測に置き換える効率的なWAMである。
Mixture-of-Transformerアーキテクチャは、動作と動作を共同で予測しながら、トレーニング中の将来の視覚力学を学習する。
LIBERO, LIBERO-Plus, および実世界の操作タスクの実験により, MoWAMは, 配電性能が向上し, 配電安定性が向上し, より平均的な実世界の成功が得られた。
論文 参考訳(メタデータ) (2026-09-17T17:07:00Z) - Learning to Use Imagination: Progress-Conditioned Future Utilization for World Action Models [72.02240114225107]
World Action Models (WAM) は、将来の視覚力学をアクション生成に組み込むことでビジョン・ランゲージ・アクション(VLA)モデルを拡張する。
既存のWAMは、実行の進行に限られた適応性を持つ想像上の未来をしばしば利用し、注意散らしや信頼性の低い予測方法を導入する可能性がある。
本稿では,プログレッシブ・コンディションド・ワールド・アクション・モデルであるProWAMを提案する。
論文 参考訳(メタデータ) (2026-09-06T12:46:20Z) - LaWAM: Latent World Action Models for Efficient Dynamics-Aware Robot Policies [31.88655699486955]
ラワント・アクション条件付きラワント・ワールドモデル(LaWM)を提案する。
LaWAMは、将来のビデオの再構成ではなく、コンパクトで潜伏した視覚サブゴールを通じて、ロボットポリシーに対する予測ダイナミクスを公開する。
LaWAMはアクションチャンク予測あたり187msで動作し、画素空間のWAMよりも最大24倍の遅延時間を実現する。
論文 参考訳(メタデータ) (2026-06-14T12:06:58Z) - FutureVLA: Joint Visuomotor Prediction for Vision-Language-Action Model [73.03346643967309]
我々は、効果的な共同運動予測モデルには、時間的連続性と視覚的条件による監督的疎結合の両方が必要であると論じる。
FutureVLAは、視覚情報と運動情報を最初に分離することで、関節振動子埋め込みを抽出するように設計されている。
訓練後の段階において、我々は遅延埋め込みアライメント戦略を採用し、様々な下流VLAモデルによりこれらの時間的先行を内部化することができる。
論文 参考訳(メタデータ) (2026-03-11T12:39:55Z) - Chain of World: World Model Thinking in Latent Motion [24.24061036481793]
VLA(Vision-Language-Action)モデルはしばしば、視覚力学の基礎となる予測的・時間的・因果的構造を見落としている。
我々は,世界モデルの時間的推論を非絡み合いの潜在動作表現と統合する新しい「世界の連鎖」パラダイムであるCoWVLAを紹介した。
CoWVLAは、既存のワールドモデルおよび潜在アクションアプローチより優れ、適度な計算効率を達成する。
論文 参考訳(メタデータ) (2026-03-03T17:52:06Z) - World Guidance: World Modeling in Condition Space for Action Generation [39.098315503589895]
アクション生成を容易にするために将来の観測モデルを活用することで、ビジョン・ランゲージ・アクション(VLA)モデルの能力を高めるための有望な道が提示される。
動作推論パイプラインに注入することで、将来の観測結果をコンパクトな条件にマッピングするフレームワークであるWoGを提案する。
この条件空間のモデル化と予測は, きめ細かな動作生成を促進するだけでなく, より優れた一般化能力を示すことを示す。
論文 参考訳(メタデータ) (2026-02-25T15:27:09Z) - Self-Correcting VLA: Online Action Refinement via Sparse World Imagination [55.982504915794514]
本稿では, 自己補正VLA (SC-VLA) を提案する。
SC-VLAは最先端のパフォーマンスを達成し、最高タスクスループットを16%削減し、最高パフォーマンスのベースラインよりも9%高い成功率を得る。
論文 参考訳(メタデータ) (2026-02-25T06:58:06Z) - Reshaping Action Error Distributions for Reliable Vision-Language-Action Models [69.38615670891038]
ロボット操作において、視覚言語アクション(VLA)モデルは、一般化可能でスケーラブルなロボットポリシーを学ぶための有望なパラダイムとして登場した。
連続動作型VLAモデルに焦点をあて、トレーニング中の動作誤差分布を再構成することにより、従来のMSEベースの回帰を超越する。
複数の代表的VLAアーキテクチャ上で、標準、少数ショット、ノイズの多い設定にまたがるアプローチを評価します。
論文 参考訳(メタデータ) (2026-02-04T05:37:09Z) - On-the-Fly VLA Adaptation via Test-Time Reinforcement Learning [61.38273866396522]
ビジョン・ランゲージ・アクションモデルが汎用ロボット学習の強力なパラダイムとして登場した。
現在の手法は、シミュレーションや物理世界の展開に挑戦するには相変わらず適していない。
本稿では,VLA フレームワークのテスト時間強化学習について紹介する。
論文 参考訳(メタデータ) (2026-01-11T01:51:30Z) - mimic-video: Video-Action Models for Generalizable Robot Control Beyond VLAs [5.109732854501585]
そこで我々は,事前学習したインターネットスケールのビデオモデルと,その潜在表現に条件付けされたフローマッチングに基づくアクションデコーダを組み合わせた,新しいビデオ・アクション・モデル(VAM)を提案する。
提案手法は,シミュレーションおよび実世界のロボット操作タスクにおける最先端性能を実現し,サンプル効率を10倍,収束速度を2倍向上させる。
論文 参考訳(メタデータ) (2025-12-17T18:47:31Z) - CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models [89.44024245194315]
視覚言語行動モデル(VLA)に明示的な視覚連鎖(CoT)推論を組み込む手法を提案する。
視覚およびアクショントークンの理解と生成が可能な最先端の7B VLAであるCoT-VLAを紹介する。
実験の結果,CoT-VLAは実世界の操作タスクでは17%,シミュレーションベンチマークでは6%,最先端のVLAモデルでは6%,高い性能を示した。
論文 参考訳(メタデータ) (2025-03-27T22:23:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。