論文の概要: Explicit Language Memory for Long-Horizon Planning in Vision-Language-Action Models
- arxiv url: http://arxiv.org/abs/2608.04765v1
- Date: Wed, 05 Aug 2026 12:32:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.920485
- Title: Explicit Language Memory for Long-Horizon Planning in Vision-Language-Action Models
- Title(参考訳): 視覚・言語・行動モデルにおける長期計画のための明示的言語記憶
- Authors: Houze Xu, Jizhong Li, Ziyi Ye,
- Abstract要約: 視覚言語アクション(VLA)モデルは、視覚知覚、言語理解、ロボット制御を接続するための統一的なパラダイムを提供する。
本稿では,言語メモリモジュールを明示した階層型長水平VLAアーキテクチャを提案する。
提案手法を複数のシミュレーション環境で評価し,実際のロボットプラットフォーム上でシミュレート・トゥ・リアルな実験を行う。
- 参考スコア(独自算出の注目度): 4.644589778994777
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-language-action (VLA) models provide a unified paradigm for connecting visual perception, language understanding, and robotic control. However, existing VLA models still face major challenges in long-horizon tasks: sparse expert demonstrations constrain cross-task compositional generalization; the non-Markovian nature of long-horizon tasks makes it difficult for policies conditioned only on current observations to maintain temporal consistency; limited closed-loop error correction allows execution errors to accumulate; and end-to-end action fine-tuning may weaken the high-level semantic representations of vision-language model (VLM) backbones. To address these issues, we propose a hierarchical long-horizon VLA architecture with an explicit language-memory module. The central idea is to convert discrete temporal observations into a coherent textual memory sequence with temporal logic. The system is decoupled into a high-level VLM and a low-level VLA: the high-level VLM performs semantic reasoning through a visual question answering training paradigm, while the low-level VLA executes precise continuous control conditioned on subtask instructions and visual observations. The high-level VLM recursively updates both language memory and subtask instructions using the previous memory as a contextual anchor, enabling persistent temporal tracking and dynamic correction during long-horizon execution. We evaluate the proposed method in multiple simulation environments and conduct sim-to-real experiments on a real robotic platform. The results demonstrate that explicit language memory improves the success rate and robustness of VLA models on complex long-horizon tasks while providing an interpretable semantic account of the decision process.
- Abstract(参考訳): 視覚言語アクション(VLA)モデルは、視覚知覚、言語理解、ロボット制御を接続するための統一的なパラダイムを提供する。
スパース・エキスパート・デモ クロスタスク構成の一般化を制約する 長距離タスクのマルコフ的でない性質は、現在の観測でのみ条件づけられたポリシーが時間的一貫性を維持するのを難しくする クローズドループエラー補正は実行エラーの蓄積を可能にする エンド・ツー・エンド・アクションの微調整は、視覚言語モデル(VLM)のバックボーンの高レベルな意味表現を弱める可能性がある。
これらの問題に対処するために,明示的な言語メモリモジュールを備えた階層型長水平VLAアーキテクチャを提案する。
中心となる考え方は、離散時間観測を時間論理による一貫性のあるテキストメモリシーケンスに変換することである。
システムは高レベルなVLMと低レベルなVLAに分離され、高レベルなVLMは視覚的質問応答訓練パラダイムを通じて意味論的推論を行い、低レベルなVLAはサブタスク命令と視覚的観察に基づいて正確な連続制御を実行する。
高レベルのVLMは、言語メモリとサブタスクの命令の両方をコンテキストアンカーとして再帰的に更新し、長期実行中の時間的追跡と動的修正を可能にする。
提案手法を複数のシミュレーション環境で評価し,実際のロボットプラットフォーム上でシミュレート・トゥ・リアルな実験を行う。
その結果、明示的な言語記憶は、複雑な長期タスクにおけるVLAモデルの成功率と堅牢性を向上し、決定過程の解釈可能なセマンティックな説明を提供することを示した。
関連論文リスト
- QuoVLA: Quotient Space for Vision-Language-Action Models [51.02329790939691]
VLA(Vision-Language-Action)モデルは、視覚的な観察と言語指示を連続的な行動にマッピングすることで、トレーニング済みのVLM潜伏者をロボット制御に適応させることが一般的である。
VLA の textitQuotient Theory は、事前訓練された VLM 潜伏剤は、アクションに十分ではないがアクションに十分であることを示している。
提案するQuoVLAは,事前学習されたVLMラテントを動作十分表現に圧縮する,VLAの商空間フレームワークである。
論文 参考訳(メタデータ) (2026-05-24T06:28:53Z) - Long-Horizon Manipulation via Trace-Conditioned VLA Planning [55.80061850746898]
LoHo-Manipは、短い水平VLA実行を専用のタスク管理VLMを介して長い水平命令にスケールするフレームワークである。
LoHo-Manipは、サブタスクシーケンスと明示的な完了+残り分割を軽量言語メモリとして組み合わせた、進捗対応の残計画を予測する。
実行器VLAは、レンダリングされたトレースの条件に適合し、長い水平決定を繰り返しローカル制御に変換する。
論文 参考訳(メタデータ) (2026-04-23T17:59:04Z) - Recurrent Reasoning with Vision-Language Models for Estimating Long-Horizon Embodied Task Progress [32.47071055191472]
Recurrent Reasoning Vision-Language Model(textR2$VLM)を提案する。
本モデルでは,局所的なビデオスニペットを反復的に処理し,グローバルなコンテキストを維持するリカレント推論フレームワークを特徴とする。
ALFREDとEgo4Dから生成された大規模で自動生成されたデータセットに対して、textR2$VLMをトレーニングします。
論文 参考訳(メタデータ) (2026-03-18T03:13:29Z) - Beyond Short-Horizon: VQ-Memory for Robust Long-Horizon Manipulation in Non-Markovian Simulation Benchmarks [96.60530830276281]
RuleSafeは、スケーラブルなLLM支援シミュレーションフレームワーク上に構築された、新しいオペレーティングベンチマークである。
VQ-Memoryはベクトル量子化変分オートエンコーダを用いたコンパクトで構造化された時間表現である。
論文 参考訳(メタデータ) (2026-03-10T11:13:54Z) - Critic in the Loop: A Tri-System VLA Framework for Robust Long-Horizon Manipulation [5.339854280045898]
Critic in the Loopは動的VLM-Expertスケジューリングによって駆動される適応的階層型フレームワークである。
中心となるのは、グローバル推論のためのVLM脳、リアクティブ実行のためのVLA小脳、軽量な視覚的批判を含む、バイオニックなTri-Systemアーキテクチャである。
我々のアーキテクチャは、人間にインスパイアされたルールをシームレスに統合し、無限の再試行ループを直感的に破る。
論文 参考訳(メタデータ) (2026-03-05T13:55:33Z) - V-CAGE: Context-Aware Generation and Verification for Scalable Long-Horizon Embodied Tasks [6.820118518027692]
V-CAGEは、大規模なセマンティックアライメントデータセットを生成するクローズドループフレームワークである。
本研究では,シーン合成における幾何学的整合性を実現する文脈認識型インスタンス化機構を提案する。
また、階層的な命令分解モジュールを用いて、抽象意図と低レベル制御のギャップを埋める。
論文 参考訳(メタデータ) (2026-01-21T16:41:51Z) - Learning Affordances at Inference-Time for Vision-Language-Action Models [50.93181349331096]
ロボット工学において、VLA(Vision-Language-Action Model)は複雑な制御タスクを解くための有望な道を提供する。
本稿では,VLAの低レベルポリシーを過去の経験を条件とした高レベルVLMに接続するLITEN(Learning from Inference-Time Execution)を紹介する。
提案手法は,低レベルVLAの計画の生成と実行を行う推論フェーズと,その結果を反映した評価フェーズとを反復する。
論文 参考訳(メタデータ) (2025-10-22T16:43:29Z) - Continual Learning for VLMs: A Survey and Taxonomy Beyond Forgetting [70.83781268763215]
視覚言語モデル(VLM)は、大規模事前学習を活用することで、多様なマルチモーダルタスクにおいて優れたパフォーマンスを実現している。
VLMは、クロスモーダル機能ドリフト、共有アーキテクチャによるパラメータ干渉、ゼロショット機能侵食など、ユニークな課題に直面している。
本調査は、生涯の視覚言語システムを開発する研究者にとって、包括的かつ診断的な基準となることを目的としている。
論文 参考訳(メタデータ) (2025-08-06T09:03:10Z) - From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models [5.660635614478238]
VLA(Vision-Language-Action)モデルは、汎用的で汎用的なロボットポリシーを作成することを約束する。
従来の模倣学習ベンチマークは言語命令の欠如のため不適当である。
言語命令,視覚,オブジェクトにまたがる10のサブカテゴリにまたがる50のシミュレーションベースのタスクの統合スイートを導入する。
論文 参考訳(メタデータ) (2025-06-11T16:52:18Z) - Losing Visual Needles in Image Haystacks: Vision Language Models are Easily Distracted in Short and Long Contexts [65.04791072532106]
視覚言語モデル(VLM)における長文抽出推論評価のためのベンチマークジェネレータであるLoCoVQAを提案する。
LoCoVQAは、数学的推論、VQA、そしてより長い視覚的コンテキストを持つ文字認識タスクのテスト例を拡張している。
このテストは、VLMがクエリに応答する際の無関係な情報をどの程度無視できるかを評価する。
論文 参考訳(メタデータ) (2024-06-24T17:58:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。