論文の概要: LEEVLA: Seeing What Matters in Latent Environment Evolution for Vision-Language-Action
- arxiv url: http://arxiv.org/abs/2607.08182v1
- Date: Thu, 09 Jul 2026 07:28:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.440679
- Title: LEEVLA: Seeing What Matters in Latent Environment Evolution for Vision-Language-Action
- Title(参考訳): LEEVLA:ビジョン・ランゲージ・アクションにおける潜在環境の進化に何が必要か
- Authors: Qi Lyu, Baicheng Liu, Xudong Wang, Jiahua Dong, Lianqing Liu, Zhi Han,
- Abstract要約: 視覚言語アクション(VLA)モデルは、マルチモーダル入力をロボットアクションにマッピングすることを目的としている。
本稿では、潜在環境進化において重要なことを確認するためのVLAアーキテクチャであるLEEVLAを提案する。
DGDPとSFFGはタスク対応の"ハウツー"トレーニングフレームワークを形成している。
- 参考スコア(独自算出の注目度): 21.946917665482545
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-language-action (VLA) models aim to map multimodal inputs to robot actions. However, most existing approaches struggle to cover complex dynamic scenarios due to treating all visual tokens uniformly and reasoning with human-selected factors, which lack mechanisms to emphasize task-critical evidence and ignore underlying factors. To address this issue, we propose LEEVLA, a VLA architecture for seeing what matters in Latent Environment Evolution that explicitly guides the model toward informative regions while preserving the structured evolution of latent world representations. To identify salient and instruction-relevant regions, we introduce drift-guided dynamic prioritization (DGDP), which combines dynamic position prioritization (DPP) with semantic drift guidance (SDG) to guide the VLA agent where to attend during training. On top of this, we introduce structured feature flow generation (SFFG), which models how these prioritized features should evolve in latent space via prototype-to-periphery (P2P) prediction, and a mutual-neighborhood contrastive (MC) loss to maintain topological consistency among neighborhoods. Together, DGDP and SFFG form a task-aware "where-how" training framework. Extensive experiments on VLA benchmarks show that LEEVLA consistently outperforms prior methods, confirming that explicit task-evidence guidance and structured latent reasoning are both crucial for scalable VLA. Our code is available at https://github.com/LyuQi127/LEEVLA.
- Abstract(参考訳): 視覚言語アクション(VLA)モデルは、マルチモーダル入力をロボットアクションにマッピングすることを目的としている。
しかしながら、既存のほとんどのアプローチは、全ての視覚的トークンを均一に扱うことと、タスククリティカルなエビデンスを強調し、基礎となる要因を無視するメカニズムが欠如している人間の選択された要因による推論によって、複雑な動的シナリオをカバーするのに苦労している。
この問題に対処するため、我々は、潜在世界表現の構造的進化を保ちながら、そのモデルを情報的領域に向けて明示的にガイドする、潜在環境進化の何が重要かを確認するためのVLAアーキテクチャであるLEEVLAを提案する。
そこで我々は,DPP(Dynamic Position Prioritization)とSDG(セマンティックドリフトガイダンス)を組み合わせたドリフト誘導動的優先順位付け(DGDP)を導入する。
これに加えて、これらの優先度付けされた特徴が、プロトタイプ・ツー・ペリファリー(P2P)予測によって潜在空間内でどのように進化するかをモデル化する構造的特徴フロー生成(SFFG)と、近隣地域のトポロジ的一貫性を維持するための相互隣り合うコントラッシブ・コントラスト(MC)損失を導入する。
DGDPとSFFGは共に、タスク対応の"ハウツー"トレーニングフレームワークを形成している。
VLAベンチマークの大規模な実験により、LEEVLAは従来手法よりも一貫して優れており、明示的なタスクエビデンスガイダンスと構造化された潜在推論がスケーラブルなVLAにとって極めて重要であることが確認された。
私たちのコードはhttps://github.com/LyuQi127/LEEVLAで公開されています。
関連論文リスト
- QuoVLA: Quotient Space for Vision-Language-Action Models [51.02329790939691]
VLA(Vision-Language-Action)モデルは、視覚的な観察と言語指示を連続的な行動にマッピングすることで、トレーニング済みのVLM潜伏者をロボット制御に適応させることが一般的である。
VLA の textitQuotient Theory は、事前訓練された VLM 潜伏剤は、アクションに十分ではないがアクションに十分であることを示している。
提案するQuoVLAは,事前学習されたVLMラテントを動作十分表現に圧縮する,VLAの商空間フレームワークである。
論文 参考訳(メタデータ) (2026-05-24T06:28:53Z) - Afford-VLA: Action-Aligned Visual Planning via Internalized Affordance [108.46436073194546]
効果的なプランニングは、ローカルで、視覚的に基礎があり、内部で生成され、アクションと直接整合するべきである、と私たちは主張する。
本稿では,タスク条件付きアベイランスをVLAモデル内で明示的な視覚的計画インターフェースとして内包する統合フレームワークであるAfford-VLAを提案する。
論文 参考訳(メタデータ) (2026-05-22T20:43:47Z) - Self-Evolving Spatial Reasoning in Vision Language Models via Geometric Logic Consistency [53.28076739140119]
本稿では,視覚・言語モデル(VLM)における論理的一貫性を幾何学的・言語的双対性演算によって実現する枠組みを提案する。
SAGEは、従来のGRPO法に比べてモデルに依存しず、データ効率が良く、既存のVLMに軽量な後学習段階として適用することができる。
ビデオおよび空間推論ベンチマークの実験では、強いベースラインよりも一貫した改善が示されている。
論文 参考訳(メタデータ) (2026-05-18T10:05:21Z) - DIAL: Decoupling Intent and Action via Latent World Modeling for End-to-End VLA [72.9197085473598]
DIALはハイレベルな意思決定と低レベルなモーター実行を、差別化可能な潜在意図ボトルネックを通じてブリッジするフレームワークである。
VLMベースのSystem-2は、VLMのネイティブな特徴空間内で、潜伏した視覚的フォレストによって潜伏世界モデリングを行う。
軽量のSystem-1ポリシーでは、この予測された意図と現在の観測結果を正確にロボットの動作にデコードする。
論文 参考訳(メタデータ) (2026-03-31T15:02:27Z) - SAMoE-VLA: A Scene Adaptive Mixture-of-Experts Vision-Language-Action Model for Autonomous Driving [10.980525810871827]
本稿では,シーン適応型視覚ランゲージ・アクション・フレームワークであるSAMoE-VLAを提案する。
私たちのキーとなるアイデアは、交通シーンのコンテキストをカプセル化した鳥眼視(BEV)機能からMoEルーティング信号を導き出すことです。
本研究では,世界認知,知覚,言語,行動の時間的一貫した推論を支援するために,条件付きクロスモーダル因果注意機構を導入する。
論文 参考訳(メタデータ) (2026-03-09T08:54:03Z) - TagaVLM: Topology-Aware Global Action Reasoning for Vision-Language Navigation [70.23578202012048]
Vision-Language Navigation (VLN) は、アーキテクチャ上のミスマッチのため、大きなビジョン-Language Models (VLM) に固有の課題を提示している。
我々は,VLMのバックボーンにトポロジ構造を明示的に注入するエンドツーエンドフレームワークであるTagaVLM(トポロジ・アウェア・グローバルアクション推論)を提案する。
トポロジ的ノード情報を強化するため、Interleaved Navigation Promptはノードレベルのビジュアルテキストアライメントを強化する。
埋め込みトポロジグラフでは、このモデルはグローバルな行動推論が可能であり、堅牢な経路補正を可能にする。
論文 参考訳(メタデータ) (2026-03-03T13:28:07Z) - Vision-Language-Action Models for Autonomous Driving: Past, Present, and Future [125.92052530850425]
VLA(Vision-Language-Action)フレームワークは、認識と言語に基づく意思決定を統合する。
VLAフレームワークは、より解釈可能で、一般化可能で、人間に準拠した運転ポリシーへの道筋を提供する。
この研究は、人間と互換性のある自動運転システムを構築するための一貫性のある基盤を確立することを目的としている。
論文 参考訳(メタデータ) (2025-12-18T16:57:44Z) - Seeing Space and Motion: Enhancing Latent Actions with Spatial and Dynamic Awareness for VLA [21.362682837521632]
Latent Action Models (LAMs) は、視覚言語制御システムにおいて、大規模な無注釈データからセマンティック・アクション・リセプションを学習することを可能にする。
Farsighted-LAMを提案する。これは幾何学的空間符号化とマルチスケール時間的モデリングを備えた潜在アクションフレームワークである。
さらに,Farsighted-LAM上に構築されたエンドツーエンドVLAフレームワークであるSSM-VLAを提案する。
論文 参考訳(メタデータ) (2025-09-30T13:41:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。