論文の概要: RT-VLA: Real-Time Vision-Language-Action Models via Knowledge Distillation
- arxiv url: http://arxiv.org/abs/2606.14010v1
- Date: Fri, 12 Jun 2026 01:06:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-15 16:00:42.702362
- Title: RT-VLA: Real-Time Vision-Language-Action Models via Knowledge Distillation
- Title(参考訳): RT-VLA:知識蒸留によるリアルタイムビジョン・ランゲージ・アクションモデル
- Abstract要約: RT-VLAは, 最先端のSimLingoモデルの駆動と推論能力を, コンパクトな学生に伝達する軽量蒸留VLAモデルである。
RT-VLAは、言語ベースの推論を保持し、リアルタイム制御に遅延を加えることなく、安全クリティカルな運転モーメントのオフライン言語分析を通じて、ポストホックな説明をサポートする。
SimLingoの教師と比較すると、RT-VLAは競合するクローズループ駆動と言語推論性能を維持しつつ、視覚のみのモードでは44.8倍、視覚+言語モードでは7.9倍の推論時間を短縮している。
- 参考スコア(独自算出の注目度): 11.501308555096605
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-Language-Action (VLA) models have shown strong potential for end-to-end autonomous driving by jointly modeling visual perception, language reasoning, explainability and action prediction. However, their large vision-language backbones and reasoning modules introduce substantial inference latency and thereby prevent their deployment in the unforgiving reality of the road networks. We propose RT-VLA, a lightweight, distilled VLA model that transfers the driving and reasoning capabilities of the state-of-the-art SimLingo model into a compact student through multi-level supervised distillation. RT-VLA preserves language-based reasoning and supports post-hoc explanation through offline language analysis of safety-critical driving moments without adding latency to real-time control. Compared to the SimLingo teacher, RT-VLA maintains competitive closed-loop driving and language reasoning performance while reducing inference time by 44.8X in vision-only mode and 7.9X in vision+language mode. These results suggest that supervised distillation is a practical approach for building real-time, explainable VLA-style autonomous driving models.
- Abstract(参考訳): VLA(Vision-Language-Action)モデルは、視覚知覚、言語推論、説明可能性、行動予測を共同でモデル化することで、エンドツーエンドの自動運転に強い可能性を示している。
しかし、彼らの大きなビジョン言語バックボーンと推論モジュールは、かなりの推論遅延をもたらし、それによって、道路ネットワークの不快な現実への展開を妨げている。
RT-VLAは, 最先端のSimLingoモデルの駆動と推論能力を, 多層蒸留によりコンパクトな学生に伝達する, 軽量蒸留VLAモデルである。
RT-VLAは、言語ベースの推論を保持し、リアルタイム制御に遅延を加えることなく、安全クリティカルな運転モーメントのオフライン言語分析を通じて、ポストホックな説明をサポートする。
SimLingoの教師と比較すると、RT-VLAは競合するクローズループ駆動と言語推論性能を維持しつつ、視覚のみのモードでは44.8倍、視覚+言語モードでは7.9倍の推論時間を短縮している。
これらの結果から, 教師付き蒸留は実時間で説明可能なVLA方式の自律運転モデルを構築するための実践的アプローチであることが示唆された。
関連論文リスト
- QuoVLA: Quotient Space for Vision-Language-Action Models [51.02329790939691]
VLA(Vision-Language-Action)モデルは、視覚的な観察と言語指示を連続的な行動にマッピングすることで、トレーニング済みのVLM潜伏者をロボット制御に適応させることが一般的である。
VLA の textitQuotient Theory は、事前訓練された VLM 潜伏剤は、アクションに十分ではないがアクションに十分であることを示している。
提案するQuoVLAは,事前学習されたVLMラテントを動作十分表現に圧縮する,VLAの商空間フレームワークである。
論文 参考訳(メタデータ) (2026-05-24T06:28:53Z) - MindVLA-U1: VLA Beats VA with Unified Streaming Architecture for Autonomous Driving [54.57163800903507]
我々は、自動運転のための最初の統合ストリーミングVLAアーキテクチャであるMindVLA-U1を紹介する。
統一されたVLMバックボーンは、1つの共有表現に1つのフォワードパスでAR言語トークンとフローマッチングされた連続的なアクショントラジェクトリを生成する。
ロングテールのWOD-E2Eベンチマークでは、MindVLA-U1が経験豊富な人間のドライバーを初めて上回った。
論文 参考訳(メタデータ) (2026-05-12T18:09:42Z) - SAMoE-VLA: A Scene Adaptive Mixture-of-Experts Vision-Language-Action Model for Autonomous Driving [10.980525810871827]
本稿では,シーン適応型視覚ランゲージ・アクション・フレームワークであるSAMoE-VLAを提案する。
私たちのキーとなるアイデアは、交通シーンのコンテキストをカプセル化した鳥眼視(BEV)機能からMoEルーティング信号を導き出すことです。
本研究では,世界認知,知覚,言語,行動の時間的一貫した推論を支援するために,条件付きクロスモーダル因果注意機構を導入する。
論文 参考訳(メタデータ) (2026-03-09T08:54:03Z) - SteerVLA: Steering Vision-Language-Action Models in Long-Tail Driving Scenarios [104.10555123175055]
自律運転における基本的な課題は、ロングテールイベントに対する高レベルなセマンティック推論と、ロバストな運転のための低レベルでリアクティブな制御の統合である。
本稿では,視覚-言語-行動駆動ポリシーを操る細粒度言語命令を生成するSteerVLAを提案する。
我々は、SteerVLAを挑戦的なクローズドループベンチマークで評価し、運転スコア全体の4.77ポイント、ロングテールサブセットの8.04ポイントで最先端の手法より優れています。
論文 参考訳(メタデータ) (2026-02-09T09:54:02Z) - TIC-VLA: A Think-in-Control Vision-Language-Action Model for Robot Navigation in Dynamic Environments [23.799083918923344]
本稿では,動作生成中に遅延セマンティック推論を明示的にモデル化する遅延認識フレームワークであるThink-in-Control (TIC)-VLAを紹介する。
TIC-VLAは、遅延視覚言語セマンティックステートと明示的な遅延メタデータのアクション生成を条件とする遅延セマンティックコントロールインターフェースを定義する。
現実的な評価を支援するために,動的環境における言語誘導ナビゲーションのための物理精度の高いフォトリアリスティック・シミュレーションスイートDynaNavを提案する。
論文 参考訳(メタデータ) (2026-02-02T18:47:49Z) - Vision-Language-Action Models for Autonomous Driving: Past, Present, and Future [125.92052530850425]
VLA(Vision-Language-Action)フレームワークは、認識と言語に基づく意思決定を統合する。
VLAフレームワークは、より解釈可能で、一般化可能で、人間に準拠した運転ポリシーへの道筋を提供する。
この研究は、人間と互換性のある自動運転システムを構築するための一貫性のある基盤を確立することを目的としている。
論文 参考訳(メタデータ) (2025-12-18T16:57:44Z) - Reasoning-VLA: A Fast and General Vision-Language-Action Reasoning Model for Autonomous Driving [46.99350914451702]
Reasoning-VLAは、最先端性能、優れた一般化能力、そしてこれまでに報告された優れた推論速度を実現する。
8つの公開可能な自律運転データセットを、標準化された言語推論ベースの、モデルトレーニングのための使いやすいデータフォーマットに統合します。
論文 参考訳(メタデータ) (2025-11-25T04:40:11Z) - A Survey on Vision-Language-Action Models for Autonomous Driving [26.407082158880204]
VLA(Vision-Language-Action)パラダイムは、視覚知覚、自然言語理解、制御を単一のポリシーに統合する。
自動運転車の研究者たちは、これらの方法を車の領域に積極的に適応させている。
この調査は、VLA for Autonomous Drivingの最初の包括的な概要を提供する。
論文 参考訳(メタデータ) (2025-06-30T16:50:02Z) - AutoVLA: A Vision-Language-Action Model for End-to-End Autonomous Driving with Adaptive Reasoning and Reinforcement Fine-Tuning [37.176428069948535]
Vision-Language-Action(VLA)モデルは、エンドツーエンドの自動運転を約束している。
現在のVLAモデルは、物理的に実現不可能なアクション出力、複雑なモデル構造、あるいは不要に長い推論に苦しむ。
本稿では,単一自己回帰生成モデル内での推論と行動生成を統一する新しいVLAモデルであるAutoVLAを提案する。
論文 参考訳(メタデータ) (2025-06-16T17:58:50Z) - CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models [89.44024245194315]
視覚言語行動モデル(VLA)に明示的な視覚連鎖(CoT)推論を組み込む手法を提案する。
視覚およびアクショントークンの理解と生成が可能な最先端の7B VLAであるCoT-VLAを紹介する。
実験の結果,CoT-VLAは実世界の操作タスクでは17%,シミュレーションベンチマークでは6%,最先端のVLAモデルでは6%,高い性能を示した。
論文 参考訳(メタデータ) (2025-03-27T22:23:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。