論文の概要: VANE: Reliable Test-Time Training for Vision-Language-Action Models via Future Visual Representation Prediction
- arxiv url: http://arxiv.org/abs/2608.09448v2
- Date: Wed, 12 Aug 2026 10:16:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-13 14:28:20.48391
- Title: VANE: Reliable Test-Time Training for Vision-Language-Action Models via Future Visual Representation Prediction
- Title(参考訳): VANE:将来の視覚表現予測による視覚・言語・行動モデルのための信頼性の高いテストタイムトレーニング
- Authors: Hongjin Ji, Guoyang Xia, Luoyang Sun, Fangxiang Feng, Lei Ren,
- Abstract要約: テストタイムトレーニング(TTT)は、ラベルのないデプロイメントストリームから視覚-言語-アクション(VLA)ポリシーを適用するための軽量な方法を提供する。
VLAポリシー(VANE)のための信頼性TTTフレームワークを導入する。
SimplerEnv WidowXでは、VANEは対応するTTベースラインよりも平均的な成功率を32ドルポイント向上させる。
- 参考スコア(独自算出の注目度): 8.801486222527984
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Test-time training (TTT) offers a lightweight way to adapt vision--language--action (VLA) policies from unlabeled deployment streams, but it remains difficult to use reliably in closed-loop manipulation. A shared adaptation space can mix incompatible task corrections, while an online update can alter subsequent actions before its consequences are known. We introduce a reliable TTT framework for VLA policies (VANE). VANE conditions prompt adaptation on the current vision--language context and learns from the future visual consequences of executed actions. Candidate updates are isolated from the live policy, evaluated on subsequent observations, and committed only when supported by future evidence, making adaptation selective and reversible. On SimplerEnv WidowX, VANE improves average success by $3.2$ percentage points over the corresponding TTT baseline. Results on Google Robot further show that deployment-time gains remain task- and embodiment-dependent. Together, these results demonstrate a constrained, evidence-based approach to adapting VLA policies during interaction.
- Abstract(参考訳): テストタイムトレーニング(TTT)は、ラベル付けされていないデプロイメントストリームから視覚-言語-アクション(VLA)ポリシーを適用するための軽量な方法を提供するが、クローズドループ操作で確実に使用するのは難しい。
共有適応空間は非互換なタスク修正を混合することができ、オンライン更新は結果が知られる前にその後のアクションを変更することができる。
VLAポリシー(VANE)のための信頼性のあるTTTフレームワークを導入する。
VANE条件は現在の視覚的文脈に適応し、実行されたアクションの将来の視覚的結果から学習する。
候補更新は、ライブポリシーから分離され、その後の観察に基づいて評価され、将来の証拠によって支持された場合にのみ実行され、適応を選択的かつ可逆的にすることができる。
SimplerEnv WidowXでは、VANEは対応するTTベースラインよりも平均的な成功率を32ドルポイント向上させる。
Google Robotの結果はさらに、デプロイメント時間の増加はタスクに依存し、実施に依存していることを示している。
これらの結果は、相互作用中にVLAポリシーを適用するための制約付きエビデンスベースのアプローチを示す。
関連論文リスト
- Action- and Language-Conditioned Video Assessment for Embodied Control [25.788621525752006]
自然言語命令を実行する視覚ベースの実施エージェントは、完全な軌道上のタスク進捗を評価するフィードバックメカニズムを必要とする。
本稿では、視覚的観察、実行されたアクションシーケンス、および自然言語命令に基づいて評価を行う軌道評価器であるALVA(Action- and Language-Conditioned Video Assessment)を提案する。
シミュレーションされた3D世帯環境において、ALVAは、ほぼゼロの偽陽性率で保守的な評価パターンを示す。
論文 参考訳(メタデータ) (2026-08-08T18:05:21Z) - FutureRTC: Real-Time Robot Execution with Anticipatory-Conditioned Action Chunking [51.97839311685636]
FutureRTCは、実行時の観察と非同期VLA制御の状態を予測するためのプラグイン・アンド・プレイ適応フレームワークである。
FutureRTCは推論遅延に対する堅牢性を実現し,よりスムーズな軌道,高速な実行,一貫したタスク成功率を実現している。
論文 参考訳(メタデータ) (2026-07-27T05:10:16Z) - TTT-VLA: Test-Time Latent Prompt Optimization for Vision-Language-Action Models [49.463896453707065]
VLA(Vision-Language-Action)モデルは目覚ましい進歩を遂げているが、展開時の分散シフトには弱いままである。
近年のVLAモデルは、プロンプトが政策行動の効率的なインターフェースとして機能することを示唆しているが、既存のプロンプトベースのステアリングは通常、外部ガイダンスに依存している。
VLAのテストタイムトレーニング(TTT)は、プロンプトの最適化によって実現可能か?
我々は、遅延プロンプト最適化(LPO)に基づくテスト時間トレーニングフレームワークであるTTT-VLAでこの問題に対処する。
論文 参考訳(メタデータ) (2026-06-02T04:10:39Z) - VisualThink-VLA: Visual Intermediate Reasoning for Effective and Low-Latency Vision-Language-Action Policies [58.65913948991329]
正確な低レイテンシVLAポリシーのためのビジュアル中間推論フレームワークであるVISUALTHINK-VLAを提案する。
私たちのブートストラップ哲学は、効果的な視覚的思考でアクションを導くことです。
これは、デコードオーバーヘッドを回避しながら空間的精度を保った、コンパクトなビジュアル・エビデンスインターフェースを通じてアクション予測をブートストラップする。
論文 参考訳(メタデータ) (2026-05-28T14:36:53Z) - When Vision Overrides Language: Evaluating and Mitigating Counterfactual Failures in VLAs [31.92520697946991]
VLA(Vision-Language-Action Model)は、ロボット制御における言語命令の基盤となることを約束するが、実際には言語に忠実に従わないことが多い。
反ファクトの失敗は、最先端のVLAで発見されていないことが示される。
本稿では,単純な2分岐推論方式であるCAGを提案する。
論文 参考訳(メタデータ) (2026-02-19T18:59:20Z) - ReViP: Reducing False Completion in Vision-Language-Action Models with Vision-Proprioception Rebalance [50.05984919728878]
本稿では、視覚的接地と摂動下での堅牢性を高めるために、視覚-受容器リバランスを備えた新しいVLAフレームワークReViPを提案する。
具体的には、タスクステージオブザーバとして外部VLMを使用して、視覚的な観察からリアルタイムなタスク中心の視覚的手がかりを抽出する。
本稿では,オブジェクトドロップのような制御された設定を持つLIBERO上に構築された最初のFalse-Completion Benchmark Suiteを提案する。
論文 参考訳(メタデータ) (2026-01-23T11:31:07Z) - On-the-Fly VLA Adaptation via Test-Time Reinforcement Learning [61.38273866396522]
ビジョン・ランゲージ・アクションモデルが汎用ロボット学習の強力なパラダイムとして登場した。
現在の手法は、シミュレーションや物理世界の展開に挑戦するには相変わらず適していない。
本稿では,VLA フレームワークのテスト時間強化学習について紹介する。
論文 参考訳(メタデータ) (2026-01-11T01:51:30Z) - Steering Vision-Language-Action Models as Anti-Exploration: A Test-Time Scaling Approach [78.4812458793128]
動作チャンクの高忠実度検証に軽量な擬数推定器を適用したテスト時間スケーリングフレームワークである textbfTACO を提案する。
我々の手法は、オフライン強化学習(RL)における古典的な反探索原理に似ており、勾配のないため、計算上の大きな恩恵をもたらす。
論文 参考訳(メタデータ) (2025-12-02T14:42:54Z) - Do What You Say: Steering Vision-Language-Action Models via Runtime Reasoning-Action Alignment Verification [17.948161564138033]
Reasoning Vision Language Action (VLA)モデルは、低レベルアクションの前にステップバイステップのテキストプランを生成することで、ロボットによる命令追従を改善する。
しかし、正しいテキストプランであっても、生成したアクションは計画の意図した結果、特にアウト・オブ・ディストリビューションのシナリオを見逃す可能性がある。
我々は、この現象をCoT忠実性の欠如として定式化し、推論・アクションアライメントのためのトレーニング不要な実行時ポリシーステアリング手法を導入する。
論文 参考訳(メタデータ) (2025-10-18T00:38:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。