論文の概要: CheckVLA: Execution-Time Verification with Action-Conditioned World Model for Long-Horizon Mobile Manipulation
- arxiv url: http://arxiv.org/abs/2607.26789v1
- Date: Wed, 29 Jul 2026 11:31:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.653188
- Title: CheckVLA: Execution-Time Verification with Action-Conditioned World Model for Long-Horizon Mobile Manipulation
- Title(参考訳): CheckVLA: 長距離移動マニピュレーションのための行動記述世界モデルによる実行時間検証
- Authors: Yushan Liu, Peibo Sun, Xintao Chao, Zhenyang Yang, Yifan Xie, Lingfeng Zhang, Shoujie Li, Chenyu Tang, Fang Chen, Xiao-Ping Zhang, Wenbo Ding,
- Abstract要約: 視覚言語アクション(VLA)ポリシーは、オープンループアクションチャンクを通じて長距離移動操作を実行する。
本稿では、個別に訓練されたフリーズされた行動条件付き世界モデルを用いて実行を検証するCheckVLAを提案する。
RoboCasa365では、一般的なトレーニングレシピと一致した呼び出し予算の下で、CheckVLAの平均成功率は36.1%であり、定期的なリプランでは27.6%である。
- 参考スコア(独自算出の注目度): 15.532709298240215
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-language-action (VLA) policies commonly execute long-horizon mobile manipulation through open-loop action chunks, issuing multiple actions without receiving new high-level visual input. A committed chunk therefore implies how observations should evolve, but accidental deviations can violate this expectation while the remaining actions continue to propagate the error: commit-time policy confidence cannot react to a deviation that occurs after dispatch, and observation-only anomaly scores lack an action-conditioned reference for separating expected effects from unexplained changes. We propose CheckVLA, which verifies execution with a separately trained, frozen action-conditioned world model. A conformally calibrated risk threshold bounds the episode-level probability of an unnecessary first intervention and determines when to intervene, its exceedance controls how strongly the rewritten suffix retains the superseded chunk, latency-aware hard prefixing restricts replacement to actions that remain deployable, and an event-driven keyframe bank preserves evidence of prior progress across repairs. On RoboCasa365, under a common training recipe and a matched invocation budget, CheckVLA attains a 36.1% average success rate against 27.6% for periodic replanning (+8.5 points). At a matched 5% episode-level false-alarm target, action conditioning raises timely recall to 77.9%, against 48.6% for an observation-only control and 37.9% for an action-shuffled control. These simulation results support action-conditioned verification as a way to restore feedback during chunked execution while keeping the repair consistent with inference latency.
- Abstract(参考訳): VLA(Vision- Language-action)ポリシーは、オープンループアクションチャンクを通じて長い水平移動操作を実行し、新しいハイレベルな視覚入力を受けずに複数のアクションを発行する。
コミット時ポリシーの信頼性は、ディスパッチ後に発生する偏差に反応できず、観察のみの異常スコアは、予期しない変化から予測される影響を分離するためのアクション条件付き参照を欠いている。
本稿では、個別に訓練されたフリーズされた行動条件付き世界モデルを用いて実行を検証するCheckVLAを提案する。
順に校正されたリスク閾値は、不要な最初の介入のエピソードレベル確率を制限し、いつ介入するかを判定し、リライトされた接尾辞が過小評価チャンクをどれだけ強く保持するかを制御し、遅延対応ハードプレフィックスは、デプロイ可能なアクションへの置換を制限し、イベント駆動のキーフレームバンクは、修復の先延ばしの証拠を保存する。
RoboCasa365では、共通トレーニングレシピと一致した呼び出し予算の下で、CheckVLAの平均成功率は36.1%であり、定期的なリプラン(+8.5ポイント)では27.6%である。
一致した5%のエピソードレベルの偽アラームターゲットでは、アクションコンディショニングが77.9%、観察のみのコントロールが48.6%、アクションシャッフルコントロールが37.9%にタイムリーリコールされる。
これらのシミュレーションの結果は、チャンク実行中のフィードバックを復元する手段として、動作条件検証をサポートし、修正は推論レイテンシと整合性を維持している。
関連論文リスト
- FutureRTC: Real-Time Robot Execution with Anticipatory-Conditioned Action Chunking [51.97839311685636]
FutureRTCは、実行時の観察と非同期VLA制御の状態を予測するためのプラグイン・アンド・プレイ適応フレームワークである。
FutureRTCは推論遅延に対する堅牢性を実現し,よりスムーズな軌道,高速な実行,一貫したタスク成功率を実現している。
論文 参考訳(メタデータ) (2026-07-27T05:10:16Z) - TrustVLA: Mechanism-Guided Inference-Time Defense Against Vision-Language-Action Backdoors [54.12833308568015]
VLA(Vision-Language-Action)モデルは、エンドユーザが監査できないパイプラインを通じてデプロイされる。
小さな視覚トリガーは、障害が観測可能である前に、長い水平ロボットポリシーをリダイレクトする。
個別に提案した2つのVLA攻撃を通してこのギャップについて検討した。
論文 参考訳(メタデータ) (2026-07-14T09:43:52Z) - Calibration Is Not Control: Why LLM-Agent Oversight Needs Intervention [14.376426170653707]
2つのトラジェクトリプレフィックスは、異なるアクションを必要とする間、同じリスク見積を持つことができる。
我々は、このミスマッチをターゲットエラーとして形式化し、介入の利点を特定する。
論文 参考訳(メタデータ) (2026-06-19T13:08:17Z) - Pre-VLA: Preemptive Runtime Verification for Reliable Vision-Language-Action and World-Model Rollouts [18.44683570310399]
低品質なアクションは、実行中に物理的な障害を引き起こしたり、冗長なレンダリングコストで世界モデルのロールアウトを誤解させるおそれがある。
実演や世界モデルの想像力の前にプリエンプティブ・アクションアセスメントの妥当性を示す統一型ランタイム検証アーキテクチャであるPre-VLAを提案する。
論文 参考訳(メタデータ) (2026-05-21T13:13:31Z) - DEFLECT: Delay-Robust Execution via Flow-matching Likelihood-Estimated Counterfactual Tuning for VLA Policies [12.248643831532663]
DEFLECTは、非同期VLA制御の使用可能な遅延エンベロープを大幅に拡張し、高遅延状態(5-7制御ステップ)で+6.4の成功率を、最も長い遅延時間で実スケールVLAに移行すると+4.6とした。
論文 参考訳(メタデータ) (2026-05-19T03:14:11Z) - ClawForge: Generating Executable Interactive Benchmarks for Command-Line Agents [59.626170560327274]
textbfClawForgeは、ステートコンフリクト下で実行可能なコマンドラインカテゴリのためのジェネレータベースのベンチマークフレームワークである。
私たちはこのフレームワークをClawForge-Bench(17のシナリオ、6の能力カテゴリ)としてインスタンス化します。
論文 参考訳(メタデータ) (2026-05-13T21:34:08Z) - Dynamic Execution Commitment of Vision-Language-Action Models [21.647844049489535]
本稿では,動的実行コミットメントを自己特定的プレフィックス検証問題として再編成する適応アクションアクセプタンス機構であるA3を紹介する。
A3はまず、グループサンプリングを介して行動の軌跡的なコンセンサススコアを計算し、次に代表ドラフトを選択し、下流検証を優先する。
さまざまなVLAモデルとベンチマークの実験では、A3は手動の水平調整の必要性を排除し、実行と推論のスループットのトレードオフを優れたものにしている。
論文 参考訳(メタデータ) (2026-05-12T05:52:58Z) - Code-as-Monitor: Constraint-aware Visual Programming for Reactive and Proactive Robotic Failure Detection [56.66677293607114]
オープンセットのリアクティブかつアクティブな障害検出のためのCode-as-Monitor(CaM)を提案する。
モニタリングの精度と効率を高めるために,制約関連エンティティを抽象化する制約要素を導入する。
実験により、CaMは28.7%高い成功率を達成し、厳しい乱れの下で実行時間を31.8%短縮することが示された。
論文 参考訳(メタデータ) (2024-12-05T18:58:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。