論文の概要: Is Success All You Need? Investigating the Impact of Input Perturbations on VLA Behaviour in Tabletop Manipulation Tasks
- arxiv url: http://arxiv.org/abs/2610.01351v1
- Date: Thu, 01 Oct 2026 09:20:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:24.02728
- Title: Is Success All You Need? Investigating the Impact of Input Perturbations on VLA Behaviour in Tabletop Manipulation Tasks
- Title(参考訳): 成功は必要か? : テーブルトップ操作作業における入力摂動がVLA行動に及ぼす影響の検討
- Abstract要約: VLA(Vision-Language-Action)モデルは、ロボット操作タスクベンチマークにおいて高いタスク成功率を達成した。
モデルの振る舞いのロバスト性を評価するためのベンチマーク非依存評価フレームワークを提案する。
動作のスムーズさ,効率,グリップ動作の指標を含む,典型的な成功行動とその変動性の変化を評価した。
- 参考スコア(独自算出の注目度): 49.09021048464337
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-Language-Action (VLA) models have achieved high task success rates on robot manipulation task benchmarks. More recently, there has been an emphasis on evaluating the robustness of VLA models to perturbations. However, this robustness is still predominantly measured through Task Success Rate (TSR). In this work, we propose a benchmark-agnostic evaluation framework to measure the behavioural robustness of models by characterising how successful trajectories are executed under perturbation. We implement this methodology by extending the widely-used LIBERO and LIBERO-Plus benchmarks. Across three state-of-the-art VLA models, four LIBERO task suites and seven perturbation conditions, we evaluate changes in both typical successful behaviour and its variability, including metrics of motion smoothness, efficiency and gripper behaviour. We find that perturbations can alter the behaviour of successful trajectories, a phenomenon which cannot necessarily be inferred from TSR alone. Across LIBERO suites, we identify cases where state-of-the-art VLA models achieve comparable TSR under the same perturbation condition, yet behaviour on successful trajectories diverges substantially. Therefore, to have a more robust assessment of task performance, we argue that suitable measures of robustness should capture not only whether a task is completed, but also how the robot behaves while completing it. When evaluating the robustness of VLA models, TSR may be complemented by behavioural evaluation metrics that characterise the nature and variability of successful task execution by robots.
- Abstract(参考訳): VLA(Vision-Language-Action)モデルは、ロボット操作タスクベンチマークにおいて高いタスク成功率を達成した。
最近では、摂動に対するVLAモデルの堅牢性を評価することに重点が置かれている。
しかし、このロバスト性は依然としてタスク成功率(TSR)によって測定されている。
本研究では,摂動下で軌道がいかにうまく実行されるかを特徴付けることで,モデルの挙動ロバスト性を評価するためのベンチマーク非依存評価フレームワークを提案する。
広範に使われている LIBERO と LIBERO-Plus ベンチマークを拡張して実装する。
3つの最先端VLAモデル,4つのLIBEROタスクスイート,7つの摂動条件に対して,動作のスムーズさ,効率,グリップパ動作の指標を含む,典型的な動作と変動性の変化を評価した。
摂動は、TSR単独では必ずしも推測できない現象である軌道軌道の挙動を変えることができる。
LIBERO スイート全体では、最先端の VLA モデルが同じ摂動条件下で同等の TSR を達成する場合を同定するが、成功した軌道上での挙動は実質的に分岐する。
そこで,タスク性能をより堅牢に評価するためには,タスクが完了しただけでなく,その完了中にロボットがどのように振る舞うかを適切に把握する必要があると論じる。
VLAモデルの堅牢性を評価する場合、TSRはロボットによるタスク実行の成功の性質と可変性を特徴付ける行動評価指標によって補完される。
関連論文リスト
- Beyond Appearance Shifts: Task-Semantic Action Calibration for VLA Models [5.6961461689283235]
凍結ベースVLA上に構築されたタスクセマンティックアクションキャリブレーションフレームワークであるBAS-VLAを提案する。
BAS-VLAは、OpenPI-pi0.5 / LIBERO-Object Milk-Swapベンチマークにおいて、クリーン(98.0%)とセマンティクス保存条件(97.5%)で高い成功を維持していることを示す。
これらの結果は、信頼性の高いVLA動作は、外見を超えて明示的なタスク・セマンティック・アクション・キャリブレーションに移行する必要があることを強調している。
論文 参考訳(メタデータ) (2026-09-20T13:54:45Z) - TrapVLA: Trapping Vision-Language-Action Models in Configured Failure Modes [65.10128145059127]
この研究は、Vision-Language-Action(VLA)モデルに対する新しいバックドア攻撃タスクであるConfigured Failure Trappingを導入している。
本稿では,高品質な目標軌道を合成するための効率的なデータエンジンと,構成欠陥の忠実度を測定するための自動スイートを提案する。
実験によると、TrapVLAは構成された障害モードをVLAモデルに効果的に注入し、クリーンなデータのパフォーマンスを保っている。
論文 参考訳(メタデータ) (2026-08-27T03:44:49Z) - Measuring Cross-Task Behavioral Consistency in Language Model Agents [0.0]
タスク間の振舞いの一貫性は、独立して測定可能な特性である、と我々は主張する。
本稿では,BCM(Behavioral Consistency Metric)を導入して定量化する。
一貫性に匹敵するシステムでは、一貫性が著しく異なる可能性があるため、一貫性は成功率に還元できないことが分かっています。
論文 参考訳(メタデータ) (2026-07-31T18:37:11Z) - See, Plan, Rewind: Progress-Aware Vision-Language-Action Models for Robust Robotic Manipulation [59.07792608884117]
本稿では,See, Plan, Rewind (SPR)について紹介する。
SPRは、現在の状態と今後のマイルストーンを見て、次の2Dウェイポイントに向けて軌道を計画し、障害時に回復可能な状態に戻すという、継続的なコアサイクルを通じて運用される。
SPRは、OpenVLA-OFTとUniVLAを上回る最小のパフォーマンス低下で最先端のロバスト性を達成する。
論文 参考訳(メタデータ) (2026-03-10T07:22:51Z) - Reshaping Action Error Distributions for Reliable Vision-Language-Action Models [69.38615670891038]
ロボット操作において、視覚言語アクション(VLA)モデルは、一般化可能でスケーラブルなロボットポリシーを学ぶための有望なパラダイムとして登場した。
連続動作型VLAモデルに焦点をあて、トレーニング中の動作誤差分布を再構成することにより、従来のMSEベースの回帰を超越する。
複数の代表的VLAアーキテクチャ上で、標準、少数ショット、ノイズの多い設定にまたがるアプローチを評価します。
論文 参考訳(メタデータ) (2026-02-04T05:37:09Z) - CycleVLA: Proactive Self-Correcting Vision-Language-Action Models via Subtask Backtracking and Minimum Bayes Risk Decoding [60.06899554269808]
サイクロンVLA(CycleVLA)は、VLA(Vision-Language-Action Model)を積極的に自己補正するシステムである。
CycleVLAは、重要なサブタスク遷移ポイントにフラグを付けるプログレス対応のVLAを統合することで、これを実現する。
大規模な実験により、CycleVLAは、よく訓練されたVLAと訓練されていないVLAの両方のパフォーマンスを改善することが示された。
論文 参考訳(メタデータ) (2026-01-05T17:31:01Z) - Steering Vision-Language-Action Models as Anti-Exploration: A Test-Time Scaling Approach [78.4812458793128]
動作チャンクの高忠実度検証に軽量な擬数推定器を適用したテスト時間スケーリングフレームワークである textbfTACO を提案する。
我々の手法は、オフライン強化学習(RL)における古典的な反探索原理に似ており、勾配のないため、計算上の大きな恩恵をもたらす。
論文 参考訳(メタデータ) (2025-12-02T14:42:54Z) - Evaluating Uncertainty and Quality of Visual Language Action-enabled Robots [13.26825865228582]
ロボット操作タスクのためのVLAモデルに特化して設計された8つの不確実性指標と5つの品質指標を提案する。
我々は,3つの最先端VLAモデルから908のタスク実行を成功させる大規模実証実験により,その有効性を評価する。
論文 参考訳(メタデータ) (2025-07-22T22:15:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。