論文の概要: How VLAs (Really) Work In Open-World Environments
- arxiv url: http://arxiv.org/abs/2604.21192v1
- Date: Thu, 23 Apr 2026 01:32:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-24 14:40:06.230685
- Title: How VLAs (Really) Work In Open-World Environments
- Title(参考訳): VLAはどのようにして(実際に)オープンワールド環境で機能するか
- Authors: Amir Rasouli, Yangzheng Wu, Zhiyuan Li, Rui Heng Yang, Xuan Zhao, Charles Eret, Sajjad Pakdamansavoji,
- Abstract要約: 視覚言語アクションモデル(VLA)はロボット工学の応用で広く使われており、様々な操作問題において大きな成功を収めている。
本稿では,このような評価プロトコルを用いることで,操作の安全性についてはほとんど言及せず,報告された性能を過大評価する可能性があることを論じる。
次に、より複雑でインタラクティブなシナリオにおいて、安全違反を捕捉し、ポリシーの真のパフォーマンスをよりよく測定する評価プロトコルを提案する。
- 参考スコア(独自算出の注目度): 18.578122377343984
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-language-action models (VLAs) have been extensively used in robotics applications, achieving great success in various manipulation problems. More recently, VLAs have been used in long-horizon tasks and evaluated on benchmarks, such as BEHAVIOR1K (B1K), for solving complex household chores. The common metric for measuring progress in such benchmarks is success rate or partial score based on satisfaction of progress-agnostic criteria, meaning only the final states of the objects are considered, regardless of the events that lead to such states. In this paper, we argue that using such evaluation protocols say little about safety aspects of operation and can potentially exaggerate reported performance, undermining core challenges for future real-world deployment. To this end, we conduct a thorough analysis of state-of-the-art models on the B1K Challenge and evaluate policies in terms of robustness via reproducibility and consistency of performance, safety aspects of policies operations, task awareness, and key elements leading to the incompletion of tasks. We then propose evaluation protocols to capture safety violations to better measure the true performance of the policies in more complex and interactive scenarios. At the end, we discuss the limitations of the existing VLAs and motivate future research.
- Abstract(参考訳): 視覚言語アクションモデル(VLA)はロボット工学の応用で広く使われており、様々な操作問題において大きな成功を収めている。
最近では、VLAは長い水平タスクで使われ、BEHAVIOR1K (B1K) のような複雑な家事の解決のためのベンチマークで評価されている。
このようなベンチマークの進捗を測定するための一般的な指標は、成功率または部分スコアであり、進歩に依存しない基準の満足度に基づいており、そのような状態につながる事象に関係なく、オブジェクトの最終状態のみが考慮されることを意味する。
本稿では、このような評価プロトコルを用いることで、運用の安全性についてはほとんど言及せず、報告された性能を過大評価できる可能性があり、将来の実世界の展開における中核的な課題を損なう可能性があると論じる。
この目的のために、我々はB1Kチャレンジにおける最先端モデルの徹底的な分析を行い、パフォーマンスの再現性と一貫性、ポリシー操作の安全性、タスク認識、タスクの不完成につながる重要な要素といった観点から、ロバスト性の観点からポリシーを評価する。
次に、より複雑でインタラクティブなシナリオにおいて、安全違反を捕捉し、ポリシーの真のパフォーマンスをよりよく測定する評価プロトコルを提案する。
最後に,既存のVLAの限界について論じ,今後の研究を動機づける。
関連論文リスト
- ProgressVLA: Progress-Guided Diffusion Policy for Vision-Language Robotic Manipulation [57.07494675832939]
ロボット操作のための既存の視覚言語アクション(VLA)モデルは、進歩意識を欠いている。
本研究では,textbf vla という新しいモデルを提案し,タスク進捗の推定と統合について検討する。
CALVINとLIBEROベンチマークの実験は、実世界のロボットの展開とともに、成功率の大幅な改善を一貫して示している。
論文 参考訳(メタデータ) (2026-03-29T12:38:11Z) - ALOE: Action-Level Off-Policy Evaluation for Vision-Language-Action Model Post-Training [15.70383059978939]
本研究では,オンライン強化学習(RL)による大規模基盤視覚アクション(VLA)システムの改善方法について検討する。
実際には、値関数は異なるデータソースから収集された軌跡断片から推定される。
VLAポストトレーニングのためのアクションレベルオフポリシー評価フレームワークであるALOEを提案する。
論文 参考訳(メタデータ) (2026-02-13T07:46:37Z) - LIBERO-X: Robustness Litmus for Vision-Language-Action Models [32.29541801424534]
この研究は、評価とデータの観点からVLAベンチマークを体系的に再考する。
LIBERO-Xは階層的評価プロトコルを特徴とするベンチマークで,3つのコア機能を対象とした進行難度レベルを示す。
代表的なVLAモデルを用いた実験では、累積摂動下での大幅な性能低下が示されている。
論文 参考訳(メタデータ) (2026-02-06T09:59:12Z) - Reshaping Action Error Distributions for Reliable Vision-Language-Action Models [69.38615670891038]
ロボット操作において、視覚言語アクション(VLA)モデルは、一般化可能でスケーラブルなロボットポリシーを学ぶための有望なパラダイムとして登場した。
連続動作型VLAモデルに焦点をあて、トレーニング中の動作誤差分布を再構成することにより、従来のMSEベースの回帰を超越する。
複数の代表的VLAアーキテクチャ上で、標準、少数ショット、ノイズの多い設定にまたがるアプローチを評価します。
論文 参考訳(メタデータ) (2026-02-04T05:37:09Z) - AttackVLA: Benchmarking Adversarial and Backdoor Attacks on Vision-Language-Action Models [60.39655329875822]
VLA(Vision-Language-Action)モデルは、ロボットが自然言語の命令を解釈し、多様なタスクを実行することを可能にするモデルである。
このようなモデルを攻撃することへの関心は高まっているが、既存の手法の有効性は依然として不明である。
我々はVLA開発ライフサイクルに合わせて統合されたフレームワークであるAttackVLAを提案する。
論文 参考訳(メタデータ) (2025-11-15T10:30:46Z) - How Good are Foundation Models in Step-by-Step Embodied Reasoning? [79.15268080287505]
身体的エージェントは、安全で空間的に整合性があり、文脈に根ざした決定をしなければならない。
大規模マルチモーダルモデルの最近の進歩は、視覚的理解と言語生成において有望な能力を示している。
私たちのベンチマークには、10のタスクと8のエボディメントにまたがる詳細なステップバイステップ推論を備えた1.1k以上のサンプルが含まれています。
論文 参考訳(メタデータ) (2025-09-18T17:56:30Z) - Benchmarking Vision, Language, & Action Models in Procedurally Generated, Open Ended Action Environments [20.93006455952299]
視覚言語アクション(VLA)モデルは汎用ロボットシステムに向けた重要なステップである。
我々は,最先端VLMとVLAの一般化性能の評価と解析を目的としたベンチマークであるMultiNet v0.2を紹介する。
論文 参考訳(メタデータ) (2025-05-08T16:51:36Z) - LLM-Safety Evaluations Lack Robustness [58.334290876531036]
我々は、大規模言語モデルに対する現在の安全アライメント研究は、多くのノイズ源によって妨げられていると論じる。
本研究では,将来の攻撃・防衛用紙の評価において,ノイズやバイアスを低減させる一連のガイドラインを提案する。
論文 参考訳(メタデータ) (2025-03-04T12:55:07Z) - Seizing Serendipity: Exploiting the Value of Past Success in Off-Policy Actor-Critic [42.57662196581823]
高品質な$Q$値関数の学習は、多くの現代のオフポリシーディープ強化学習(RL)アルゴリズムの成功に重要な役割を果たしている。
一般的な視点から考えると、RLトレーニングプロセスの後半段階では、$Q$-valueが過小評価されることが多い。
本稿では,Blended Exploitation and Exploration (BEE)演算子を提案する。
論文 参考訳(メタデータ) (2023-06-05T13:38:14Z) - Benchmarks for Deep Off-Policy Evaluation [152.28569758144022]
我々は,政策外の評価のベンチマークに使用できるポリシーの集合を提案する。
私たちのベンチマークの目標は、一連の原則から動機付けられた進歩の標準化された尺度を提供することです。
この領域における今後の研究を促進するために、当社のデータとコードに対するオープンソースアクセスを提供しています。
論文 参考訳(メタデータ) (2021-03-30T18:09:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。