論文の概要: IndustrialVLA-Bench: A Traceable Multi-Axis Evaluation of Open Robot Policy Models
- arxiv url: http://arxiv.org/abs/2609.25562v1
- Date: Tue, 22 Sep 2026 01:51:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-23 18:04:04.172235
- Title: IndustrialVLA-Bench: A Traceable Multi-Axis Evaluation of Open Robot Policy Models
- Title(参考訳): IndustrialVLA-Bench:オープンロボット政策モデルのトレース可能なマルチ軸評価
- Abstract要約: IndustrialVLA-Benchは、6つの視覚言語モデル(VLA)と世界行動モデル(WAM)のエビデンス対応評価である。
LIBEROのクリーンな機能、LIBERO-Plusの非言語的堅牢性、LIBERO-Paraの命令感度、実行コストを別々に評価する。
- 参考スコア(独自算出の注目度): 33.966043117465816
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Open robot policies increasingly follow two paradigms: vision-language-action models (VLAs) directly map observations and instructions to actions, whereas world-action models (WAMs) incorporate learned video or world dynamics into policy learning or action generation. Although both target the same manipulation tasks and represent alternative design choices, they are commonly reported under different evaluation protocols, leaving their capability, robustness, language sensitivity, and deployment-cost trade-offs unclear. We present IndustrialVLA-Bench, an evidence-aware evaluation of six released VLA and WAM systems under a unified reporting schema. It separately evaluates clean capability on LIBERO, non-language robustness on LIBERO-Plus, instruction sensitivity on LIBERO-Para, and observed execution cost. Reported task scores aggregate three complete evaluations with distinct random seeds under a fixed checkpoint and inference configuration. Across all six systems, clean LIBERO averages differ by only 1.58 points, whereas robustness and paraphrase summaries span 14.62 and 31.08 points. Restricting every comparison to the three protocol-faithful systems preserves the effect (1.36, 14.62 and 23.10 points), so the diagnostic separation reported here does not depend on the weaker evidence tiers. We additionally report observed inference latency, peak memory, runtime mode, and an evidence status for every system. Protocol-faithful, near-reproduction, and pending-verification entries remain visibly separated; only protocol-faithful entries support strict comparisons. Rather than claiming universal superiority of either paradigm, IndustrialVLA-Bench provides traceable evidence for comparing released robot policies on shared practical criteria. Code and evaluation records are available at https://github.com/xiaoqi-7/IndustrialVLA-Bench.
- Abstract(参考訳): 視覚言語行動モデル(VLA)は、観察と指示を直接行動にマッピングするのに対し、世界行動モデル(WAM)は、学習されたビデオや世界ダイナミクスを政策学習や行動生成に取り入れる。
どちらも同じ操作タスクをターゲットとし、代替設計の選択を表現しているが、一般的に異なる評価プロトコルの下で報告され、その能力、堅牢性、言語感受性、デプロイメントコストのトレードオフは明確ではない。
IndustrialVLA-Benchは、6つのVLAおよびWAMシステムに対して、統一的な報告スキーマの下でエビデンスを意識した評価を行う。
LIBEROのクリーンな機能、LIBERO-Plusの非言語的堅牢性、LIBERO-Paraの命令感度、実行コストを別々に評価する。
報告されたタスクスコアは、固定されたチェックポイントと推論構成の下で、異なるランダムなシードで3つの完全な評価を集約する。
6つのシステム全体で、クリーンなLIBERO平均値はわずか1.58ポイント、ロバストさとパラフレーズの要約は14.62ポイントと31.08ポイントである。
3つのプロトコルに忠実なシステムとの比較を制限することは、その効果(1.36、14.62、23.10点)を保っているため、ここで報告されている診断分離はより弱いエビデンス層に依存しない。
さらに、観測された推論レイテンシ、ピークメモリ、ランタイムモード、および各システムに対するエビデンスステータスを報告します。
プロトコルに忠実で、ほぼ再現性があり、保留中のエントリだけが視覚的に分離され、プロトコルに忠実なエントリだけが厳密な比較をサポートする。
いずれのパラダイムの普遍的な優位性を主張するのではなく、IndustrialVLA-Benchは、リリースされたロボットポリシーを共通の実践基準で比較する上で、追跡可能な証拠を提供する。
コードと評価記録はhttps://github.com/xiaoqi-7/IndustrialVLA-Benchで公開されている。
関連論文リスト
- What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations) [1.0499611180329804]
私たちは、ChatGPTのチャットUIとOpenAIのAPIの2つのモダリティを、Web検索を有効に/しないで比較した。
例えば、チャットUIレスポンスは、検索を無効にした両方のベンチマークのAPIレスポンスよりも正確ではなかった。
AIの安全性評価は、モダリティ、マルチラン一貫性、探索条件、応答レベルの振る舞いを体系的に考慮すべきである、と我々は主張する。
論文 参考訳(メタデータ) (2026-08-06T15:58:32Z) - EvalSafetyGap: A Hybrid Survey and Conceptual Framework for LLM Evaluation-Safety Failures [0.6588840794922407]
本稿では、物語合成と組み合わせた体系的な探索と、グレーエビデンスを別々に追跡する。
この合成は、ベンチマークの妥当性、動的評価、安全性評価、ジェイルブレイク/拒否の堅牢性、報酬のハッキング、機械的解釈可能性、ガバナンス/監査性という8つのエビデンスストリームにまたがっている。
コントリビューションは、動的評価、透過的なソースレポート、多目的安全測定、監査可能なアライメントプラクティスをサポートするための共通語彙とエビデンスマップである。
論文 参考訳(メタデータ) (2026-06-29T12:33:06Z) - GPF-LiveNews: A Streaming Evaluation Protocol for Group-Conditioned Framing in Large Language Models [0.0]
GPF-LIVENEWSは、グループ条件フレーミングの監査のためのストリーミング評価プロトコルとベンチマークスナップショットである。
新たなBBC/Reutersニュースアンカーを42のアイデンティティラベルと7つのプロンプトファミリーに拡張し、セマンティックセンシティブと感情格差信号を使用して応答バンドルを評価する。
12回以上の監視走行と23回のモデルで、ポリシー/アクションは最も強力なセマンティック・ムーブメントを生み出す。
我々は,全てのスコアを,ヒトの評定のための観察風監査信号として解釈し,恒久的公正度ランキングや有害バイアスの直接的証明として解釈する。
論文 参考訳(メタデータ) (2026-05-16T06:32:11Z) - Claw-Eval: Toward Trustworthy Evaluation of Autonomous Agents [66.97968363332465]
エージェントベンチマークの3つのギャップに対処するエンドツーエンド評価スイートであるClaw-Evalを紹介した。
Claw-Evalは3つのグループにまたがる9つのカテゴリにまたがる300の人間検証タスクで構成されている。
すべてのエージェントアクションは、3つの独立したエビデンスチャネルを通じて記録される。
論文 参考訳(メタデータ) (2026-04-07T17:43:18Z) - vla-eval: A Unified Evaluation Harness for Vision-Language-Action Models [58.633451339058986]
VLAモデルは一般的に、各モデルリポジトリによって独立して維持されるベンチマークスクリプト毎に評価される。
本稿では、ベンチマーク実行からモデル推論を分離するオープンソースの評価ハーネスであるvla evalを紹介する。
完全な評価では、vla eval serveとvla eval runの2つのコマンドしか必要としない。
論文 参考訳(メタデータ) (2026-03-14T14:38:53Z) - CompassVerifier: A Unified and Robust Verifier for LLMs Evaluation and Outcome Reward [50.97588334916863]
評価と結果報酬のための正確で堅牢な軽量検証モデルであるCompassVerifierを開発した。
数学、知識、多種多様な推論タスクにまたがる多分野の能力を示し、様々な答えの型を処理する能力を示す。
我々は,複数のデータソースから収集したモデル出力からなるVerifierBenchベンチマークを導入し,メタエラーパターンを手動で解析してCompassVerifierを強化する。
論文 参考訳(メタデータ) (2025-08-05T17:55:24Z) - Bidirectional Decoding: Improving Action Chunking via Guided Test-Time Sampling [51.38330727868982]
動作チャンキングが学習者と実証者の間の分岐にどのように影響するかを示す。
動作チャンキングをクローズドループ適応でブリッジするテスト時間推論アルゴリズムである双方向デコーディング(BID)を提案する。
提案手法は、7つのシミュレーションベンチマークと2つの実世界のタスクにまたがって、最先端の2つの生成ポリシーの性能を向上させる。
論文 参考訳(メタデータ) (2024-08-30T15:39:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。