論文の概要: Beyond Task Success: Behavioral and Representational Diagnostics for WAM and VLA
- arxiv url: http://arxiv.org/abs/2606.01095v1
- Date: Sun, 31 May 2026 08:35:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-02 21:34:29.202732
- Title: Beyond Task Success: Behavioral and Representational Diagnostics for WAM and VLA
- Title(参考訳): タスク成功を超えて:WAMとVLAの行動・表現診断
- Authors: Hung Mai, Bin Zhu, Tuan Do,
- Abstract要約: VLA(Vision- Language-action)ポリシーとWAM(World-Action Models)は、ロボット操作においてますます重要なパラダイムである。
本稿では,WAMが将来予測を単に追加するか,ロボットの動作や内部表現を制御可能な方法で変更するかを問う。
- 参考スコア(独自算出の注目度): 8.586006378757878
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-language-action (VLA) policies and World-Action Models (WAM) represent two increasingly important paradigms for robotic manipulation. However, it remains unclear whether future prediction in WAMs leads to behaviorally meaningful improvements beyond final task success. In this paper, we ask whether WAMs merely add future prediction, or whether they change robot behavior and internal representations in ways that are actionable for control. We introduce a model-agnostic diagnostic framework that compares WAMs and VLAs through two complementary lenses: behavioral rollout analysis and sparse-autoencoder-based feature analysis. The behavioral protocol measures action dynamics consistency, target-object progress, distractor disturbance, and runtime cost. The feature-space protocol characterizes internal representations as memorized, reactive, or predictive, revealing whether models encode future-oriented structure. Across LIBERO and RoboTwin2.0, we evaluate 7 policies spanning direct VLAs and joint, sequential, and auxiliary WAMs. Our results show that success alone hides key differences: WAMs often improve object-level behavior and target selectivity, but their gains depend on architecture and incur higher inference cost. Sequential WAMs show the clearest predictive structure, while auxiliary and joint WAMs respectively compress or entangle future information. These findings suggest future directions for WAMs design to preserve behaviorally actionable future representations for efficient manipulation.
- Abstract(参考訳): VLA(Vision- Language-action)ポリシーとWAM(World-Action Models)は、ロボット操作においてますます重要なパラダイムである。
しかし、WAMの今後の予測が最終作業の成功を超えて行動的に有意義な改善をもたらすかどうかは不明だ。
本稿では,WAMが将来予測を単に追加するか,ロボットの動作や内部表現を制御可能な方法で変更するかを問う。
本稿では,WAMとVLAを2つの相補レンズで比較するモデルに依存しない診断フレームワークを提案する。
動作プロトコルは、アクションの動的一貫性、ターゲットオブジェクトの進捗、イントラクタ障害、実行時のコストを測定します。
特徴空間プロトコルは、内部表現を記憶、反応、予測として特徴付け、モデルが将来の指向構造を符号化するかどうかを明らかにする。
LIBERO と RoboTwin2.0 全体で,直接 VLA とジョイント,シーケンシャル,補助WAM にまたがる7つのポリシーを評価した。
WAMは、しばしばオブジェクトレベルの振る舞いとターゲットの選択性を改善するが、その利得はアーキテクチャに依存し、推論コストが高くなる。
逐次的なWAMは最も明確な予測構造を示し、補助的なWAMと共同的なWAMはそれぞれ将来の情報を圧縮または絡み合わせる。
これらの結果から,WAMの設計における将来的方向性は,効率的な操作のための行動的行動可能な未来の表現を保存できることが示唆された。
関連論文リスト
- Guide, Think, Act: Interactive Embodied Reasoning in Vision-Language-Action Models [15.486973209713954]
GTA-VLA(Guide, Think, Act)はインタラクティブなビジョンランゲージ・アクション・フレームワークである。
ユーザがロボットポリシーを明示的な視覚的手がかりでガイドできるようにすることで、空間的に操作可能な具体的推論を可能にする。
論文 参考訳(メタデータ) (2026-05-13T14:58:29Z) - HarmoWAM: Harmonizing Generalizable and Precise Manipulation via Adaptive World Action Models [58.191567345416836]
世界行動モデル(WAM)は、物理力学のモデリングによるロボット制御のための有望なパラダイムとして登場した。
HarmoWAMは、予測と反応の制御を統一するために世界モデルを完全に活用し、一般的なトランジットと正確な操作を可能にする。
実世界の6つのロボットタスクにまたがる3つのトレーニング未確認テスト環境を構築し、背景、位置、オブジェクトの意味のバリエーションをカバーした。
論文 参考訳(メタデータ) (2026-05-11T17:59:56Z) - Is the Future Compatible? Diagnosing Dynamic Consistency in World Action Models [28.165928090888986]
世界行動モデル(WAM)は、将来の観察と行動を予測することにより、想像上のロールアウトを通じて意思決定を可能にする。
動作状態の整合性、予測された動作と誘導された状態遷移の整合性を、WAMの信頼性の欠如の軸として同定する。
テスト時間選択のための価値のないコンセンサス戦略を導入し、予測される未来間での合意によって、候補のロールアウトをランク付けする。
論文 参考訳(メタデータ) (2026-05-08T09:44:43Z) - From Pixels to Tokens: A Systematic Study of Latent Action Supervision for Vision-Language-Action Models [14.109112325287208]
本研究は,2つの視点から潜時行動監視に関する研究である。 (i) 画像に基づく潜時行動による軌道の規則化, (ii) 行動に基づく潜時行動による目標空間の統一である。
以上の結果より, 動作に基づく潜在動作は複雑な運動調整において優れるが, 定式化タスク対応は明らかである。
論文 参考訳(メタデータ) (2026-05-06T09:27:07Z) - ProgressVLA: Progress-Guided Diffusion Policy for Vision-Language Robotic Manipulation [57.07494675832939]
ロボット操作のための既存の視覚言語アクション(VLA)モデルは、進歩意識を欠いている。
本研究では,textbf vla という新しいモデルを提案し,タスク進捗の推定と統合について検討する。
CALVINとLIBEROベンチマークの実験は、実世界のロボットの展開とともに、成功率の大幅な改善を一貫して示している。
論文 参考訳(メタデータ) (2026-03-29T12:38:11Z) - Reshaping Action Error Distributions for Reliable Vision-Language-Action Models [69.38615670891038]
ロボット操作において、視覚言語アクション(VLA)モデルは、一般化可能でスケーラブルなロボットポリシーを学ぶための有望なパラダイムとして登場した。
連続動作型VLAモデルに焦点をあて、トレーニング中の動作誤差分布を再構成することにより、従来のMSEベースの回帰を超越する。
複数の代表的VLAアーキテクチャ上で、標準、少数ショット、ノイズの多い設定にまたがるアプローチを評価します。
論文 参考訳(メタデータ) (2026-02-04T05:37:09Z) - PSALM-V: Automating Symbolic Planning in Interactive Visual Environments with Large Language Models [22.688086293676328]
視覚環境における象徴的行動意味論(プレコンディションとポストコンディション)を誘導できる最初の自律型ニューロシンボリック学習システムPSALM-Vを提案する。
PSALM-Vは、専門家のアクション定義なしで信頼できるシンボリックプランニングを行い、LSMを使って計画と候補シンボリックセマンティクスを生成する。
論文 参考訳(メタデータ) (2025-06-25T02:44:20Z) - HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model [54.64088247291416]
操作ポリシー設計の基本的な目的は、ロボットに人間の指示を理解し、シーンの手がかりを推論し、動的な環境で一般化されたアクションを実行することである。
近年の自己回帰的視覚言語行動(VLA)法は、視覚言語モデル(VLM)から常識推論能力を継承し、次の行動予測を行う。
拡散に基づく行動の連続的な性質と自己回帰の文脈的推論を吸収する統合フレームワークであるHybridVLAを紹介する。
論文 参考訳(メタデータ) (2025-03-13T17:59:52Z) - ACT-JEPA: Novel Joint-Embedding Predictive Architecture for Efficient Policy Representation Learning [90.41852663775086]
ACT-JEPAは模倣学習と自己教師型学習を統合する新しいアーキテクチャである。
我々はアクションシーケンスと抽象的な観察シーケンスを予測するポリシーを訓練する。
実験の結果,ACT-JEPAは時間環境の動的学習によって表現の質を向上させることがわかった。
論文 参考訳(メタデータ) (2025-01-24T16:41:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。