論文の概要: Outcome-Conditioned End-Effector Geometry Across Vision-Language-Action Policies
- arxiv url: http://arxiv.org/abs/2609.21659v2
- Date: Wed, 23 Sep 2026 07:02:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 00:05:17.647254
- Title: Outcome-Conditioned End-Effector Geometry Across Vision-Language-Action Policies
- Title(参考訳): ビジョン・ランゲージ・アクション・ポリシー全体でのアウトカム・コンディションド・エンドエフェクタ・ジオメトリ
- Abstract要約: 我々は4つの方針から15,000個の閉ループLIBEROロールアウトにおけるクロス・ポリチック・エンドエフェクタ・ジオメトリについて検討した。
両者のペアは、正確に1つのポリシーが成功すると0.0120 m と 0.0380 m の中央値の正規化された動的時間ワープ距離を持つ。
- 参考スコア(独自算出の注目度): 10.096346957868388
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-language-action (VLA) policies solve the same manipulation task through different action interfaces, but task success alone does not establish whether their physical executions agree. We study cross-policy end-effector geometry in 15,000 closed-loop LIBERO rollouts from four policies. The primary clean-condition analysis forms 3,600 configuration-matched, and therefore dependent, policy pairs. Both-success pairs have a median normalized dynamic time warping distance of 0.0120 m versus 0.0380 m when exactly one policy succeeds. This ordering holds in every task, every policy pair, and nine sampling and band-limited representations; however, the ratio varies severalfold across representations, so we report the direction rather than a fixed multiple. Both-failure pairs are more separated again but rest on thin, uneven support, so we report them as exploratory. Within successful executions, partner replacements separate more across tasks than across initial states. A matched baseline still reveals measurable, heterogeneous residual policy differences, so a low cross-policy distance does not imply interchangeability. Successful executions sit about as far from same-task demonstrations as those demonstrations sit from each other, compatible with task-associated geometry without separating training-data overlap from task constraints. A common 72-action window preserves the ordering but reduces its magnitude; endpoint and duration adjustment likewise leaves a positive mixed-outcome coefficient relative to both-success pairs, though its magnitude is specification-dependent. Under composite visual stress, policy rankings and pair composition change together.
- Abstract(参考訳): 視覚言語アクション(VLA)ポリシーは、異なるアクションインターフェースを通じて同じ操作タスクを解決するが、タスクの成功だけでは、それらの物理的な実行が一致するかどうかを確定しない。
我々は4つの方針から15,000個の閉ループLIBEROロールアウトにおけるクロス・ポリチック・エンドエフェクタ・ジオメトリについて検討した。
一次クリーンコンディション解析は3,600のコンフィグレーションマッチング、従ってポリシーペアを形成する。
両者のペアは、正確に1つのポリシーが成功すると0.0120 m と 0.0380 m の中央値の正規化された動的時間ワープ距離を持つ。
この順序付けは、すべてのタスク、すべてのポリシーペア、9つのサンプリングおよびバンド制限表現に当てはまるが、その比率は表現によって数倍異なるので、固定多重ではなく方向を報告する。
両障害ペアは、再び分離されるが、細く不均一なサポートで休んでいるため、探索として報告する。
実行が成功した場合、パートナー置換は初期状態よりもタスク間で分離される。
一致した基準線は、測定可能な、不均一な残留政策の相違をまだ示しているため、低政界距離は、インターチェンジ性を示唆しない。
成功した実行は、同じタスクのデモからほぼ遠ざかっており、これらのデモは、タスク制約からトレーニングデータのオーバーラップを分離することなく、タスクに関連する幾何学と互換性がある。
共通72-アクションウィンドウは順序を保つが、その大きさを減少させる; 終点と持続時間調整も同様に、その大きさは仕様に依存しているにもかかわらず、両方の成功ペアに対して正の混合アウトカム係数を残している。
複合的な視覚的ストレスの下では、ポリシーランキングとペア構成が一緒に変化する。
関連論文リスト
- Beyond Single-Axis Testing: Paired Evaluation of Compound Robustness in Vision-Language-Action Policies [4.55011976634859]
単軸評価から複合ロバスト性を推定できるかどうかを問う。
LIBERO-CTRLは6軸ベンチマークで、各初期状態を1軸条件でペアリングする。
1つのトランジションは複合的な成功を減少させ、もう1つのトランジションはそれを増大させるため、それらはキャンセルすることができ、集合的なパフォーマンスは単軸測定と一致しているように見える。
論文 参考訳(メタデータ) (2026-09-14T17:44:54Z) - MemCorr-DP: Counterfactual Correspondence Conditioning for a Diffusion Policy Guided by a Reference [6.8087753393731125]
凍結したRoMa v2を持ち上げる拡散ポリシであるMemCorr-DPを,現在のシーンと参照軌道との明示的な3次元関係に整合する。
この組み合わせにより、MemCorr-DPは96.67%のクローズドループ成功を達成し、同じアクションアーキテクチャを持つビジュアルトランスフォーマーでは88.90%となった。
論文 参考訳(メタデータ) (2026-09-06T14:03:20Z) - PAVE: Predictive Alignment and Value-Guided Evolution for World-Action Policies [17.87859739145508]
直接視覚-言語-アクションポリシーは、継続的なロボット動作を効率的に生成するが、標準的な行動クローンは2つの相補的なギャップを残している。
結果に依存しない予測学習と結果認識型政策改善を組み合わせた,直接的な世界行動政策である方法を紹介する。
論文 参考訳(メタデータ) (2026-08-31T07:36:11Z) - Metric Aggregation Divergence: A Hidden Validity Threat in Agent-Based Policy Optimization and a Contractual Remedy [7.1976264551575895]
メートル法アグリゲーション分散(英: Metric aggregate divergence、MAD)は、エージェントベースのモデルにおいて、異なるパイプラインステージで発生するサイレント不整合である。
私たちは、ディスパッチ時に実施される単一の呼び出し可能なランタイムであるメトリックコントラクトを、対策として紹介します。
論文 参考訳(メタデータ) (2026-06-27T18:17:33Z) - Learning Policy Representations for Steerable Behavior Synthesis [80.4542176039074]
マルコフ決定プロセス(MDP)を前提として,テスト時の行動ステアリングを促進するために,さまざまなポリシーの表現を学習する。
これらの表現は、セットベースアーキテクチャを用いて、様々なポリシーに対して均一に近似できることを示す。
変動生成法を用いてスムーズな潜伏空間を導出し,さらにコントラスト学習により、潜伏距離が値関数の差と一致するように形成する。
論文 参考訳(メタデータ) (2026-01-29T21:52:06Z) - See Less, Drive Better: Generalizable End-to-End Autonomous Driving via Foundation Models Stochastic Patch Selection [51.59559387222532]
エンドツーエンド自動運転の最近の進歩は、パッチアライメント機能で訓練されたポリシーが、アウト・オブ・ディストリビューション(OOD)よりも一般化していることを示している。
我々は、より堅牢で、一般化可能で、効率的な学習ポリシーのためのシンプルで効果的なアプローチである2.4-Patch-Selection(SPS)を提案する。
論文 参考訳(メタデータ) (2026-01-15T18:58:33Z) - Inference-Time Policy Steering through Human Interactions [54.02655062969934]
推論中、人間はしばしばポリシー実行ループから取り除かれる。
本稿では,人間のインタラクションを活用して生成するサンプリングプロセスにバイアスを与える推論時ポリシーステアリングフレームワークを提案する。
提案手法は,アライメントと分布シフトの最良のトレードオフを実現する。
論文 参考訳(メタデータ) (2024-11-25T18:03:50Z) - Policy Dispersion in Non-Markovian Environment [53.05904889617441]
本稿では,非マルコフ環境下での国家行動ペアの歴史から,多様な政策の学習を試みる。
まず、ポリシー埋め込みを学習するために、トランスフォーマーベースの手法を採用する。
次に,政策埋め込みを積み重ねて分散行列を構築し,多様な政策の集合を誘導する。
論文 参考訳(メタデータ) (2023-02-28T11:58:39Z) - Off-policy Evaluation in Infinite-Horizon Reinforcement Learning with
Latent Confounders [62.54431888432302]
無限水平エルゴードマルコフ決定過程におけるOPE問題について考察する。
我々は、状態と行動の潜在変数モデルのみを考慮すれば、政策値が政治外のデータから特定できることを示す。
論文 参考訳(メタデータ) (2020-07-27T22:19:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。