論文の概要: Beyond Reconstruction: What Matters in Action Tokenization for Robot Policies?
- arxiv url: http://arxiv.org/abs/2610.09170v1
- Date: Tue, 06 Oct 2026 22:12:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 21:58:22.632186
- Title: Beyond Reconstruction: What Matters in Action Tokenization for Robot Policies?
- Title(参考訳): リコンストラクションを超えて:ロボット政策におけるアクショントークン化とは何か?
- Abstract要約: 本稿では,下流予測可能性とロバスト性の向上を目標として,再建を戦略的に強化するトークン化学習手法であるProActを紹介する。
Robomimic、LIBERO、RoboTwinのベンチマーク、およびさまざまなトークン化アーキテクチャ全体において、ProActはロールアウトの成功を平均11.3ポイント改善している。
これらの改善はビジョン・ランゲージ・アクション・ポリシーや実世界のロボット操作にも寄与し、それぞれ平均利得は21.8ポイント、36.7%となった。
- 参考スコア(独自算出の注目度): 6.4642902322192315
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Autoregressive action-token policies such as vision-language-action models require action tokenizers to translate discrete token sequences into precise control actions in continuous space. Many action tokenizers learn the mapping between tokens and actions via a reconstruction objective. However, as we show through extensive analysis, sufficiently accurate action reconstruction is only one part of what makes a downstream robot policy successful. It is also critical that the policy is able to predict the right tokens for new observations, and that unseen policy token predictions still decode into reasonable actions. These properties are downstream of tokenizer training and are not directly incentivized by a reconstruction objective alone. In this work, we introduce Predictable and Robust Action Tokenization (ProAct), a tokenizer training method that strategically augments reconstruction with the goal of improving downstream predictability and robustness. ProAct is policy-agnostic and uses only action datasets for training. Across the Robomimic, LIBERO, and RoboTwin benchmarks and a diverse set of tokenizer architectures, ProAct improves rollout success by an average of 11.3 percentage points. These improvements also translate to vision-language-action policies and real-world robotic manipulation, yielding average gains of 21.8 and 36.7 percentage points, respectively. These results suggest that effective action tokenization should be designed as a policy interface that balances fidelity, predictability, and robustness, rather than as a reconstruction problem alone.
- Abstract(参考訳): 視覚言語アクションモデルのような自己回帰的なアクショントークンポリシーは、離散トークンシーケンスを連続空間における正確な制御アクションに変換するためにアクショントークン化器を必要とする。
多くのアクショントークンエーザは、再構築の目的を通じてトークンとアクションのマッピングを学ぶ。
しかし、広範に分析した結果、十分に正確な行動再構成は、下流ロボットのポリシーを成功させる部分の1つに過ぎなかった。
また、新たな観測のために適切なトークンを予測できることや、見当たらないトークンの予測が依然として合理的な行動にデコードされることも重要である。
これらの特性は、トークン化者のトレーニングの下流にあり、再構築目的だけで直接インセンティブを与えるものではない。
本研究では,下流予測可能性とロバスト性の向上を目標として,再建を戦略的に強化するトークン化学習手法であるPredictable and Robust Action Tokenization(ProAct)を紹介する。
ProActはポリシーに依存しないため、トレーニングにはアクションデータセットのみを使用する。
Robomimic、LIBERO、RoboTwinのベンチマーク、およびさまざまなトークン化アーキテクチャ全体において、ProActはロールアウトの成功を平均11.3ポイント改善している。
これらの改善はビジョン・ランゲージ・アクション・ポリシーや実世界のロボット操作にも寄与し、それぞれ平均利得は21.8ポイント、36.7%となった。
これらの結果から, 効果的な行動トークン化は, 再建問題のみではなく, 忠実度, 予測可能性, 堅牢性のバランスをとるための政策インターフェースとして設計されるべきであることが示唆された。
関連論文リスト
- CAP: Codebook-Aligned Prediction for Tokenized Robot Policies [6.4642902322192315]
アクショントークン化は、ロボットアクションを自己回帰的にモデル化できる離散シンボルに変換する。
既存のトークンーベースのポリシーは、一般的にトークンーが学習した潜在コード構造を無視します。
本稿では,トークンのコードベクトルをポリシークラスプロトタイプとして直接再利用するCodebook-Aligned Prediction (CAP)を紹介する。
論文 参考訳(メタデータ) (2026-10-06T22:28:45Z) - TOAST: Stochastic Robot Action Tokenization for Autoregressive Vision-Language-Action Models [2.877144102525726]
自己回帰視覚ランゲージ・アクションモデルはしばしば、連続したロボットの動作を離散トークンシーケンスとして表現する。
FASTは、様々な時間周波数を含むアクションを比較的少ないトークンにコンパクトに符号化することで、この表現を大幅に改善した。
この表現冗長性を活用すれば、政策学習が向上するかどうかを検討する。
論文 参考訳(メタデータ) (2026-10-01T01:28:33Z) - Behavior-Aligned Action Tokenization for Robot Policy Learning [9.37360970873363]
自己回帰型ロボットポリシーは、観察から個別のアクショントークンを予測することによって、継続的な制御を学習する。
本研究では,対応する動作チャンクを選択し,その量子化座標を再構成とともに整列させる行動適応型行動トークン化(BAAT)を提案する。
履歴条件付き拡散復号器はこれらのトークンから連続的なアクションチャンクを再構成し、下流の自己回帰ポリシーはそれらを予測することを学ぶ。
論文 参考訳(メタデータ) (2026-09-23T08:12:03Z) - ActionPiece: Rethinking Action Tokenization for Autoregressive Vision-Language-Action Models [40.14720118215973]
アクショントークンーは自己回帰視覚アクション(VLA)モデルにおいて中心的な役割を果たす。
トークン化が再建後の局所的物理的距離ランキングをどれだけよく保存するかを測定するために,身体的ランクの整合性(PRC)を導入する。
本稿では,表現学習と量子化の連携による身体行動関係の保存を行うActionPieceを提案する。
論文 参考訳(メタデータ) (2026-09-16T11:19:54Z) - Dynin-Robotics: Omnimodal Unified Diffusion Vision-Language-Action Model [7.384043308834925]
視覚目標とダイナミックス予測は、目標とする結果とアクションに依存したシーン変化の表現の両方で言語条件のロボットポリシーを提供することができる。
ダイニン・ロボティクスはこの定式化をダイニン・オムニに実装し、言語、視覚的観察、ゴール、アクションを離散トークンとして表現している。
我々は、48のOpen X-Embodimentデータセットから約133万の軌道上でモデルを継続的に事前訓練し、下流ドメインに個別に適応する。
論文 参考訳(メタデータ) (2026-09-11T16:49:26Z) - Why Does Action Chunking Improve Behavioral Cloning Performance in Robotic Control? [78.81308700607651]
アクションチャンキングは単一のアクションではなく、複数のアクションを予測し、実行する。
非マルコフ表現率の増大と、マルコフポリシーと比較して複合誤差の低減による作用チャンキングの利点が示された。
本稿では,アンサンブルを明示的にインスタンス化することで,アクションチャンキングのメリットを増幅するポリシークラスを提案する。
論文 参考訳(メタデータ) (2026-08-03T17:32:45Z) - PRTS: A Primitive Reasoning and Tasking System via Contrastive Representations [66.94988600664574]
我々は,目標達成型強化学習を通じて事前学習を再構築するVLA基盤モデルであるtextbfPRTS(textbfPrimitive textbfReasoning and textbfTasking textbfSystem)を提案する。
論文 参考訳(メタデータ) (2026-04-30T06:14:02Z) - CorrectionPlanner: Self-Correction Planner with Reinforcement Learning in Autonomous Driving [55.88697462014118]
CorrectionPlannerは自己補正を備えた自動回帰プランナーである。
Waymaxでは衝突率を20%以上削減し、nuPlanでは最先端の計画スコアを達成している。
論文 参考訳(メタデータ) (2026-03-16T18:03:21Z) - Dense Policy: Bidirectional Autoregressive Learning of Actions [51.60428100831717]
本稿では,行動予測における自己回帰的政策の新たなパラダイムを確立するために,Dense Policyと呼ばれる双方向拡張学習手法を提案する。
軽量なエンコーダのみのアーキテクチャを使用して、アクションシーケンスを初期単一フレームからターゲットシーケンスへ粗い方法で反復的に展開する。
実験により、我々の密集した政策は自己回帰学習能力に優れており、既存の全体的生成ポリシーを超越できることが示された。
論文 参考訳(メタデータ) (2025-03-17T14:28:08Z) - Activation Scaling for Steering and Interpreting Language Models [55.59689963561315]
モデルにうまく介入することは、内部の動作を解釈するための前提条件である、と我々は主張する。
成功した介入は、間違ったトークンで正しいことを正し、その逆を正すべきである。
勾配に基づく最適化を用いることで、特定の種類の効率的かつ解釈可能な介入を学習(そして後で評価)することができる。
論文 参考訳(メタデータ) (2024-10-07T12:01:32Z) - Offline Contextual Bandits with Overparameterized Models [52.788628474552276]
オフラインの文脈的盗賊にも同じ現象が起こるかどうかを問う。
この相違は, 目的の強調安定性によるものであることを示す。
大規模なニューラルネットワークを用いた実験では、アクション安定な値ベース目標と不安定なポリシベース目標とのギャップは、大きなパフォーマンス差をもたらす。
論文 参考訳(メタデータ) (2020-06-27T13:52:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。