論文の概要: Patch Policy: Efficient Embodied Control via Dense Visual Representations
- arxiv url: http://arxiv.org/abs/2607.18236v1
- Date: Mon, 20 Jul 2026 17:59:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.734619
- Title: Patch Policy: Efficient Embodied Control via Dense Visual Representations
- Title(参考訳): パッチポリシー:高密度視覚表現による効率的な身体制御
- Authors: Gaoyue Zhou, Zichen Jeff Cui, Ada Langford, Bowen Tan, Yann LeCun, Lerrel Pinto,
- Abstract要約: 我々は,フルVLMの計算オーバーヘッドを伴わずに,事前訓練済みの高密度パッチトークンを直接消費するパッチポリシーを開発した。
提案手法は,最先端のグローバルプール表現を用いた政策よりも40%の相対的な改善を実現している。
微調整されたOpenVLA-OFTを18%上回り、パラメータの約0.7%を使用する。
- 参考スコア(独自算出の注目度): 52.199962246592285
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Pretrained dense visual features from Vision Transformers (ViTs) are powerful yet have been underutilized in robot learning. Modern robot policies either compress each observation into a single global token, or rely on visual backbones trained from scratch, sacrificing both fine-grained spatial detail and the benefits of large-scale visual pre-training. While there exist policies that do operate on dense patch features like large vision-language-action models (VLAs), they tend to be heavy and slow, inheriting the full cost of a billion-parameter vision-language model (VLM) backbone. We close this gap with Patch Policy, a minimal architectural extension that enables transformer-based policies to consume dense pre-trained patch tokens directly without the computational overhead of a full VLM. At its core is a block-causal attention mask that preserves the temporal causality of standard policies while letting the model attend over many patch tokens per observation, alongside other state information. Patch Policy is lightweight, fast, and highly effective. Across four simulated and three real-world environment suites, our method achieves a 40% relative improvement over policies using state-of-the-art global-pooled representations. Furthermore, it surpasses fine-tuned OpenVLA-OFT by 18% while using roughly 0.7% of the parameters. We believe Patch Policy provides a pipeline for the robotics community to readily leverage continuing progress in visual representation learning, without sacrificing the training efficiency or inference speed required for high-frequency, reactive control. Videos can be viewed at https://patch-policy.github.io
- Abstract(参考訳): ビジョントランスフォーマー(ViT)からの事前訓練された密集した視覚的特徴は強力だが、ロボット学習では利用されていない。
現代のロボットポリシーは、それぞれの観察結果を単一のグローバルトークンに圧縮するか、あるいはスクラッチから訓練された視覚的バックボーンに依存し、きめ細かい空間的詳細と大規模な視覚前訓練の利点の両方を犠牲にする。
大規模な視覚言語モデル(VLA)のような密集したパッチ機能を操作するポリシーは存在するが、それらは重く遅く、数十億パラメータの視覚言語モデル(VLM)のバックボーンを完全に継承する傾向にある。
Patch Policyは、トランスフォーマーベースのポリシーで、完全なVLMの計算オーバーヘッドを伴わずに、高密度でトレーニング済みのパッチトークンを直接消費できる最小限のアーキテクチャ拡張である。
その中核はブロック因果注意マスクであり、標準ポリシーの時間的因果性を維持しながら、他の状態情報とともに、観測毎に多くのパッチトークンにモデルを参加させる。
パッチポリシーは軽量で、高速で、非常に効果的です。
シミュレーションされた4つの実環境スイートと3つの実環境スイートにまたがって、我々の手法は最先端のグローバルプール表現を用いた政策よりも40%の相対的な改善を実現している。
さらに、パラメータの約0.7%を使用しながら、微調整されたOpenVLA-OFTを18%上回る。
Patch Policyは、ロボットコミュニティにとって、高速でリアクティブな制御に必要なトレーニング効率や推論速度を犠牲にすることなく、視覚表現学習の継続的な進歩を容易に活用するためのパイプラインを提供する、と私たちは信じています。
ビデオはhttps://patch-policy.github.ioで見ることができる。
関連論文リスト
- Language-Guided Token Compression with Reinforcement Learning in Large Vision-Language Models [19.87835200940665]
TPRLは、言語誘導シーケンシャル最適化を通じて適応的なプルーニング軌跡を学習し、エンドタスク性能に直結する。
我々は、明示的な状態遷移を伴う逐次決定プロセスとして視覚トークンプルーニングを定式化する。
我々は、自己教師付きオートエンコーダを用いて、視覚トークンを効率的なポリシー学習のためのコンパクトな状態表現に圧縮する。
論文 参考訳(メタデータ) (2026-03-11T09:52:44Z) - IVRA: Improving Visual-Token Relations for Robot Action Policy with Training-Free Hint-Based Guidance [35.90972175891154]
多くのVision-Language-Action (VLA)モデルは、画像パッチを1Dトークンシーケンスに平坦化し、正確な操作に必要な2D空間キューを弱める。
我々は,モデルに組み込まれた視覚で既に利用可能な親和性ヒントを活用することにより,空間的理解を改善する軽量なトレーニング不要な手法を提案する。
論文 参考訳(メタデータ) (2026-01-22T18:57:13Z) - See Less, Drive Better: Generalizable End-to-End Autonomous Driving via Foundation Models Stochastic Patch Selection [51.59559387222532]
エンドツーエンド自動運転の最近の進歩は、パッチアライメント機能で訓練されたポリシーが、アウト・オブ・ディストリビューション(OOD)よりも一般化していることを示している。
我々は、より堅牢で、一般化可能で、効率的な学習ポリシーのためのシンプルで効果的なアプローチである2.4-Patch-Selection(SPS)を提案する。
論文 参考訳(メタデータ) (2026-01-15T18:58:33Z) - MemER: Scaling Up Memory for Robot Control via Experience Retrieval [46.5398413633767]
人間は日常的にメモリをタスクに頼っているが、ほとんどのロボットポリシーはこの機能を欠いている。
本稿では,その経験から過去の関連事項を選択し,追跡するために,ハイレベルな政策を訓練する階層的な政策枠組みを提案する。
我々のアプローチであるMemERは、数分のメモリを必要とする3つの現実世界の長距離ロボット操作タスクにおいて、従来の手法よりも優れています。
論文 参考訳(メタデータ) (2025-10-23T08:26:17Z) - Patch-as-Decodable-Token: Towards Unified Multi-Modal Vision Tasks in MLLMs [88.68484904214142]
Patch-as-Decodable Token (PaDT)を導入し、テキストと多様な視覚出力を生成する。
PaDTの中心は、クエリイメージのビジュアルパッチ埋め込みから派生したVisual Reference Tokens (VRT)である。
MLLMモデルと比較しても,PaDTは最先端の性能を一貫して達成できることを示す。
論文 参考訳(メタデータ) (2025-10-02T12:23:57Z) - PEEK: Guiding and Minimal Image Representations for Zero-Shot Generalization of Robot Manipulation Policies [32.6823407205603]
本稿では,PEEK(Policy-Agnostic extract of Essential Keypoints)を提案する。
これらのアノテーションはロボットの観察に直接オーバーレイされるので、表現はポリシーに依存しず、アーキテクチャ全体にわたって転送可能である。
実世界の評価では、PEEKはゼロショットの一般化を継続的に強化し、シミュレーションでのみ訓練された3Dポリシーの41.4倍の現実世界の改善を達成している。
論文 参考訳(メタデータ) (2025-09-22T18:10:14Z) - FLARE: Robot Learning with Implicit World Modeling [87.81846091038676]
$textbfFLARE$は、予測潜在世界モデリングをロボットポリシー学習に統合する。
$textbfFLARE$は最先端のパフォーマンスを実現し、これまでのポリシー学習のベースラインを最大26%上回っている。
この結果は、暗黙の世界モデリングと高周波ロボット制御を組み合わせた汎用的でスケーラブルなアプローチとして$textbfFLARE$を確立した。
論文 参考訳(メタデータ) (2025-05-21T15:33:27Z) - Zero-Shot Visual Generalization in Robot Manipulation [0.13280779791485384]
現在のアプローチは、しばしば点雲や深さのような不変表現に頼ることで問題を横取りする。
ディアングル型表現学習は、視覚的分布シフトに対して、視覚に基づく強化学習ポリシーを堅牢化できることを最近示した。
シミュレーションおよび実ハードウェア上での視覚摂動に対するゼロショット適応性を示す。
論文 参考訳(メタデータ) (2025-05-16T22:01:46Z) - Any-point Trajectory Modeling for Policy Learning [64.23861308947852]
我々は、ビデオフレーム内の任意の点の将来の軌跡を予測するために、ATM(Any-point Trajectory Modeling)を導入する。
ATMは、強力なビデオ事前トレーニングベースラインを平均80%上回っている。
本研究では,人間の動画やビデオからの操作スキルを,異なるロボット形態から効果的に伝達する学習方法を示す。
論文 参考訳(メタデータ) (2023-12-28T23:34:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。