論文の概要: Compact Robot Policies Need Fine-Grained Visual Representations
- arxiv url: http://arxiv.org/abs/2610.08183v1
- Date: Tue, 06 Oct 2026 11:36:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.964915
- Title: Compact Robot Policies Need Fine-Grained Visual Representations
- Title(参考訳): 精密な視覚表現を必要とする小型ロボット
- Abstract要約: CoRPは、表現抽出器とフローマッチングアクションジェネレータに分解するコンパクトなポリシーである。
LIBEROは97.0%、RoboTwin 2.0は75.78%/73.36%に達する。
我々は、その表現が事前訓練され、タスク適応され、圧縮されたときに、コンパクトなポリシーが機能すると主張する。
- 参考スコア(独自算出の注目度): 4.682431619746478
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multi-task manipulation policies differ in architecture, scale, and pretrained priors all at once, so published comparisons cannot attribute performance to any single component. We argue that most of it comes from the visual representation, and that parameter scale and generative priors are largely incidental. To test this, we build CoRP (Compressed Representation Policy), a deliberately compact policy (48.9M parameters, no vision-language model and no video-generative prior) that factorizes into a representation extractor and a flow-matching action generator. It reaches 97.0% on LIBERO and 75.78%/73.36% on RoboTwin 2.0 Clean/Randomized, matching systems 40.9-163.6x larger. Holding the action generator fixed, we then vary one extractor property at a time. Pretrained initialization is decisive: a random ViT-S/14 drops to 78.1% and an ImageNet ResNet-34 to 74.5% on LIBERO. Pretraining alone is not enough, as freezing the encoder costs 19.8 points. Compression matters as much: resampling each view to 48 tokens beats passing all patch tokens (97.0% vs 83.2%), and a variational information bottleneck over those tokens is worse than a hard token budget, cutting LIBERO-Goal from 95.8% to 33.0% by suppressing the instruction-dependent token selection the policy relies on. Language conditioning contributes only where the observation leaves the goal ambiguous (LIBERO-Goal: 9.2% to 95.8%), while on RoboTwin 2.0, where observations are unambiguous, removing it slightly improves success. Therefore, we argue that a compact policy works when its representation is pretrained, task-adapted, and compressed. Project page: https://corp-policy.github.io/
- Abstract(参考訳): マルチタスク操作ポリシーは、アーキテクチャ、スケール、事前訓練された事前訓練のすべてにおいて、一度に異なるため、公表された比較は、すべての単一コンポーネントのパフォーマンスを評価できない。
そのほとんどが視覚的表現によるもので、パラメータのスケールと生成の先行は大部分が偶発的である、と我々は主張する。
そこで我々はCoRP(Compressed Representation Policy, 圧縮表現ポリシー)を構築する。これは意図的なコンパクトなポリシー(48.9Mパラメータ, 視覚言語モデル, ビデオ生成前のモデル)であり、表現抽出器とフローマッチングアクションジェネレータに分解する。
LIBEROは97.0%、RoboTwin 2.0は75.78%/73.36%、マッチングシステムは40.9-163.6倍である。
アクションジェネレータを固定すると、一度に1つの抽出器特性が変化する。
ViT-S/14のランダムな初期化は78.1%、ImageNet ResNet-34は74.5%に低下する。
エンコーダの冷凍には19.8ポイントの費用がかかるため、単独でのトレーニングだけでは不十分である。
各ビューを48個のトークンに再サンプリングすると、すべてのパッチトークン(97.0%対83.2%)が通過し、それらのトークンに対する変動情報のボトルネックはハードトークンの予算よりも悪くなり、LIBERO-Goalが95.8%から33.0%に削減され、ポリシーが依存する命令依存トークンの選択が抑制される。
言語条件付けは、目標が曖昧なもの(LIBERO-Goal: 9.2% - 95.8%)を残しているのに対して、RoboTwin 2.0では、観測が曖昧であり、わずかに改善されている。
したがって、コンパクトなポリシーは、その表現が事前訓練され、タスク適応され、圧縮されたときに有効である、と論じる。
プロジェクトページ: https://corp-policy.github.io/
関連論文リスト
- DORA: Dynamic Online Reinforcement Agent for Token Pruning in Vision Transformers [6.235887167172886]
DORAは、凍結したViTに対して入力適応型プルーニングポリシー自体を学ぶ。
DeiT-BaseのImageNet-1Kでは、FLOPを38.4%削減している。
平均して4つのViT型バックボーンの精度が一致し、DORAは13.2%のFLOPを使用する。
論文 参考訳(メタデータ) (2026-09-28T05:02:41Z) - Robo-Harness K1: Harnessing Robot-Use Agents via Perception Augmentation [61.15247763568461]
本稿では,ロボット利用エージェントフレームワークであるRobo-Harness K1を紹介する。
一致した LIBERO-PRO タスクでは、Gemini 3.7 Flash with K1 が 77.8% に達し、GPT-6 Astra の 61.1% を RGB のみのハーネスで上回った。
RoboTwin では Easy で 32.0%、Hard で 28.0% を達成し、視覚的および環境的な摂動に対するレジリエンスを示している。
論文 参考訳(メタデータ) (2026-09-24T11:16:18Z) - Learning Foresight without Explicit Trajectories for 3D Diffusion Policies [54.692734738738885]
3次元拡散ポリシは、現在の観測から幾何学的に基底化されたアクションを生成するのに強い。
我々は,この予測を明示的な計画を導入することなく,シンプルかつ効果的な手段である運動傾向ガイダンスを導入する。
正確にどこに移動すべきかを告げることなく、相互作用がどこに向かっているかを知ることで、大きなメリットを享受できることを、私たちは示しています。
論文 参考訳(メタデータ) (2026-09-17T16:44:13Z) - View-Structured Conformal Prediction for 3D Gaussian Splatting [26.600186868779364]
3D Gaussian Splatting (3DGS)は、新しいビューをリアルタイムでレンダリングするが、不確実なヒートマップは、レンダリングされたビューが特定の予測カバレッジを満たすことを証明しない。
ビュー構造化コンフォーマル予測(VSCP)を提案する。
これは、事前校正スケールを、必要となる最小のビューワイズ乗算器を予測する有界および移動可能なビューワイズ因子から空間的な形状に分割する。
論文 参考訳(メタデータ) (2026-09-09T15:16:52Z) - Paritok-4B: Intent-Conditioned Context Compression for Coding Agents [0.9689471757238836]
Paritok-4Bは、4BのLoRA圧縮機で、2つのコミットメントに基づいて構築されたコーディング・エージェント・トラジェクトリを駆動する。
書き直しではなくスパンを選択し、96.4%の識別子、パス、および出力した番号が入力にすでに表示されている。
エージェントの現在のタスクでは、主に保持されたセグメント内で動作し、どのラインが生き残るかを選択する。
論文 参考訳(メタデータ) (2026-08-25T07:53:30Z) - Large Models for Small Devices: Recent Advances and Empirical Analysis of Edge AI Deployment [4.582004238093247]
リソース制約のあるエッジデバイス上で大規模なAIモデルを実行するには、モデルサイズと計算量を削減するためにモデル圧縮が必要である。
質問応答とイメージセグメンテーションにまたがって、GPU、CPU、Raspberry Piプラットフォームにコンパクトな言語とイメージモデルをデプロイします。
ニューラルネットワークグラフ解析とプリフィル・デコードレベルの遅延分解により,これらの効果を説明する。
論文 参考訳(メタデータ) (2026-08-16T11:52:13Z) - Patch Policy: Efficient Embodied Control via Dense Visual Representations [52.199962246592285]
我々は,フルVLMの計算オーバーヘッドを伴わずに,事前訓練済みの高密度パッチトークンを直接消費するパッチポリシーを開発した。
提案手法は,最先端のグローバルプール表現を用いた政策よりも40%の相対的な改善を実現している。
微調整されたOpenVLA-OFTを18%上回り、パラメータの約0.7%を使用する。
論文 参考訳(メタデータ) (2026-07-20T17:59:41Z) - More Structure, Not More Capacity: Object-Centric Representations for Visuomotor Imitation Learning [54.65906330923846]
対象中心のスロット表現は、事前学習された視覚モデルに代わる構造化された代替物であることを示す。
トークンの16倍の高密度なパッチグリッドは、グローバル機能に匹敵するパフォーマンスはない。
明示的な2D空間目標とネイティブ解像度レンダリングにより、全システムは68.7$pm$4.2%まで上昇し、特権付き3Dオーラクルの上界の直ぐ下にある。
論文 参考訳(メタデータ) (2026-07-10T10:35:24Z) - See Less, Drive Better: Generalizable End-to-End Autonomous Driving via Foundation Models Stochastic Patch Selection [51.59559387222532]
エンドツーエンド自動運転の最近の進歩は、パッチアライメント機能で訓練されたポリシーが、アウト・オブ・ディストリビューション(OOD)よりも一般化していることを示している。
我々は、より堅牢で、一般化可能で、効率的な学習ポリシーのためのシンプルで効果的なアプローチである2.4-Patch-Selection(SPS)を提案する。
論文 参考訳(メタデータ) (2026-01-15T18:58:33Z) - Prune Spatio-temporal Tokens by Semantic-aware Temporal Accumulation [89.88214896713846]
STAスコアは、時間的冗長性と意味的重要性の2つの重要な要因を考慮に入れている。
市販のビデオトランスフォーマーとビデオウィンにSTAモジュールを適用する。
結果: Kinetics-400 と something-Something V2 は 30% のオーバーシェルフ削減を実現し,0.2% の精度低下を実現した。
論文 参考訳(メタデータ) (2023-08-08T19:38:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。