論文の概要: PredVLA: Predictive Sensorimotor Modeling for Sub-Million-Parameter Robot Manipulation
- arxiv url: http://arxiv.org/abs/2608.26673v2
- Date: Sun, 30 Aug 2026 04:56:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 13:34:07.735569
- Title: PredVLA: Predictive Sensorimotor Modeling for Sub-Million-Parameter Robot Manipulation
- Title(参考訳): PredVLA:サブミリパラメータロボットマニピュレーションのための予測型センサモレータモデリング
- Abstract要約: PredVLAは、トレーニング可能なネットワークパラメータがわずか0.68万で、ロボットデータの事前学習がない言語条件の予測符号化ポリシーである。
階層的なリカレントダイナミクスは視覚的特徴と固有受容を予測し、観察は予測エラー駆動オンライン推論によってのみ潜在状態に影響を与える。
- 参考スコア(独自算出の注目度): 4.55011976634859
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large pretrained vision-language-action models achieve strong robot-manipulation performance, while compact alternatives have largely pursued efficiency by compressing the prevailing observation-to-action paradigm. We investigate whether predictive sensorimotor modeling can make more effective use of a limited parameter budget than direct observation-to-action mapping. We present PredVLA, a language-conditioned predictive-coding policy with only 0.68 million trainable network parameters and no robot-data pretraining. Its hierarchical recurrent dynamics predict visual features and proprioception, while observations influence latent state only through prediction-error-driven online inference. On LIBERO, PredVLA achieves an 86.9% mean success rate across the three short-horizon suites and 75.4% across all four suites. Under a controlled comparison using the same frozen front end, demonstrations, action decoder, and evaluation protocol, PredVLA achieves 3.7x and 7.4x the three-suite mean success rates of parameter-matched Transformer and LSTM behavior-cloning policies, respectively. A mechanism-by-mechanism transition to the recurrent behavior-cloning baseline shows that replacing the predictive pathway with direct observation input produces the largest single performance drop, accounting for approximately $70\%$ of the endpoint gap. Further ablations identify distinct contributions from training-time latent inference, test-time error regression, hierarchical timescales, and sensory prediction-error channels. Together, these results support predictive sensorimotor modeling as a strong inductive bias for compact language-conditioned robot control.
- Abstract(参考訳): 大きな事前学習された視覚-言語-アクションモデルは強力なロボット-操作性能を達成する一方、コンパクトな代替手段は一般的な観察-行動パラダイムを圧縮することで効率を追求している。
本研究では,予測感作モデルが直接観察・行動マッピングよりも限られたパラメータ予算を効果的に活用できるかどうかを考察する。
トレーニング可能なネットワークパラメータはわずか0.68万で,ロボットデータの事前学習は行わない,言語条件の予測符号化ポリシであるPredVLAを提案する。
階層的なリカレントダイナミクスは視覚的特徴と固有受容を予測し、観察は予測エラー駆動オンライン推論によってのみ潜在状態に影響を与える。
LIBEROでは、PredVLAは3つの短水平スイートで86.9%、全4スイートで75.4%という平均的な成功率を達成した。
PredVLAは、同じ凍結したフロントエンド、デモ、アクションデコーダ、評価プロトコルを用いて、パラメータマッチングされたトランスフォーマーとLSTMの行動閉鎖ポリシーの3.7xと7.4xの平均成功率をそれぞれ達成している。
機構バイメカニズムが繰り返し発生する動作閉包ベースラインへの遷移は、予測経路を直接観察入力に置き換えると、エンドポイントギャップの約70 % を考慮し、最大の単一性能低下が発生することを示している。
さらに、トレーニング時潜時推論、テスト時エラー回帰、階層的時間スケール、知覚予測エラーチャネルから、異なるコントリビューションを識別する。
これらの結果は,コンパクトな言語条件ロボット制御のための強力な誘導バイアスとして,予測センタモレータモデリングを支援する。
関連論文リスト
- Prediction of Prediction (PoP): Inter-Layer Activation Fusion for Single-Pass Hallucination Detection in Large Language Models [0.0]
この研究は、生成中の内部の隠れ状態遷移ダイナミクスが、補助的な復号呼び出しを伴わずに事実エラーを信号化できるかどうかを評価する。
本稿では,層間遷移の不確実性を捉えるメカニズムである予測予測(PoP)を導入する。
PoPは受信機動作特性曲線(AUROC)の領域を75.5%の精度で達成している。
論文 参考訳(メタデータ) (2026-08-27T14:17:14Z) - FutureRTC: Real-Time Robot Execution with Anticipatory-Conditioned Action Chunking [51.97839311685636]
FutureRTCは、実行時の観察と非同期VLA制御の状態を予測するためのプラグイン・アンド・プレイ適応フレームワークである。
FutureRTCは推論遅延に対する堅牢性を実現し,よりスムーズな軌道,高速な実行,一貫したタスク成功率を実現している。
論文 参考訳(メタデータ) (2026-07-27T05:10:16Z) - Conformal Reliability: A New Evaluation Metric for Conditional Generation [62.761166941396844]
条件付き生成モデルは、近年、様々な応用において顕著な成功を収めている。
本稿では,信頼度を事前に設定した予測値に基づいて,信頼度という新たな評価指標を提案する。
本稿では, 予測セットの構築と, (ii) 構築した予測セット内の信頼性スコアを正確に最適化するフレームワークであるConformal Reliability(CReL)を紹介する。
論文 参考訳(メタデータ) (2026-05-29T03:52:44Z) - Feedback World Model Enables Precise Guidance of Diffusion Policy [36.965417653906535]
本稿では,推定時刻における予測と観測のループを閉じる新たなパラダイムであるフィードバック・ワールド・モデルを提案する。
本手法は,分布シフト時の予測精度とポリシー性能を大幅に向上することを示す。
特に、世界モデルの予測誤差を最大76.4%削減し、アウト・オブ・ディストリビューション(OOD)の成功率を30%改善する。
論文 参考訳(メタデータ) (2026-05-15T07:52:13Z) - ReconVLA: An Uncertainty-Guided and Failure-Aware Vision-Language-Action Framework for Robotic Control [7.018221049093963]
視覚-言語-アクション(VLA)モデルは、視覚観察と自然言語命令を連続的なアクションシーケンスにマッピングできる汎用ロボットコントローラとして登場した。
ReconVLAは、不確実性誘導および故障認識制御信号を生成する信頼性の高いコンフォメーションモデルである。
以上の結果から, 共形行動予測は失敗予測を継続的に改善し, 破滅的エラーを低減し, 基礎となるVLAを調整・修正することなく信頼度を調整できることが示唆された。
論文 参考訳(メタデータ) (2026-04-17T20:20:43Z) - See, Plan, Rewind: Progress-Aware Vision-Language-Action Models for Robust Robotic Manipulation [59.07792608884117]
本稿では,See, Plan, Rewind (SPR)について紹介する。
SPRは、現在の状態と今後のマイルストーンを見て、次の2Dウェイポイントに向けて軌道を計画し、障害時に回復可能な状態に戻すという、継続的なコアサイクルを通じて運用される。
SPRは、OpenVLA-OFTとUniVLAを上回る最小のパフォーマンス低下で最先端のロバスト性を達成する。
論文 参考訳(メタデータ) (2026-03-10T07:22:51Z) - Can We Predict Before Executing Machine Learning Agents? [74.39460101251792]
データ中心のソリューション優先のタスクを形式化し、18,438対比較の包括的コーパスを構築する。
検証データ解析レポートを作成した場合, LLM は重要な予測能力を示すことを示す。
このフレームワークをForEAGENT(Predict-then-Verifyループを利用するエージェント)でインスタンス化し、実行ベースラインを+6%超えながらコンバージェンスを6倍高速化する。
論文 参考訳(メタデータ) (2026-01-09T16:44:17Z) - Agentic World Modeling for 6G: Near-Real-Time Generative State-Space Reasoning [70.56067503630486]
第6世代(6G)インテリジェンスは、流動的なトークン予測ではなく、想像と選択の能力を校正している、と我々は主張する。
We showed that WM-MS3M cuts mean absolute error (MAE) by 1.69% vs MS3M with 32% less parameters and similar latency, and achieve a 35-80% lower root mean squared error (RMSE) than attention/hybrid baselines with 2.3-4.1x faster inference。
論文 参考訳(メタデータ) (2025-11-04T17:22:22Z) - Loss-Controlling Calibration for Predictive Models [5.51361762392299]
交換可能なデータに対する損失制御予測を行うための予測モデルの校正のための学習フレームワークを提案する。
対照的に、損失制御手法によって構築された予測器は、設定された予測器に限らない。
提案手法は,選択的回帰および高影響気象予報問題に適用する。
論文 参考訳(メタデータ) (2023-01-11T09:44:55Z) - AutoCP: Automated Pipelines for Accurate Prediction Intervals [84.16181066107984]
本稿では、自動予測のための自動機械学習(Automatic Machine Learning for Conformal Prediction, AutoCP)というAutoMLフレームワークを提案する。
最高の予測モデルを選択しようとする慣れ親しんだAutoMLフレームワークとは異なり、AutoCPは、ユーザが指定したターゲットカバレッジ率を達成する予測間隔を構築する。
さまざまなデータセットでAutoCPをテストしたところ、ベンチマークアルゴリズムを著しく上回っていることがわかった。
論文 参考訳(メタデータ) (2020-06-24T23:13:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。