論文の概要: PredVLA: A Sub-Million-Parameter Predictive-Coding Policy for Robot Manipulation
- arxiv url: http://arxiv.org/abs/2608.26673v1
- Date: Thu, 27 Aug 2026 06:27:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 16:30:58.258785
- Title: PredVLA: A Sub-Million-Parameter Predictive-Coding Policy for Robot Manipulation
- Title(参考訳): PredVLA:ロボットマニピュレーションのためのサブミリパラメータ予測符号化ポリシー
- Authors: Hiroki Sawada, Shunichi Kasahara,
- Abstract要約: トレーニング可能なネットワークパラメータがわずか0.68万である言語条件付き予測符号化ポリシであるPredVLAを提案する。
以上の結果から,PredVLAは現代の言語条件のベンチマークで高い性能を達成できることが示唆された。
- 参考スコア(独自算出の注目度): 4.55011976634859
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large pretrained vision-language-action models dominate modern robot-manipulation benchmarks, but it remains unclear how much model scale is necessary for strong language-conditioned control, or whether fundamentally different control architectures can remain competitive at much smaller parameter budgets. We present PredVLA, a language-conditioned predictive-coding policy with only 0.68 million trainable network parameters and no robot-data pretraining, whose hierarchical generative recurrent dynamics predict visual features and proprioception while observations influence latent state only through online inference from the resulting sensory prediction errors. On LIBERO, PredVLA achieves an 86.9% mean success rate across the three short-horizon suites and 75.4% when the long-horizon suite is included. Under a controlled comparison using the same frozen front end, demonstrations, action decoder, and evaluation protocol, PredVLA achieves 3.7x and 7.4x mean success rates of parameter-matched Transformer and LSTM policies, respectively. The predictive-coding formulation also makes the contribution of observation-driven correction directly measurable: because observations influence the recurrent state only through prediction-error-based latent inference, disabling this inference yields an exact open-loop control condition. Together, these results show that a sub-million-parameter recurrent generative policy can achieve strong performance on modern language-conditioned manipulation benchmarks while providing an explicit mechanism for prediction-error-driven online state correction.
- Abstract(参考訳): 大規模な事前学習型視覚言語アクションモデルが現代のロボットマニピュレーションベンチマークを支配しているが、言語条件の強い制御にどの程度のモデルスケールが必要か、あるいは、より小さなパラメータ予算で根本的に異なる制御アーキテクチャが競争力を維持するかは、まだ不明である。
PredVLAは、トレーニング可能なネットワークパラメータがわずか0.68万で、ロボットデータの事前学習がない言語条件の予測符号で、階層的な生成的リカレントダイナミクスによって視覚的特徴やプロピオセプションが予測され、観察は知覚予測エラーからのオンライン推論によってのみ潜在状態に影響を及ぼす。
LIBEROでは、PredVLAは3つの短軸スイートで86.9%、長軸スイートで75.4%を達成している。
PredVLAは、同じ凍結したフロントエンド、デモ、アクションデコーダ、評価プロトコルを使用して、それぞれパラメータマッチングされたトランスフォーマーとLSTMポリシーの3.7xと7.4xの平均成功率を達成する。
予測符号の定式化はまた、観測駆動補正の寄与を直接測定する: 観測は予測エラーに基づく潜時推論によってのみ、再帰状態に影響を与えるので、この推論を無効にすると、正確な開ループ制御条件が得られる。
これらの結果から,予測エラーによるオンライン状態修正のメカニズムを明確化しつつ,現代的な言語条件の操作ベンチマークにおいて,サブパラメータの繰り返し生成ポリシが強い性能を達成できることが示唆された。
関連論文リスト
- Prediction of Prediction (PoP): Inter-Layer Activation Fusion for Single-Pass Hallucination Detection in Large Language Models [0.0]
この研究は、生成中の内部の隠れ状態遷移ダイナミクスが、補助的な復号呼び出しを伴わずに事実エラーを信号化できるかどうかを評価する。
本稿では,層間遷移の不確実性を捉えるメカニズムである予測予測(PoP)を導入する。
PoPは受信機動作特性曲線(AUROC)の領域を75.5%の精度で達成している。
論文 参考訳(メタデータ) (2026-08-27T14:17:14Z) - FutureRTC: Real-Time Robot Execution with Anticipatory-Conditioned Action Chunking [51.97839311685636]
FutureRTCは、実行時の観察と非同期VLA制御の状態を予測するためのプラグイン・アンド・プレイ適応フレームワークである。
FutureRTCは推論遅延に対する堅牢性を実現し,よりスムーズな軌道,高速な実行,一貫したタスク成功率を実現している。
論文 参考訳(メタデータ) (2026-07-27T05:10:16Z) - Conformal Reliability: A New Evaluation Metric for Conditional Generation [62.761166941396844]
条件付き生成モデルは、近年、様々な応用において顕著な成功を収めている。
本稿では,信頼度を事前に設定した予測値に基づいて,信頼度という新たな評価指標を提案する。
本稿では, 予測セットの構築と, (ii) 構築した予測セット内の信頼性スコアを正確に最適化するフレームワークであるConformal Reliability(CReL)を紹介する。
論文 参考訳(メタデータ) (2026-05-29T03:52:44Z) - Feedback World Model Enables Precise Guidance of Diffusion Policy [36.965417653906535]
本稿では,推定時刻における予測と観測のループを閉じる新たなパラダイムであるフィードバック・ワールド・モデルを提案する。
本手法は,分布シフト時の予測精度とポリシー性能を大幅に向上することを示す。
特に、世界モデルの予測誤差を最大76.4%削減し、アウト・オブ・ディストリビューション(OOD)の成功率を30%改善する。
論文 参考訳(メタデータ) (2026-05-15T07:52:13Z) - ReconVLA: An Uncertainty-Guided and Failure-Aware Vision-Language-Action Framework for Robotic Control [7.018221049093963]
視覚-言語-アクション(VLA)モデルは、視覚観察と自然言語命令を連続的なアクションシーケンスにマッピングできる汎用ロボットコントローラとして登場した。
ReconVLAは、不確実性誘導および故障認識制御信号を生成する信頼性の高いコンフォメーションモデルである。
以上の結果から, 共形行動予測は失敗予測を継続的に改善し, 破滅的エラーを低減し, 基礎となるVLAを調整・修正することなく信頼度を調整できることが示唆された。
論文 参考訳(メタデータ) (2026-04-17T20:20:43Z) - See, Plan, Rewind: Progress-Aware Vision-Language-Action Models for Robust Robotic Manipulation [59.07792608884117]
本稿では,See, Plan, Rewind (SPR)について紹介する。
SPRは、現在の状態と今後のマイルストーンを見て、次の2Dウェイポイントに向けて軌道を計画し、障害時に回復可能な状態に戻すという、継続的なコアサイクルを通じて運用される。
SPRは、OpenVLA-OFTとUniVLAを上回る最小のパフォーマンス低下で最先端のロバスト性を達成する。
論文 参考訳(メタデータ) (2026-03-10T07:22:51Z) - Can We Predict Before Executing Machine Learning Agents? [74.39460101251792]
データ中心のソリューション優先のタスクを形式化し、18,438対比較の包括的コーパスを構築する。
検証データ解析レポートを作成した場合, LLM は重要な予測能力を示すことを示す。
このフレームワークをForEAGENT(Predict-then-Verifyループを利用するエージェント)でインスタンス化し、実行ベースラインを+6%超えながらコンバージェンスを6倍高速化する。
論文 参考訳(メタデータ) (2026-01-09T16:44:17Z) - Agentic World Modeling for 6G: Near-Real-Time Generative State-Space Reasoning [70.56067503630486]
第6世代(6G)インテリジェンスは、流動的なトークン予測ではなく、想像と選択の能力を校正している、と我々は主張する。
We showed that WM-MS3M cuts mean absolute error (MAE) by 1.69% vs MS3M with 32% less parameters and similar latency, and achieve a 35-80% lower root mean squared error (RMSE) than attention/hybrid baselines with 2.3-4.1x faster inference。
論文 参考訳(メタデータ) (2025-11-04T17:22:22Z) - Loss-Controlling Calibration for Predictive Models [5.51361762392299]
交換可能なデータに対する損失制御予測を行うための予測モデルの校正のための学習フレームワークを提案する。
対照的に、損失制御手法によって構築された予測器は、設定された予測器に限らない。
提案手法は,選択的回帰および高影響気象予報問題に適用する。
論文 参考訳(メタデータ) (2023-01-11T09:44:55Z) - AutoCP: Automated Pipelines for Accurate Prediction Intervals [84.16181066107984]
本稿では、自動予測のための自動機械学習(Automatic Machine Learning for Conformal Prediction, AutoCP)というAutoMLフレームワークを提案する。
最高の予測モデルを選択しようとする慣れ親しんだAutoMLフレームワークとは異なり、AutoCPは、ユーザが指定したターゲットカバレッジ率を達成する予測間隔を構築する。
さまざまなデータセットでAutoCPをテストしたところ、ベンチマークアルゴリズムを著しく上回っていることがわかった。
論文 参考訳(メタデータ) (2020-06-24T23:13:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。