論文の概要: PredVLA: A Sub-Million-Parameter Predictive-Coding Policy for Robot Manipulation
- arxiv url: http://arxiv.org/abs/2608.26673v1
- Date: Thu, 27 Aug 2026 06:27:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 16:30:58.258785
- Title: PredVLA: A Sub-Million-Parameter Predictive-Coding Policy for Robot Manipulation
- Title(参考訳): PredVLA:ロボットマニピュレーションのためのサブミリパラメータ予測符号化ポリシー
- Abstract要約: トレーニング可能なネットワークパラメータがわずか0.68万である言語条件付き予測符号化ポリシであるPredVLAを提案する。
以上の結果から,PredVLAは現代の言語条件のベンチマークで高い性能を達成できることが示唆された。
- 参考スコア(独自算出の注目度): 4.55011976634859
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large pretrained vision-language-action models dominate modern robot-manipulation benchmarks, but it remains unclear how much model scale is necessary for strong language-conditioned control, or whether fundamentally different control architectures can remain competitive at much smaller parameter budgets. We present PredVLA, a language-conditioned predictive-coding policy with only 0.68 million trainable network parameters and no robot-data pretraining, whose hierarchical generative recurrent dynamics predict visual features and proprioception while observations influence latent state only through online inference from the resulting sensory prediction errors. On LIBERO, PredVLA achieves an 86.9% mean success rate across the three short-horizon suites and 75.4% when the long-horizon suite is included. Under a controlled comparison using the same frozen front end, demonstrations, action decoder, and evaluation protocol, PredVLA achieves 3.7x and 7.4x mean success rates of parameter-matched Transformer and LSTM policies, respectively. The predictive-coding formulation also makes the contribution of observation-driven correction directly measurable: because observations influence the recurrent state only through prediction-error-based latent inference, disabling this inference yields an exact open-loop control condition. Together, these results show that a sub-million-parameter recurrent generative policy can achieve strong performance on modern language-conditioned manipulation benchmarks while providing an explicit mechanism for prediction-error-driven online state correction.
- Abstract(参考訳): 大規模な事前学習型視覚言語アクションモデルが現代のロボットマニピュレーションベンチマークを支配しているが、言語条件の強い制御にどの程度のモデルスケールが必要か、あるいは、より小さなパラメータ予算で根本的に異なる制御アーキテクチャが競争力を維持するかは、まだ不明である。
PredVLAは、トレーニング可能なネットワークパラメータがわずか0.68万で、ロボットデータの事前学習がない言語条件の予測符号で、階層的な生成的リカレントダイナミクスによって視覚的特徴やプロピオセプションが予測され、観察は知覚予測エラーからのオンライン推論によってのみ潜在状態に影響を及ぼす。
LIBEROでは、PredVLAは3つの短軸スイートで86.9%、長軸スイートで75.4%を達成している。
PredVLAは、同じ凍結したフロントエンド、デモ、アクションデコーダ、評価プロトコルを使用して、それぞれパラメータマッチングされたトランスフォーマーとLSTMポリシーの3.7xと7.4xの平均成功率を達成する。
予測符号の定式化はまた、観測駆動補正の寄与を直接測定する: 観測は予測エラーに基づく潜時推論によってのみ、再帰状態に影響を与えるので、この推論を無効にすると、正確な開ループ制御条件が得られる。
これらの結果から,予測エラーによるオンライン状態修正のメカニズムを明確化しつつ,現代的な言語条件の操作ベンチマークにおいて,サブパラメータの繰り返し生成ポリシが強い性能を達成できることが示唆された。
関連論文リスト
- Dynin-Robotics: Omnimodal Unified Diffusion Vision-Language-Action Model [7.384043308834925]
視覚目標とダイナミックス予測は、目標とする結果とアクションに依存したシーン変化の表現の両方で言語条件のロボットポリシーを提供することができる。
ダイニン・ロボティクスはこの定式化をダイニン・オムニに実装し、言語、視覚的観察、ゴール、アクションを離散トークンとして表現している。
我々は、48のOpen X-Embodimentデータセットから約133万の軌道上でモデルを継続的に事前訓練し、下流ドメインに個別に適応する。
論文 参考訳(メタデータ) (2026-09-11T16:49:26Z) - Prediction of Prediction (PoP): Inter-Layer Activation Fusion for Single-Pass Hallucination Detection in Large Language Models [0.0]
この研究は、生成中の内部の隠れ状態遷移ダイナミクスが、補助的な復号呼び出しを伴わずに事実エラーを信号化できるかどうかを評価する。
本稿では,層間遷移の不確実性を捉えるメカニズムである予測予測(PoP)を導入する。
PoPは受信機動作特性曲線(AUROC)の領域を75.5%の精度で達成している。
論文 参考訳(メタデータ) (2026-08-27T14:17:14Z) - FutureRTC: Real-Time Robot Execution with Anticipatory-Conditioned Action Chunking [51.97839311685636]
FutureRTCは、実行時の観察と非同期VLA制御の状態を予測するためのプラグイン・アンド・プレイ適応フレームワークである。
FutureRTCは推論遅延に対する堅牢性を実現し,よりスムーズな軌道,高速な実行,一貫したタスク成功率を実現している。
論文 参考訳(メタデータ) (2026-07-27T05:10:16Z) - Predicting Future Behaviors in Reasoning Models Enables Better Steering [35.89008737242842]
テストタイムステアリングは、隠れた表現を介入することで大きな推論モデル(LRM)を制御するが、出力品質を低下させることができる。
我々は、事前のステアリング作業は、すでに生成されたテキストの振る舞いを検出する内部機能に暗黙的に依存していると論じる。
我々は、中間推論ステップから将来の行動可能性を予測するために、アクティベーションプローブを訓練する。
これらのプローブは64%-91%の精度で最も起こりそうな振る舞いを予測し、内部予測の異なるタイプの特徴を明らかにした。
論文 参考訳(メタデータ) (2026-06-09T17:49:24Z) - Conformal Reliability: A New Evaluation Metric for Conditional Generation [62.761166941396844]
条件付き生成モデルは、近年、様々な応用において顕著な成功を収めている。
本稿では,信頼度を事前に設定した予測値に基づいて,信頼度という新たな評価指標を提案する。
本稿では, 予測セットの構築と, (ii) 構築した予測セット内の信頼性スコアを正確に最適化するフレームワークであるConformal Reliability(CReL)を紹介する。
論文 参考訳(メタデータ) (2026-05-29T03:52:44Z) - Feedback World Model Enables Precise Guidance of Diffusion Policy [36.965417653906535]
本稿では,推定時刻における予測と観測のループを閉じる新たなパラダイムであるフィードバック・ワールド・モデルを提案する。
本手法は,分布シフト時の予測精度とポリシー性能を大幅に向上することを示す。
特に、世界モデルの予測誤差を最大76.4%削減し、アウト・オブ・ディストリビューション(OOD)の成功率を30%改善する。
論文 参考訳(メタデータ) (2026-05-15T07:52:13Z) - ReconVLA: An Uncertainty-Guided and Failure-Aware Vision-Language-Action Framework for Robotic Control [7.018221049093963]
視覚-言語-アクション(VLA)モデルは、視覚観察と自然言語命令を連続的なアクションシーケンスにマッピングできる汎用ロボットコントローラとして登場した。
ReconVLAは、不確実性誘導および故障認識制御信号を生成する信頼性の高いコンフォメーションモデルである。
以上の結果から, 共形行動予測は失敗予測を継続的に改善し, 破滅的エラーを低減し, 基礎となるVLAを調整・修正することなく信頼度を調整できることが示唆された。
論文 参考訳(メタデータ) (2026-04-17T20:20:43Z) - See, Plan, Rewind: Progress-Aware Vision-Language-Action Models for Robust Robotic Manipulation [59.07792608884117]
本稿では,See, Plan, Rewind (SPR)について紹介する。
SPRは、現在の状態と今後のマイルストーンを見て、次の2Dウェイポイントに向けて軌道を計画し、障害時に回復可能な状態に戻すという、継続的なコアサイクルを通じて運用される。
SPRは、OpenVLA-OFTとUniVLAを上回る最小のパフォーマンス低下で最先端のロバスト性を達成する。
論文 参考訳(メタデータ) (2026-03-10T07:22:51Z) - Can We Predict Before Executing Machine Learning Agents? [74.39460101251792]
データ中心のソリューション優先のタスクを形式化し、18,438対比較の包括的コーパスを構築する。
検証データ解析レポートを作成した場合, LLM は重要な予測能力を示すことを示す。
このフレームワークをForEAGENT(Predict-then-Verifyループを利用するエージェント)でインスタンス化し、実行ベースラインを+6%超えながらコンバージェンスを6倍高速化する。
論文 参考訳(メタデータ) (2026-01-09T16:44:17Z) - InternVLA-A1: Unifying Understanding, Generation and Action for Robotic Manipulation [77.07565723756119]
InternVLA-A1は動的予測機能を備えた視覚言語モデルである。
我々は、実世界のロボットデータ、合成シミュレーションデータ、人間のビデオなどを用いて、これらのモデルを異種データソース上で事前訓練する。
InternVLA-A1を実世界の12のロボットタスクとシミュレーションベンチマークで評価した。
論文 参考訳(メタデータ) (2026-01-05T18:54:29Z) - Agentic World Modeling for 6G: Near-Real-Time Generative State-Space Reasoning [70.56067503630486]
第6世代(6G)インテリジェンスは、流動的なトークン予測ではなく、想像と選択の能力を校正している、と我々は主張する。
We showed that WM-MS3M cuts mean absolute error (MAE) by 1.69% vs MS3M with 32% less parameters and similar latency, and achieve a 35-80% lower root mean squared error (RMSE) than attention/hybrid baselines with 2.3-4.1x faster inference。
論文 参考訳(メタデータ) (2025-11-04T17:22:22Z) - Multi-Channel Swin Transformer Framework for Bearing Remaining Useful Life Prediction [2.600463444320238]
本稿では,ウェーブレットに基づくデノベーション手法であるウェーブレットパケット分解(WPD)と,これらの問題に対処するためにカスタマイズされたマルチチャネルスウィントランスモデル(MCSFormer)を組み合わせた新しいフレームワークを提案する。
特徴融合のための注意機構を組み込んだモデルでは、グローバルおよび局所的な劣化パターンを学習するように設計されている。
カスタマイズされた損失関数は、早期と後期の予測を区別するために、この作業の重要な区別として開発されている。
論文 参考訳(メタデータ) (2025-05-20T20:44:38Z) - Predictor-Corrector Enhanced Transformers with Exponential Moving Average Coefficient Learning [73.73967342609603]
トラクションエラーを最小限に抑えるための予測-相関学習フレームワークを提案する。
また、高次予測器を強化するために、指数関数的移動平均ベース係数学習法を提案する。
我々のモデルは3.8BのDeepNetを平均2.9のSacreBLEUで上回り、1/3のパラメータしか使用していない。
論文 参考訳(メタデータ) (2024-11-05T12:26:25Z) - Planning with Adaptive World Models for Autonomous Driving [50.4439896514353]
マルチエージェントインタラクションをキャプチャする実世界のモーションプランニングベンチマークであるnuPlanを提案する。
我々は、グラフ畳み込みニューラルネットワーク(GCNN)であるBehaviorNetを用いて、このようなユニークな振る舞いをモデル化することを学ぶ。
また、モデル予測制御(MPC)ベースのプランナであるAdaptiveDriverについても紹介する。
論文 参考訳(メタデータ) (2024-06-15T18:53:45Z) - Trajeglish: Traffic Modeling as Next-Token Prediction [67.28197954427638]
自動運転開発における長年の課題は、記録された運転ログからシードされた動的運転シナリオをシミュレートすることだ。
車両、歩行者、サイクリストが運転シナリオでどのように相互作用するかをモデル化するために、離散シーケンスモデリングのツールを適用します。
我々のモデルはSim Agents Benchmarkを上回り、リアリズムメタメトリックの先行作業の3.3%、インタラクションメトリックの9.9%を上回ります。
論文 参考訳(メタデータ) (2023-12-07T18:53:27Z) - Loss-Controlling Calibration for Predictive Models [5.51361762392299]
交換可能なデータに対する損失制御予測を行うための予測モデルの校正のための学習フレームワークを提案する。
対照的に、損失制御手法によって構築された予測器は、設定された予測器に限らない。
提案手法は,選択的回帰および高影響気象予報問題に適用する。
論文 参考訳(メタデータ) (2023-01-11T09:44:55Z) - Adversarial Refinement Network for Human Motion Prediction [61.50462663314644]
リカレントニューラルネットワークとフィードフォワードディープネットワークという2つの一般的な手法は、粗い動きの傾向を予測することができる。
本稿では,新たな逆誤差増大を伴う簡易かつ効果的な粗大きめ機構に従えば,ARNet(Adversarial Refinement Network)を提案する。
論文 参考訳(メタデータ) (2020-11-23T05:42:20Z) - AutoCP: Automated Pipelines for Accurate Prediction Intervals [84.16181066107984]
本稿では、自動予測のための自動機械学習(Automatic Machine Learning for Conformal Prediction, AutoCP)というAutoMLフレームワークを提案する。
最高の予測モデルを選択しようとする慣れ親しんだAutoMLフレームワークとは異なり、AutoCPは、ユーザが指定したターゲットカバレッジ率を達成する予測間隔を構築する。
さまざまなデータセットでAutoCPをテストしたところ、ベンチマークアルゴリズムを著しく上回っていることがわかった。
論文 参考訳(メタデータ) (2020-06-24T23:13:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。