論文の概要: ForeTime-VLA: Causal Future-Token Distillation from a World Action Model for Conveyor-Belt Manipulation
- arxiv url: http://arxiv.org/abs/2608.20735v2
- Date: Mon, 24 Aug 2026 03:31:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 13:29:43.01192
- Title: ForeTime-VLA: Causal Future-Token Distillation from a World Action Model for Conveyor-Belt Manipulation
- Title(参考訳): ForeTime-VLA:Conveyor-Belt マニピュレーションのための世界行動モデルからの因果的未来型蒸留
- Authors: Siyuan Ma, Yutian Zhang, Boshi Zhang, Qinglian Wu, Jiaqi Zhai, Dong Wei, Xiaojin Huang,
- Abstract要約: 本稿では,凍ったFast-WAMをベースとした教師から,未来を意識した行動等価表現を蒸留する高密度pi0.5ポリシーであるForeTime-VLAを紹介する。
オンラインでは、8フレームの履歴エンコーダが操作フェーズと正規化された時間-遷移とともにこのターゲットを予測する。
テストMAEは0.134119から0.130593 (2.63%)に減少し、ペアリングブートストラップ95%CI:0.82-4.48%の改善、テストL2は2.46-2.93%の遅延コストで3.02%減少する。
- 参考スコア(独自算出の注目度): 6.874305530359895
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Manipulating moving objects requires a policy to anticipate contact events, yet vision-language-action (VLA) policies are commonly fine-tuned from the current observation alone. World action models (WAMs) learn predictive dynamics, but running a video-scale teacher or explicitly imagining future frames at deployment is costly. We introduce ForeTime-VLA, a dense pi0.5 policy that distills a future-aware, action-equivalent representation from a frozen Fast-WAM-derived teacher while remaining causal at inference. Offline, current and future video latents are compressed into a whitened 64-D target. Online, an eight-frame history encoder predicts this target together with manipulation phase and normalized time-to-transition. Four future tokens and one phase token condition the VLM prefix, while the predicted future and transition horizon condition the action expert. Training retains the original flow-matching action target and adds cosine, relational geometry, phase, time-to-transition, and action-equivalence objectives. On a deduplicated conveyor-belt dataset, we compare 40k-step checkpoints on 768 matched windows per split. Test MAE decreases from 0.134119 to 0.130593 (2.63%; paired-bootstrap 95% CI: 0.82-4.48% improvement), and test L2 decreases by 3.02%, at a 2.46-2.93% latency cost. In quantitative real-robot evaluation, ForeTime-VLA achieves 81.1% stationary and 58.9% slow-moving grasp success, exceeding the next-best reference by 12.2 and 22.2 percentage points, respectively. Across three belt speeds, it completes 44/90 grasps versus 23/90 for pi0.5, including 11/30 versus 2/30 at fast speed. The agreement between offline orientation gains and reduced real-robot contact-pose failures supports causal future-token distillation as an effective way to improve dynamic manipulation without deploying the world-model teacher.
- Abstract(参考訳): 移動物体を操作するには、接触イベントを予測するためのポリシーが必要であるが、視覚言語アクション(VLA)ポリシーは、現在の観測のみから一般的に微調整される。
ワールドアクションモデル(WAM)は予測力学を学習するが、ビデオスケールの教師を実行するか、デプロイ時に将来のフレームを明示的に想像することはコストがかかる。
本稿では,Fast-WAM 由来の教師が推論時に因果関係を保ちながら,未来を意識した行動等価表現を蒸留する高密度 pi0.5 ポリシーである ForeTime-VLA を紹介する。
オフライン、現在および将来のビデオラテントは、白色の64-Dターゲットに圧縮される。
オンラインでは、8フレームの履歴エンコーダが操作フェーズと正規化された時間-遷移とともにこのターゲットを予測する。
4つの将来トークンと1つのフェーズトークン条件はVLMプレフィックスであり、予測される未来と遷移水平条件はアクションエキスパートである。
トレーニングは、元のフローマッチングアクションターゲットを保持し、コサイン、リレーショナルジオメトリ、フェーズ、タイム・トゥ・トランジション、アクション・等価な目的を追加します。
重複したコンベヤベルトデータセットでは、768個のマッチングウィンドウ上の40kステップのチェックポイントを分割毎に比較する。
テストMAEは0.134119から0.130593(2.63%、ペアリングブートストラップ95%CI:0.82-4.48%の改善)に減少し、テストL2は2.46-2.93%の遅延コストで3.02%減少する。
定量実ロボット評価では、ForeTime-VLAは81.1%の静止状態と58.9%のスローモーションの把握成功を達成し、それぞれ12.2ポイント、22.2ポイントの次の基準を上回っている。
3つのベルト速度で44/90のグリップを、pi0.5では23/90のグリップを、高速では11/30のグリップを、高速では2/30のグリップを完了させる。
オフライン配向利得と実ロボット接触場所故障の低減との合意は、世界モデル教師を配置することなく動的操作を改善する効果的な方法として、因果的未来トーケン蒸留を支持している。
関連論文リスト
- RynnValue: Scaling Robotic Value Foundation Models with Temporal Distance [84.26294415726723]
汎用報酬モデルが、ロボット学習のスケーリングのボトルネックになりつつある。
ロボット操作のためのオープンソースのバリューファンデーションモデルであるRynnValueを紹介した。
RynnValueは7000時間以上、好みやプログレッシブアノテーションなしで約3Mの命令条件付きクリップにスケールする。
論文 参考訳(メタデータ) (2026-08-10T17:09:37Z) - Discrete Action Space as a Prerequisite for GRPO Convergence in Small-Model Continuous Control [0.0]
グループ相対ポリシー最適化は、シミュレートされた四重項連続制御タスクのための小さな言語モデルを微調整することができる。
このベンチマークでは、25Hzの4乗子速度制御のためのQwen-0.5BのバニラGRPO微調整が、自明なゼロ作用に崩壊する。
Crazyflie 2.1 ダイナミックスを用いた高忠実度シミュレーションは、ホバー領域のトレーニングと分配のギャップを表面化する。
論文 参考訳(メタデータ) (2026-07-07T17:14:19Z) - Latent Clarity: Bridging World-Model Kinematics to Semantic Manifolds for Video Anomaly Anticipation [0.0]
継続的ビデオ検出は、リアクティブなMIL(Multiple Instance Learning)によって支配され、機能がスコアに分解される。
本稿では,連続的な意味的世界モデルパイプラインであるPULS(Predictive Unified Latent Space)を紹介する。
この翻訳だけで、UCF-Crime のチャンクレベル AUROC は 0.8994 であり、MIL や階層融合のない分布外異常は 0.8162 である。
論文 参考訳(メタデータ) (2026-07-03T18:47:54Z) - Intercepting the Future: Latent-Space Predictive World Model for Dynamic VLA Manipulation [6.790887409995267]
AHEAD (Anticipatory Horizon Extrapolation with Adaptive Dynamics) は、動きを意識した潜在世界モデルで凍結したVLAを増強する予測効果のあるラッパーである。
AHEADは凍結した7B OpenVLAに4.9Mパラメータを追加し、20の動的シミュレーションシナリオで79から97%の成功を達成した。
論文 参考訳(メタデータ) (2026-06-01T16:55:38Z) - CrossVLA: Cross-Paradigm Post-Training and Inference Optimization for Vision-Language-Action Models [7.489020109808801]
われわれは,クロスパラダイム・ビジョン・ランゲージ・アクション(VLA)のポストトレーニングに関する実証的研究であるCrossVLAを報告する。
i) 確率フローODE統合なしでDPOを連続動作バックボーンで操作できる代理フローマッチングログ確率推定器、(ii) VLA DPOのパラメータ係数層としてのLoRAとDoRAの頭と頭の比較、(iii) ノイズループを示す推論時間解剖学は、サンプル_actions遅延の78.6%、プレフィックス-K/Vキャッシングのラを支配している。
論文 参考訳(メタデータ) (2026-05-21T01:02:41Z) - Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation [95.89924101984566]
GPM(Global Prior Memory)とLCM(Local Consistency Memory)を備えたデュアルメモリVLAフレームワークOptimusVLAを紹介する。
GPMはガウスノイズを意味論的に類似した軌道から取得したタスクレベルの先行値に置き換える。
LCMは、時間的コヒーレンスと軌道の滑らかさを強制する学習された一貫性制約を注入する。
論文 参考訳(メタデータ) (2026-02-22T15:39:34Z) - Time Is a Feature: Exploiting Temporal Dynamics in Diffusion Language Models [57.474294329887236]
拡散大言語モデル (dLLMs) は反復的 denoising を通じてテキストを生成する。
現在のデコード戦略は、最終的な出力に有利なリッチな中間予測を捨てている。
時間的整合性を利用する2つの相補的手法を導入する。
論文 参考訳(メタデータ) (2025-08-12T17:59:57Z) - Spatiotemporal Contrastive Video Representation Learning [87.56145031149869]
ラベルのないビデオから視覚的表現を学習するための,自己指導型コントラスト映像表現学習(CVRL)法を提案する。
我々の表現は、コントラスト時間的損失を用いて学習され、同じ短いビデオから2つの強化されたクリップが埋め込み空間にまとめられる。
本研究では,ビデオ自己教師型学習におけるデータ向上の要因について検討し,空間的情報と時間的情報の両方が重要であることを明らかにする。
論文 参考訳(メタデータ) (2020-08-09T19:58:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。