論文の概要: FUTURE-VLA: Forecasting Unified Trajectories Under Real-time Execution
- arxiv url: http://arxiv.org/abs/2602.15882v1
- Date: Thu, 05 Feb 2026 14:27:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-02-23 12:01:13.688478
- Title: FUTURE-VLA: Forecasting Unified Trajectories Under Real-time Execution
- Title(参考訳): Future-VLA: リアルタイム実行下での統一軌道予測
- Abstract要約: FUTURE-VLAは、長期制御と将来の予測をモノリシックなシーケンス生成タスクとして再構成する統一アーキテクチャである。
FUTURE-VLAはLIBEROで99.2%、RoboTwinで75.4%、現実世界のPiperプラットフォームで78.0%の成功率を達成した。
- 参考スコア(独自算出の注目度): 27.399648455932397
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: General vision-language models increasingly support unified spatiotemporal reasoning over long video streams, yet deploying such capabilities on robots remains constrained by the prohibitive latency of processing long-horizon histories and generating high-dimensional future predictions. To bridge this gap, we present FUTURE-VLA, a unified architecture that reformulates long-horizon control and future forecasting as a monolithic sequence-generation task. Adopting a dual-sided efficiency paradigm, FUTURE-VLA leverages a temporally adaptive compression strategy to maximize spatiotemporal information density, enabling the ingestion of extensive multi-view histories while maintaining constant inference latency. Simultaneously, it performs latent-space autoregression to align actionable dynamics with reviewable visual look-aheads in a single forward pass. These real-time predictive capabilities further enable a prediction-guided Human-In-the-Loop mechanism via interactive execution gating, allowing operators to dynamically validate behaviors based on interpretable future previews. Extensive evaluations demonstrate that FUTURE-VLA establishes new state-of-the-art performance, attaining success rates of 99.2% on LIBERO, 75.4% on RoboTwin, and 78.0% on a real-world Piper platform, all with a $16\times$ extended spatiotemporal window while maintaining the inference latency of a single-frame baseline.
- Abstract(参考訳): 一般的な視覚言語モデルは、長いビデオストリームに対する一貫した時空間推論をますますサポートしているが、ロボットにそのような機能をデプロイすることは、長い水平履歴を処理し、高次元の将来の予測を生成することの禁止的な遅延によって制約されている。
このギャップを埋めるために,モノリシックなシーケンス生成タスクとして,長期制御と将来の予測を再構成する統一アーキテクチャFuture-VLAを提案する。
両面の効率パラダイムを採用することで、FUTURE-VLAは時間適応型圧縮戦略を利用して時空間情報密度を最大化し、一定の推論レイテンシを維持しながら、広範囲な多視点履歴の取り込みを可能にする。
同時に、動作可能なダイナミックスとレビュー可能な視覚的なルックアヘッドを1つのフォワードパスで整列するために、潜在空間の自動回帰を実行する。
これらのリアルタイム予測機能は、インタラクティブな実行ゲーティングを通じて予測誘導されたHuman-In-the-Loopメカニズムを可能にすることで、解釈可能な将来のプレビューに基づいて動作を動的に検証することが可能になる。
FUTURE-VLAが新しい最先端のパフォーマンスを確立し、LIBEROで99.2%、RoboTwinで75.4%、現実世界のPiperプラットフォームで78.0%を達成した。
関連論文リスト
- Learning to Use Imagination: Progress-Conditioned Future Utilization for World Action Models [72.02240114225107]
World Action Models (WAM) は、将来の視覚力学をアクション生成に組み込むことでビジョン・ランゲージ・アクション(VLA)モデルを拡張する。
既存のWAMは、実行の進行に限られた適応性を持つ想像上の未来をしばしば利用し、注意散らしや信頼性の低い予測方法を導入する可能性がある。
本稿では,プログレッシブ・コンディションド・ワールド・アクション・モデルであるProWAMを提案する。
論文 参考訳(メタデータ) (2026-09-06T12:46:20Z) - Drive-HWM: Hierarchical World Models for Dynamic-Latent Guided Autonomous Driving [78.83165764484562]
Drive-HWMは階層的なスローファーストな世界モデリングフレームワークで、将来の表現予測とアクション生成を補完的な時間スケールで構成する。
次のフレーム予測では、高速モデルが差し迫ったシーンの進化を捉え、一方1ステップのアクション生成は、新しい観察が到着すると、決定を継続的に更新することを可能にする。
論文 参考訳(メタデータ) (2026-09-03T09:21:19Z) - WALL-SS: Scaling Long-horizon World Models via Next-Scale Autoregression [24.010807495676605]
生成的世界モデルは、相互作用の下で世界がどのように進化するかの予測モデルを提供する。
WALL-SSは,スケールワイドの自己回帰スケーリングによって視覚的未来を生成する世界モデルである。
We show that WALL-SS improves action following and trajectory accuracy, support coherent minute-long streaming rollout under bounded memory, and consistent benefit of on-policy alignment。
論文 参考訳(メタデータ) (2026-08-26T17:57:12Z) - Latent Action as Intention Enables Efficient Future Imagination for World Action Models [20.031922437200524]
提案するアーキテクチャ**LAWA**は,コンパクトな潜伏動作を将来の意図の操作的表現として利用するWAMアーキテクチャである。
RoboCasaでは、LAWAは数ショットと全データ設定で65.6%と80.8%という最先端の平均的な成功率を達成した。
また、一致したJoint-WAMモデルの性能レベルも保持し、42.9%の遅延時間を必要とする。
論文 参考訳(メタデータ) (2026-08-25T17:59:03Z) - FibVLA: An Efficient Temporal Vision-Language-Action Model with Fibonacci Sampling [11.3018332690505]
視覚言語-アクションモデル(VLA)は、物理世界のアクションを推測するためにマルチモーダル情報の認識を利用する。
本稿では、長いコンテキスト履歴の時間的知覚を特徴とする効率的なフレームワークFibVLAを紹介する。
実験により、FibVLAは大規模な視覚エンコーダを再訓練することなく、動作のスムーズさと成功率を大幅に改善することが示された。
論文 参考訳(メタデータ) (2026-07-31T16:23:07Z) - ST-WAM: Semantic-Temporal World Action Model for Robust Manipulation under Visual Distribution Shifts [24.959404195743744]
トレーニング・ディストリビューション・ハロシン化(英語: Training-Distribution Hallucination)とは、現在のシーンに忠実に留まらず、視覚的に変化した観察で条件付けられた未来がトレーニング領域の内容に幻覚を与える現象である。
本稿では,DINOv3 を将来予測と履歴検索のための共有意味表現として用き,詳細なVAE のダイナミクスを維持しつつ,アクションロバスト性を向上させるセマンティック・テンポラル WAM (ST-WAM) を提案する。
論文 参考訳(メタデータ) (2026-07-31T03:44:56Z) - SegDiff: Segmented Trajectory Diffusion for Consistent and Adaptive Robot Manipulation [65.81476183180527]
両パラダイムの長所を統合するクローズドループビズモータポリシであるSegDiffを紹介する。
SegDiffはデモをキーセグメンテーション間で動作セグメントに分解し、現在の状態から次のキーセグメンテーションまでの連続的な軌跡を予測することを学習する。
SegDiffは、さまざまなシミュレートされた実世界のシナリオにおいて、既存のアプローチよりも大きなパフォーマンス向上を示している。
論文 参考訳(メタデータ) (2026-07-13T02:48:03Z) - LeapTS: Rethinking Time Series Forecasting as Adaptive Multi-Horizon Scheduling [74.94985663101906]
本稿では,予測地平線上での動的スケジューリングプロセスとして時系列予測を再構成する新しいフレームワーク LeapTSを提案する。
LeapTSは、Transformerベースのモデルよりも2.6$times$から5.3$times$推論スピードアップを実現しつつ、全体的な予測性能を少なくとも7.4%向上させる。
論文 参考訳(メタデータ) (2026-05-11T09:54:02Z) - Chain of World: World Model Thinking in Latent Motion [24.24061036481793]
VLA(Vision-Language-Action)モデルはしばしば、視覚力学の基礎となる予測的・時間的・因果的構造を見落としている。
我々は,世界モデルの時間的推論を非絡み合いの潜在動作表現と統合する新しい「世界の連鎖」パラダイムであるCoWVLAを紹介した。
CoWVLAは、既存のワールドモデルおよび潜在アクションアプローチより優れ、適度な計算効率を達成する。
論文 参考訳(メタデータ) (2026-03-03T17:52:06Z) - Self-Correcting VLA: Online Action Refinement via Sparse World Imagination [55.982504915794514]
本稿では, 自己補正VLA (SC-VLA) を提案する。
SC-VLAは最先端のパフォーマンスを達成し、最高タスクスループットを16%削減し、最高パフォーマンスのベースラインよりも9%高い成功率を得る。
論文 参考訳(メタデータ) (2026-02-25T06:58:06Z) - Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation [95.89924101984566]
GPM(Global Prior Memory)とLCM(Local Consistency Memory)を備えたデュアルメモリVLAフレームワークOptimusVLAを紹介する。
GPMはガウスノイズを意味論的に類似した軌道から取得したタスクレベルの先行値に置き換える。
LCMは、時間的コヒーレンスと軌道の滑らかさを強制する学習された一貫性制約を注入する。
論文 参考訳(メタデータ) (2026-02-22T15:39:34Z) - From Observations to States: Latent Time Series Forecasting [65.98504021691666]
本稿では,TSFを観測回帰から潜時予測に移行する新しいパラダイムであるLatent Time Series Forecasting(LatentTSF)を提案する。
具体的には、LatentTSFはAutoEncoderを使用して、各段階での観測結果を高次元の潜在状態空間に投影する。
提案する潜伏目標は,予測潜伏状態と地道状態と観測値との相互情報を暗黙的に最大化する。
論文 参考訳(メタデータ) (2026-01-30T20:39:44Z) - FASTer: Toward Efficient Autoregressive Vision Language Action Modeling via Neural Action Tokenization [61.10456021136654]
本稿では,効率的で汎用的なロボット学習のための統合フレームワークであるFASTerを紹介する。
FASTerVQは、アクションチャンクをシングルチャネルイメージとしてエンコードし、高い圧縮比を維持しながら、グローバルな時間的依存関係をキャプチャする。
FASTerVLAはブロックワイドの自動回帰デコーディングと軽量アクションエキスパートを備えたトークンライザ上に構築されており、推論の高速化とタスクパフォーマンスの向上を実現している。
論文 参考訳(メタデータ) (2025-12-04T16:21:38Z) - SparseWorld-TC: Trajectory-Conditioned Sparse Occupancy World Model [27.54931639768958]
本稿では, これからの3Dシーン占有状況の軌跡条件予測のための新しいアーキテクチャを提案する。
GPTやVGGTのような基本的な視覚や言語モデルにおける注意に基づくトランスフォーマーアーキテクチャにインスパイアされた我々は、中間的な鳥の視線(BEV)投影と、その明示的な幾何学的先行をバイパスする疎密な占有表現を採用した。
離散トークン化の有限容量制約とBEV表現の構造的制約の両方を回避し、1-3秒の占有予測のためのnuScenesベンチマークにおける最先端性能を実現する。
論文 参考訳(メタデータ) (2025-11-27T02:48:45Z) - dVLA: Diffusion Vision-Language-Action Model with Multimodal Chain-of-Thought [66.78110237549087]
VLA(Vision-Language-Action)モデルは、ロボット工学の次世代パラダイムとして登場しつつある。
単一システムにおける視覚認識,言語推論,ロボット制御を統一する拡散型VLAであるdVLAを紹介する。
論文 参考訳(メタデータ) (2025-09-30T02:36:11Z) - CronusVLA: Towards Efficient and Robust Manipulation via Multi-Frame Vision-Language-Action Modeling [84.51372201195132]
CronusVLAは、単一フレームのVLAモデルをマルチフレームパラダイムに拡張する統合フレームワークである。
CronusVLAは70.9%の成功率で先進的な性能と優れた堅牢性を達成する。
これらの結果は、より強力で堅牢な実世界展開のためのVLAモデルにおける効率的なマルチフレーム適応の可能性を強調している。
論文 参考訳(メタデータ) (2025-06-24T17:30:27Z) - Hierarchical Implicit Neural Emulators [20.09615751270837]
本稿では,長期予測精度を高めるマルチスケール暗黙的ニューラルエミュレータを提案する。
提案手法では, 圧縮速度の向上に先立って, 次の段階の圧縮速度の向上を推算する。
乱流流体力学の実験により,本手法は短期精度が高く,長期安定予測が得られた。
論文 参考訳(メタデータ) (2025-06-05T00:28:26Z) - Deep Active Inference Agents for Delayed and Long-Horizon Environments [1.693200946453174]
AIFエージェントは、遅れた環境で悪化する制限である正確な即時予測と徹底的な計画に依存している。
本稿では,複数段階の遅延遷移を特徴とする生成型政治アーキテクチャを提案する。
我々は,遅延と長期化の設定で現実的な産業シナリオを模倣した環境におけるエージェントの評価を行った。
論文 参考訳(メタデータ) (2025-05-26T11:50:22Z) - GACL: Graph Attention Collaborative Learning for Temporal QoS Prediction [5.040979636805073]
時間的予測のための新しいグラフ協調学習(GACL)フレームワークを提案する。
動的ユーザサービスグラフ上に構築され、過去のインタラクションを包括的にモデル化する。
WS-DREAMデータセットの実験は、GACLが時間的予測のための最先端の手法を著しく上回っていることを示している。
論文 参考訳(メタデータ) (2024-08-20T05:38:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。