論文の概要: SKIP: Sparse Keyframe Interpolation Paradigm for Efficient Embodied World Models
- arxiv url: http://arxiv.org/abs/2606.00664v1
- Date: Sat, 30 May 2026 10:41:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-02 21:34:28.581085
- Title: SKIP: Sparse Keyframe Interpolation Paradigm for Efficient Embodied World Models
- Title(参考訳): SKIP:効率的な身体的世界モデルのためのスパースキーボード補間パラダイム
- Abstract要約: SKIP(Sparse Keyframe Interpolation Paradigm)を提案する。
SKIPは、ロボットが認識するマルチモーダル機能を利用してタスク関連物を識別する。
次に、スパースビデオ拡散モデルでこれらのEmsのみを合成する。
学習されたギャップ予測器ビデオと動作条件補間器は、その後、ロボットの動作に応じて行方不明区間を再構築する。
- 参考スコア(独自算出の注目度): 34.49867155987541
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Embodied world models have emerged as a promising paradigm in robotics by predicting how robot actions affect the surrounding scene. However, the rollout inference remains computationally expensive in pixel space, as long-horizon manipulation videos typically have to be generated frame by frame. This cost cannot be easily reduced by indiscriminately dropping frames, since downstream policies rely on complete preservation of sparse task-relevant events such as approach, contact, grasp, and release. To address this challenge, we propose Sparse Keyframe Interpolation Paradigm (SKIP), an event-preserving sparse-to-dense framework that avoids dense frame-by-frame generation. SKIP first identifies task-relevant keyframes by leveraging robot-aware multimodal features. It then synthesizes only these keyframes with a sparse video diffusion model. A learned gap predictor and an action-conditioned interpolator subsequently reconstruct the missing intervals according to the robot actions. On LIBERO, SKIP generates dense rollouts $4.16\times$ faster than a dense baseline while improving visual fidelity and reducing aggregate FVD by $89.0\%$. Importantly, SKIP-generated videos are effective policy-training data. Even when they fully replace real demonstrations, $π_{0.5}$ success drops only $1.3$ pp in LIBERO simulation and $6.7$ pp on the real robot, whereas fully dense frame-by-frame generation collapses by $48$ to $58$ pp.
- Abstract(参考訳): ロボットのアクションが周囲のシーンにどのように影響するかを予測することによって、ロボット工学における有望なパラダイムとして、エンボディードワールドモデルが登場した。
しかし、ロールアウト推論はピクセル空間において計算コストがかかるままであり、長い水平操作ビデオはフレーム単位で生成されるのが普通である。
ダウンストリームポリシは、アプローチ、コンタクト、把握、リリースといった、スパースなタスク関連イベントの完全な保存に依存しているため、フレームを無差別にドロップすることで、このコストを簡単に削減することはできない。
この課題に対処するため,SKIP(Sparse Keyframe Interpolation Paradigm)を提案する。
SKIPはまず、ロボットが認識するマルチモーダル機能を活用することで、タスク関連キーフレームを識別する。
そして、これらのキーフレームのみをスパースビデオ拡散モデルで合成する。
学習されたギャップ予測器と動作条件補間器は、その後、ロボットの動作に応じて行方不明区間を再構築する。
LIBEROでは、SKIPは濃厚なベースラインよりも4.16\times$で高密度なロールアウトを生成し、視覚的忠実度を改善し、集約的なFVDを89.0\%で下げる。
重要なことは、SKIP生成ビデオは効果的なポリシー学習データである。
実際のデモを完全に置き換えたとしても、$π_{0.5}$成功率は、LIBEROシミュレーションで1.3$ pp、実際のロボットで6.7$ pp、フル密度のフレーム・バイ・フレーム・ジェネレーションでは4.8$から5.8$ ppにしか低下しない。
関連論文リスト
- StreamPI: Streaming Multimodal Temporal Modeling for Vision-Language-Action Models [84.17128030384099]
StreamPIはストリーミングマルチモーダル時間モデリングフレームワークである。
追加パラメータを導入することなく、単一フレームのVLAに時間的推論能力を持たせる。
メモリ依存および正確な認識シナリオにまたがる実ロボットタスクの実験とシミュレーションベンチマークのLIBEROは、StreamPIが様々なタスクでpi0.5より優れていることを示した。
論文 参考訳(メタデータ) (2026-08-26T17:33:19Z) - PCA: Persistence-Aware Compression and Aggregation for Fast Video Large Language Models [63.31550146180189]
本稿では、エンコーディングステージの前に、高サンプリングの生の視覚情報を保存するためのトレーニング不要な$mathbfP$ersistence-Aware $mathbfC$ompressionと$mathbfA$ggregation (PCA)手法を提案する。
PCAは、既存の最先端のアプローチを効率と精度の両方で一貫して上回っている。
論文 参考訳(メタデータ) (2026-07-22T05:17:38Z) - Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs [21.02858354959528]
視覚言語モデルと視覚言語アクションモデルにより、ロボットには前例のない能力がある。
ビデオや高解像度画像の入力は膨大な数の視覚トークンをもたらし、非常に高い推論遅延をもたらし、ロボットのリアルタイム制御を著しく妨げる。
本稿では,視覚的エンコーディングフェーズにおいて,冗長トークンを直接効率的に融合するプラグイン・アンド・プレイフレームワークST-Mergeを提案する。
論文 参考訳(メタデータ) (2026-06-28T11:42:55Z) - Diffusion Transformer World-Action Model for AV Scene Prediction [0.0]
アクションコンディショニングされた世界モデルは、自動運転車が将来のカメラシーンを独自のコントロールから予測することを可能にする。
しかし、コンパクトで訓練可能なスケールでは、未来は曖昧であり、フィールドの標準歪み指標は積極的に誤解を招く。
我々はこれを、冷凍デコーダが最大256倍256ドルフレームを最大8秒前にレンダリングする将来のシーンの潜伏を予測するコンパクトな潜伏世界モデルと対決する。
論文 参考訳(メタデータ) (2026-06-11T07:24:12Z) - RobotPan: A 360$^\circ$ Surround-View Robotic Vision System for Embodied Perception [47.76543396190029]
6台のカメラをLiDARと組み合わせて360ドル(約3万2000円)のビジュアルカバレッジを提供するサラウンドビューロボットビジョンシステムを導入する。
また、キャリブレーションされたスパースビューの入力から、エンフェロメトリースケールとエンフェロパクトの3Dガウスを予測できるフィードフォワードフレームワークであるtextscRobotPan を提示する。
実験により,textscRobotPanはフィードフォワードの事前再構成やビュー合成手法と競合する品質を実現することが示された。
論文 参考訳(メタデータ) (2026-04-15T04:58:23Z) - DiT4DiT: Jointly Modeling Video Dynamics and Actions for Generalizable Robot Control [16.562259973551786]
本稿では,ビデオ拡散変換器とアクション拡散変換器を結合したエンドツーエンドのビデオ・アクション・モデルであるDiT4DiTを紹介する。
DiT4DiTは、再構成後のフレームに頼る代わりに、ビデオ生成プロセスから中間的なデノイング機能を抽出する。
これは最先端の結果を達成し、LIBEROでは98.6%、RoboCasa GR1では50.8%という平均的な成功率に達した。
論文 参考訳(メタデータ) (2026-03-11T06:03:53Z) - An Efficient Quality Metric for Video Frame Interpolation Based on Motion-Field Divergence [0.3823356975862005]
ビデオフレームは時間的ビデオ強調の基本的なツールであるが、既存の品質指標は、人工物の影響を効果的に評価するのに苦労している。
動きの発散重み付けによりPSNRを強化する新しい完全参照品質指標であるtextPSNR_textDIV$を提示する。
提案手法では,画像誤差の重み付けに使用される運動場の特異点に着目した。
論文 参考訳(メタデータ) (2025-10-01T18:40:38Z) - H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers [124.11648300910444]
Heerarchical Hourglass Tokenizer (H$_2$OT) と呼ばれる階層的なプラグアンドプレイプルーニング&ドル回復フレームワークを提案する。
提案手法は汎用的であり,Seq2seqおよびSeq2frameパイプラインの共通VPTモデルに容易に組み込むことができる。
論文 参考訳(メタデータ) (2025-09-08T17:59:59Z) - FLARE: Robot Learning with Implicit World Modeling [87.81846091038676]
$textbfFLARE$は、予測潜在世界モデリングをロボットポリシー学習に統合する。
$textbfFLARE$は最先端のパフォーマンスを実現し、これまでのポリシー学習のベースラインを最大26%上回っている。
この結果は、暗黙の世界モデリングと高周波ロボット制御を組み合わせた汎用的でスケーラブルなアプローチとして$textbfFLARE$を確立した。
論文 参考訳(メタデータ) (2025-05-21T15:33:27Z) - Towards Scalable Modeling of Compressed Videos for Efficient Action Recognition [6.168286187549952]
提案するハイブリッドなエンドツーエンドフレームワークは,3つの重要な概念にまたがって学習を分解し,推論コストを先行技術に対して330倍に削減する。
実験により,本手法は最先端のビデオ認識性能を実現する軽量なアーキテクチャを実現することが示された。
論文 参考訳(メタデータ) (2025-03-17T21:13:48Z) - IBVC: Interpolation-driven B-frame Video Compression [68.18440522300536]
Bフレームビデオ圧縮は、双方向動作推定と動き補償(MEMC)符号化をミドルフレーム再構成に適用することを目的としている。
従来の学習アプローチでは、しばしば双方向の光フロー推定に依存するニューラルネットワークのPフレームコーデックをBフレームに直接拡張する。
これらの問題に対処するために,IBVC (Interpolation-B-frame Video Compression) という単純な構造を提案する。
論文 参考訳(メタデータ) (2023-09-25T02:45:51Z) - All at Once: Temporally Adaptive Multi-Frame Interpolation with Advanced
Motion Modeling [52.425236515695914]
最先端の手法は、一度に1つのフレームを補間する反復解である。
この研究は、真のマルチフレーム補間子を導入している。
時間領域のピラミッドスタイルのネットワークを使用して、複数フレームのタスクをワンショットで完了する。
論文 参考訳(メタデータ) (2020-07-23T02:34:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。