論文の概要: AcrossVAM1.0: Particle World Modeling for Text-Assisted Robot Video Prediction
- arxiv url: http://arxiv.org/abs/2608.28491v1
- Date: Fri, 28 Aug 2026 16:19:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-31 17:16:04.39247
- Title: AcrossVAM1.0: Particle World Modeling for Text-Assisted Robot Video Prediction
- Title(参考訳): AcrossVAM1.0: テキスト支援ロボット映像予測のための粒子世界モデリング
- Authors: Yafei Zhang, Nan Wu,
- Abstract要約: AcrossVAM1.0は、将来の予測をオブジェクト中心の動きと高密度な外観に分解する軽量なテキスト支援ビデオアクションモデルである。
因果的デュアルストリームデコーダは、最後のフレームからのみ符号化された外観とパーティクルレンダリングされた動きを結合する。
多様な実ロボット軌道から構築したVRSベンチマークでは、粒子動力学は持続性よりも誤差を21.0%削減する。
- 参考スコア(独自算出の注目度): 14.556446786016787
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Predicting robot videos requires both precise motion reasoning and preservation of high-frequency appearance, yet monolithic pixel models entangle these objectives and often conceal their progress behind a strong last-frame baseline. We present AcrossVAM1.0, a lightweight, text-assisted video action model that factorizes future prediction into object-centric motion and dense appearance. A frozen SAM3-DLP codec decomposes four context frames into semantic particles for the robot, arm, and gripper, together with a background latent. A 0.28M-parameter spatio-temporal Transformer aligns particle identities, rolls their states forward, and is modulated by a frozen OpenCLIP instruction embedding through FiLM. A causal dual-stream decoder combines particle-rendered motion with appearance encoded exclusively from the last observed frame; a residual refiner and learned delivery mask produce five future frames without access to future appearance. On our VRS benchmark constructed from diverse real-robot trajectories, particle dynamics reduce trajectory error by 21.0\% over persistence. Across three delivery-mask seeds, AcrossVAM1.0 improves future-frame PSNR/SSIM from 19.97/0.796 to 20.573/0.8004, while raw particle generation improves motion-region PSNR from 11.89 to 13.23. The delivered model does not yet beat persistence in LPIPS, and correct-versus- shuffled language changes trajectory error by only 2.8--3.1%. We report these limitations alongside oracle, negative-control, multi-seed, and per-robot analyses. The results show that explicit particle dynamics are a promising low-dimensional interface for robot video prediction, while robust language grounding and appearance delivery remain the principal open challenges.
- Abstract(参考訳): ロボットビデオの予測には、高精度な動き推論と高周波の外観の保存の両方が必要であるが、モノリシックなピクセルモデルはこれらの目的を絡め、しばしば強力なラストフレームベースラインの背後にその進捗を隠蔽する。
AcrossVAM1.0は、将来の予測をオブジェクト中心の動きと高密度な外観に分解する軽量なテキスト支援ビデオアクションモデルである。
凍ったSAM3-DLPコーデックは、4つのコンテキストフレームをロボット、アーム、グリップのセマンティック粒子に分解する。
0.28Mパラメトリック時空間変換器は粒子のアイデンティティを整列させ、その状態を前方に回転させ、凍結したOpenCLIP命令でFiLMを通して変調する。
因果的デュアルストリームデコーダは、粒子レンダリングされた動きと、最後の観測フレームからのみ符号化された外観を組み合わせる。
種々の実ロボット軌道から構築したVRSベンチマークにおいて,粒子動力学は軌道誤差を持続時間で21.0\%削減する。
AcrossVAM1.0は3つのデリバリーマスク種の中で、将来のフレームPSNR/SSIMを19.97/0.796から20.573/0.8004に改善し、一方粒子生成は11.89から13.23に改善した。
配信されたモデルはLPIPSの永続性にはまだ勝っていないが、正逆シャッフルされた言語は軌道誤差をわずか2.8~3.1%変更した。
これらの制限は、オラクル、ネガティブコントロール、マルチシード、ロボットごとの分析と共に報告する。
その結果、明示的な粒子動力学はロボットビデオ予測のための有望な低次元インタフェースであり、ロバストな言語接地と外観提供が主要な課題であることが明らかとなった。
関連論文リスト
- KineBench: Benchmarking Embodied World Models via IDM-Free Kinematic Grounding [58.541098216700796]
エンボディド・ワールド・モデルの 物理的整合性を評価することは 重要なオープン・チャレンジです
既存のフレームワークはほとんどがアクション抽出に逆ダイナミクスモデル(IDM)に依存している。
IDMのないEWMのためのクローズドループベンチマークであるKineBenchを紹介する。
論文 参考訳(メタデータ) (2026-07-22T08:04:17Z) - PhysisForcing: Physics Reinforced World Simulator for Robotic Manipulation [37.9748770367306]
ビデオ生成モデルは、一貫性のないロボットとオブジェクトの相互作用を含む、物理的に不可解な操作を生成することができる。
本研究では,物理インフォーマティブ領域の監督に焦点をあて,身体の整合性を高めるためのトレーニングフレームワークであるPhys Forcingを提案する。
実験の結果,Phys Forcing は強いベースラインよりも常にエンボディドビデオ生成を改善していることがわかった。
論文 参考訳(メタデータ) (2026-06-26T14:30:18Z) - DiT4DiT: Jointly Modeling Video Dynamics and Actions for Generalizable Robot Control [16.562259973551786]
本稿では,ビデオ拡散変換器とアクション拡散変換器を結合したエンドツーエンドのビデオ・アクション・モデルであるDiT4DiTを紹介する。
DiT4DiTは、再構成後のフレームに頼る代わりに、ビデオ生成プロセスから中間的なデノイング機能を抽出する。
これは最先端の結果を達成し、LIBEROでは98.6%、RoboCasa GR1では50.8%という平均的な成功率に達した。
論文 参考訳(メタデータ) (2026-03-11T06:03:53Z) - Masked Modeling for Human Motion Recovery Under Occlusions [21.05382087890133]
MoRoは、ビデオコンディショニングタスクとしてモーション再構成を定式化する、エンドツーエンドの生成フレームワークである。
MoRoは、1つのH200 GPU上で70FPSのリアルタイム推論を実現する。
論文 参考訳(メタデータ) (2026-01-22T16:22:20Z) - InternVLA-A1: Unifying Understanding, Generation and Action for Robotic Manipulation [77.07565723756119]
InternVLA-A1は動的予測機能を備えた視覚言語モデルである。
我々は、実世界のロボットデータ、合成シミュレーションデータ、人間のビデオなどを用いて、これらのモデルを異種データソース上で事前訓練する。
InternVLA-A1を実世界の12のロボットタスクとシミュレーションベンチマークで評価した。
論文 参考訳(メタデータ) (2026-01-05T18:54:29Z) - M2DAO-Talker: Harmonizing Multi-granular Motion Decoupling and Alternating Optimization for Talking-head Generation [65.48046909056468]
我々は,音声音声生成をビデオ前処理,モーション表現,レンダリング再構成を含む統一的なフレームワークに再構成する。
M2DAO-Talkerは2.43dBのPSNRの改善とユーザ評価ビデオの画質0.64アップで最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2025-07-11T04:48:12Z) - Text-guided 3D Human Motion Generation with Keyframe-based Parallel Skip Transformer [62.29951737214263]
既存のアルゴリズムは、コストがかかりエラーを起こしやすい全シーケンスを直接生成する。
本稿では,入力テキストに対応する人間の動作系列を生成するKeyMotionを提案する。
我々は,自動エンコーダを潜在空間に投影するために,Kullback-Leibler正規化付き変分符号器(VAE)を用いる。
逆拡散のために,デザインラテントとテキスト条件の相互参照を行う新しいパラレルスキップ変換器を提案する。
論文 参考訳(メタデータ) (2024-05-24T11:12:37Z) - Robust Human Motion Forecasting using Transformer-based Model [14.088942546585068]
本研究では,リアルタイムな3次元人体動作予測を短時間・長期で処理するTransformerに基づく新しいモデルを提案する。
本モデルでは, 騒音の多い環境下での3次元動作の復元と予測において, 人間の動きが著しく抑制されている状況において, その頑健さを実証する。
我々のモデルは,400msの入力プレフィックスを持つHumanre3.6Mデータセットにおいて,短期予測におけるST-Transformerの平均2乗誤差を8.89%,長期予測で2.57%削減する。
論文 参考訳(メタデータ) (2023-02-16T13:06:39Z) - Future Frame Prediction for Robot-assisted Surgery [57.18185972461453]
本稿では,ロボット手術用ビデオシーケンスにおけるフレーム予測のためのtpg-vaeモデルを提案する。
コンテンツ配信に加えて、私たちのモデルは、手術ツールの小さな動きを処理するために斬新な運動分布を学習します。
論文 参考訳(メタデータ) (2021-03-18T15:12:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。