論文の概要: Temporal Forcing: 4D Representation Alignment for Vision-Language-Action Models
- arxiv url: http://arxiv.org/abs/2608.30643v1
- Date: Mon, 31 Aug 2026 11:47:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:31.372545
- Title: Temporal Forcing: 4D Representation Alignment for Vision-Language-Action Models
- Title(参考訳): 時間的強制:視覚・言語・行動モデルのための4次元表現アライメント
- Abstract要約: VLAモデルの4次元表示アライメント法であるTemporal Forcingを提案する。
まず,バニラVLAモデルを用いて観測履歴を時間的に認識された潜在表現に要約する履歴経路を提案する。
そして、潜在表現は、時間的に一貫した幾何学的表現を通して進化する3次元世界をキャプチャする事前訓練された4次元基礎モデルによって抽出された幾何学的特徴と整合する。
- 参考スコア(独自算出の注目度): 44.595035220827754
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent vision-language-action (VLA) methods improve manipulation performance by aligning their representations with 3D scene geometry. However, these methods often struggle with long-horizon manipulation and observation aliasing between visually similar states due to a lack of temporal information: the 3D scene geometry captures only the current state, rather than how it has evolved over time. To resolve this, we present Temporal Forcing, a 4D representation alignment method for VLA models. Specifically, we first introduce a history pathway that enables a vanilla VLA model to summarize observation history into temporally aware latent representations. Then, the latent representations are aligned with the geometric features extracted by a pretrained 4D foundation model, which captures the evolving 3D world through temporally consistent geometric representations, enabling a deeper understanding of dynamic environments. Temporal Forcing reaches 98.8% on LIBERO, outperforming its base model by 2.2 points. On a physical hidden-placement task, it raises full-task success from 20.0% to 43.3%. Code will be publicly available.
- Abstract(参考訳): 近年の視覚-言語-アクション (VLA) 法では, 表現を3次元シーン形状に整合させることにより, 操作性能の向上が図られている。
しかし、これらの手法は、時間的情報の欠如により視覚的に類似した状態間の長時間の操作や観察に苦慮することが多く、3Dシーンの幾何学は時間とともにどのように進化してきたかではなく、現在の状態のみを捉えている。
これを解決するために,VLAモデルの4次元表示アライメント法であるテンポラル強制法を提案する。
具体的には,まず,バニラVLAモデルを用いて観測履歴を時間的に認識された潜在表現に要約する履歴経路を提案する。
そして、潜在表現は、事前訓練された4次元基礎モデルによって抽出された幾何学的特徴と整合し、時間的に一貫した幾何学的表現を通して進化する3次元世界を捉え、動的環境のより深い理解を可能にする。
テンポラルフォースはLIBEROで98.8%に達し、ベースモデルを2.2ポイント上回った。
物理的な隠れ配置タスクでは、フルタスクの成功率が20.0%から43.3%に上昇する。
コードは公開されます。
関連論文リスト
- 4DGS-WAM: Bridging Past and Future with an Object-Centric World Action Model based on 4D Gaussian Splatting [72.02343855552051]
現在の世界アクションモデル(WAM)は2次元の視覚データを扱うのが一般的である。
動的オブジェクトとシーンの静的背景を別々にモデル化した,明示的な4Dガウススティング(4DGS)表現を利用する。
4DGS-WAMは2次元観察を永続的な4次元表現に上げ、将来の予測で観測済みの静的コンテンツを再利用できるようにする。
論文 参考訳(メタデータ) (2026-08-26T16:16:57Z) - IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer [64.5765465030666]
オンライン4Dシーン理解のためのストリーミングインスタンスグラウンド幾何変換器IGGT4Dを提案する。
IGGT4Dは、ビデオフレームを逐次処理し、因果時空間モデリングを通じて歴史的コンテキストを再利用し、カメラモーション、幾何学、オブジェクトアイデンティティの統一表現を漸進的に更新する。
3次元再構成、ポーズ推定、例空間追跡、オープンボキャブラリセグメンテーションの実験は、IGGT4Dが既存のストリーミングベースラインより優れていることを示した。
論文 参考訳(メタデータ) (2026-07-21T16:00:01Z) - Lift3D-VLA: Lifting VLA Models to 3D Geometry and Dynamics-Aware Manipulation [76.16065370700488]
We introduced Lift3D-VLA, a unified VLA framework that equips models with explicit 3D point cloud reasoning and possible temporally coherent action generation。
我々は,Lift3D-VLAがMetaWorldとRLBenchの平均成功率を10.8%,11.1%向上したことを示す。
論文 参考訳(メタデータ) (2026-07-07T17:59:47Z) - ST-VLA: Enabling 4D-Aware Spatiotemporal Understanding for General Robot Manipulation [33.92613503473177]
本稿では,3D-4Dの統一表現を用いた3D-4D表現を提案する。
STHumanは,14,300kエピソード,注釈付き2D,3D,4Dコンテキストを備えた大規模ヒューマン操作データセットである。
RLBenchと実世界の操作タスクの実験は、手法が最先端のベースラインを大幅に上回っていることを示している。
論文 参考訳(メタデータ) (2026-03-14T06:36:48Z) - StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation [6.0744834626758495]
StemVLAは、未来の3D空間知識と歴史的4D表現の両方をアクション予測に明示的に組み込む新しいフレームワークである。
我々は,CALVIN ABC-D ベンチマーク [46] において,StemVLA はタスクの長期化と最先端性能を著しく向上し,XXX の平均シーケンス長を達成できることを示した。
論文 参考訳(メタデータ) (2026-02-27T06:43:37Z) - VLA-4D: Embedding 4D Awareness into Vision-Language-Action Models for SpatioTemporally Coherent Robotic Manipulation [54.81449795163812]
時間的コヒーレントなロボット操作のための4次元認識型汎用VLAモデルを開発した。
視覚的特徴を抽出し, 4次元埋め込みのための3次元位置への1次元時間埋め込みを行い, クロスアテンション機構による統一視覚表現に融合する。
この枠組みの中で、デザインされた視覚アクションは、空間的に滑らかで時間的に一貫したロボット操作を共同で行う。
論文 参考訳(メタデータ) (2025-11-21T12:26:30Z) - LoRD: Local 4D Implicit Representation for High-Fidelity Dynamic Human
Modeling [69.56581851211841]
そこで我々は,LoRDという,動的に衣を着る人間の局所的な4D暗黙表現を提案する。
私たちの重要な洞察は、ネットワークがローカルな部分レベルの表現の潜在コードを学ぶように促すことです。
LoRDは、4D人間を表現する能力が強く、実用上の最先端の手法よりも優れています。
論文 参考訳(メタデータ) (2022-08-18T03:49:44Z) - Learning Parallel Dense Correspondence from Spatio-Temporal Descriptors
for Efficient and Robust 4D Reconstruction [43.60322886598972]
本稿では,点雲列からの4次元形状再構成の課題に焦点をあてる。
本稿では,クロスフレーム占有領域間の連続的変換関数を捉えることにより,人間の3次元形状の時間変化を学ぶための新しいパイプラインを提案する。
論文 参考訳(メタデータ) (2021-03-30T13:36:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。