論文の概要: OpenSPM: An Environment-Transferable Robotic Key Spatial Pose Memory and Closed-Loop High-Frequency Flow-Matching Action Generation Model
- arxiv url: http://arxiv.org/abs/2606.29936v2
- Date: Sun, 05 Jul 2026 08:13:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 17:33:48.561107
- Title: OpenSPM: An Environment-Transferable Robotic Key Spatial Pose Memory and Closed-Loop High-Frequency Flow-Matching Action Generation Model
- Title(参考訳): OpenSPM: 環境伝達可能なロボットキー空間空間情報メモリと閉ループ高周波フローマッチング動作生成モデル
- Abstract要約: OpenSPMは、テーブルトップロボット操作のためのオープン環境空間持続メモリフレームワークである。
人間のデモから重要な空間的ポーズを抽出し、転送可能でオブジェクト中心の空間的永続メモリエントリとして保持する。
推論中、OpenSPMは自然言語命令で関連するメモリエントリを取得し、空間ポーズを新しいシーンに転送し、高周波アクションチャンクを生成する。
85.6%の成功率と1033.3Hzの等価制御周波数を達成し、最小の推論AI計算能力を必要とする。
- 参考スコア(独自算出の注目度): 15.447261775053072
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Open-environment tabletop robotic manipulation requires systems to possess semantic understanding, precise geometric pose estimation, and high-frequency action generation. While end-to-end vision-language-action (VLA) models excel at semantic generalization, they often lack explicit geometric constraints for fine-grained tasks and require costly training. To bridge the gap between high-level semantics and low-level physical execution, we propose OpenSPM, an open environment spatial persistent memory framework consisting of spatial pose memory and flow-matching action generation model. OpenSPM first leverages semantically conditioned 3D perception and Kalman filtering to track continuous 6D poses. It then extracts key spatial poses from human demonstrations, keeping them as transferable, object-centric spatial persistent memory entries. During inference, OpenSPM retrieves relevant memory entries in terms of natural language instructions, transfers the spatial poses to new scenes using SE(3) transformations, and generates high-frequency action chunks via a lightweight conditional flow-matching model. Combined with real-time proprioceptive state feedback and terminal residual correction, the system effectively suppresses trajectory error accumulation. Evaluated on ten LIBERO-GOAL tasks, OpenSPM achieves an 85.6% success rate and an equivalent control frequency of 1033.3 Hz, while requiring minimal inference AI computing power. Extensive ablations illustrate that structured spatial persistent memory and closed-loop residual correction play a crucial role in reliable, high-frequency robotic manipulation.
- Abstract(参考訳): オープン環境のテーブルトップロボット操作では、セマンティックな理解、正確な幾何学的ポーズ推定、高周波アクション生成を必要とする。
エンド・ツー・エンド・ビジョン・ランゲージ・アクション(VLA)モデルはセマンティック・ジェネリゼーション(英語版)において優れているが、細粒度タスクに対する明示的な幾何学的制約を欠くことが多く、コストのかかる訓練を必要とする。
高レベルのセマンティクスと低レベルの物理実行のギャップを埋めるため、空間ポーズメモリとフローマッチングアクション生成モデルからなるオープン環境空間永続メモリフレームワークOpenSPMを提案する。
OpenSPMはまずセマンティック条件付き3D知覚とカルマンフィルタを利用して連続した6Dポーズを追跡する。
次に、人間のデモから重要な空間的ポーズを抽出し、転送可能でオブジェクト中心の空間的永続メモリエントリとして保持する。
推論中、OpenSPMは関連するメモリエントリを自然言語命令で検索し、SE(3)変換を使用して空間ポーズを新しいシーンに転送し、軽量な条件付きフローマッチングモデルにより高周波なアクションチャンクを生成する。
実時間固有状態フィードバックと終端残差補正を組み合わせることで,軌道誤差の蓄積を効果的に抑制する。
10のLIBERO-GOALタスクに基づいて評価され、OpenSPMは85.6%の成功率と1033.3Hzに相当する制御周波数を達成した。
広汎な説明は、構造化された空間的永続記憶と閉ループ残差補正が信頼性の高い高周波ロボット操作において重要な役割を担っていることを示している。
関連論文リスト
- HitMem: Hierarchical Temporal 3D Memory with Multi-Modal Context-Aware Retrieval for Dynamic Environments [5.55387168911911]
HitMemは階層的な時間的3Dメモリフレームワークで、マルチモーダルなコンテキスト認識検索機構を備えている。
HitMemはオブジェクトの移動精度を大幅に向上し、探索コストを低減し、動的環境におけるタスク実行性能を向上させる。
論文 参考訳(メタデータ) (2026-09-01T09:09:21Z) - MemoryWAM: Efficient World Action Modeling with Persistent Memory [80.90899269062128]
本稿では,効率的な永続メモリを持つ世界アクションモデルであるMemoryWAMを紹介する。
調整された注意機構は、詳細な短期コンテキストと圧縮された長期コンテキストの両方の検索を可能にする。
MemoryWAMは、シミュレーションと実世界の両方において、強力な視覚言語アクション(VLA)とWAMベースラインを上回っている。
論文 参考訳(メタデータ) (2026-06-18T17:59:51Z) - GeoHAT: Geometry-Adaptive Hybrid Action Transformer for Mobile Manipulation [6.488530751190965]
全体移動操作には移動基地とマニピュレータの調整が必要である。
我々は、シンプルな原理に基づいて構築された、エンドツーエンドの拡散ベースのフレームワークGeoHATを提案する。
ManiSkill-HABシミュレーションベンチマークの実験では、GeoHATが79.3%の成功率を達成した。
論文 参考訳(メタデータ) (2026-06-11T14:25:09Z) - Reasmory: 3D Reconstruction as Explicit Memory for VLMs Spatial Reasoning [43.950190960277865]
VLM(Vision-Language Models)は、空間的推論能力の出現を示すが、正確な空間的理解を必要とするタスクには信頼できない。
再構成空間メモリ上での構造化プログラム実行として空間推論を定式化するフレームワークであるtextbfReasmoryを提案する。
Reasmoryは明示的な3Dメモリを構築し、セマンティックな3Dオブジェクトインスタンスで拡張し、軽量なDomain-Specific Languageを導入している。
論文 参考訳(メタデータ) (2026-05-31T02:36:57Z) - SpaMEM: Benchmarking Dynamic Spatial Reasoning via Perception-Memory Integration in Embodied Environments [19.997461654311994]
本稿では,空間的信念進化の力学を分離した大規模診断ベンチマークであるSpaMEMを紹介する。
SpaMEMは,4つのモードにわたる10,601,392の高忠実度画像を備えた,物理的に接地されたデータセット上に構築されている。
我々は,空間推論を3段階の階層として15の診断タスクで定式化する。
論文 参考訳(メタデータ) (2026-04-24T10:06:41Z) - Beyond Short-Horizon: VQ-Memory for Robust Long-Horizon Manipulation in Non-Markovian Simulation Benchmarks [96.60530830276281]
RuleSafeは、スケーラブルなLLM支援シミュレーションフレームワーク上に構築された、新しいオペレーティングベンチマークである。
VQ-Memoryはベクトル量子化変分オートエンコーダを用いたコンパクトで構造化された時間表現である。
論文 参考訳(メタデータ) (2026-03-10T11:13:54Z) - Rethinking Multi-Condition DiTs: Eliminating Redundant Attention via Position-Alignment and Keyword-Scoping [61.459927600301654]
マルチコンディション制御は従来のコンカデント・アンド・アットエンドの戦略によってボトルネックとなる。
分析の結果,これらの相互作用の多くは空間的にも意味的にも冗長であることがわかった。
本稿では,これらの冗長性を解消するための高効率なフレームワークであるPKAを提案する。
論文 参考訳(メタデータ) (2026-02-06T16:39:10Z) - Infinite-World: Scaling Interactive World Models to 1000-Frame Horizons via Pose-Free Hierarchical Memory [101.2076718776139]
複雑な実環境において,1000フレーム以上のコヒーレントな視覚記憶を維持することのできる,堅牢な対話型世界モデルを提案する。
我々は,歴史的潜水剤を固定予算の幾何学的表現に蒸留するpose-free Memory (HPMC)を導入する。
また,連続動作を三状態論理に識別する不確実性認識型アクションラベルモジュールを提案する。
論文 参考訳(メタデータ) (2026-02-02T17:52:56Z) - The Curious Case of In-Training Compression of State Space Models [49.819321766705514]
ステートスペースモデル(SSM)は、並列化可能なトレーニングと高速推論の両方を提供する。
鍵となる設計上の課題は、表現力の最大化と計算負荷の制限の間の適切なバランスを打つことだ。
我々のアプローチである textscCompreSSM はリニアリカレントユニットのような線形時間不変SSMに適用されるが、選択モデルにも拡張可能である。
論文 参考訳(メタデータ) (2025-10-03T09:02:33Z) - ReSem3D: Refinable 3D Spatial Constraints via Fine-Grained Semantic Grounding for Generalizable Robotic Manipulation [12.059517583878756]
本稿では,意味的に多様な環境に対する統一的な操作フレームワークReSem3Dを提案する。
本稿では,ReSem3Dがゼロショット条件下で多様な操作を行い,適応性と一般化性を示すことを示す。
論文 参考訳(メタデータ) (2025-07-24T10:07:31Z) - Long-Context State-Space Video World Models [66.28743632951218]
本稿では、状態空間モデル(SSM)を活用して、計算効率を損なうことなく時間記憶を拡張する新しいアーキテクチャを提案する。
我々の設計の中心はブロックワイズSSMスキャン方式であり、時間記憶の拡張のために空間整合性を戦略的にトレードオフする。
メモリ迷路とMinecraftのデータセットの実験は、我々のアプローチが長距離メモリ保存のベースラインを超えたことを示している。
論文 参考訳(メタデータ) (2025-05-26T16:12:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。