論文の概要: Trajectory-Level Continuous Action Representation for Robotic Manipulation
- arxiv url: http://arxiv.org/abs/2608.24111v2
- Date: Wed, 26 Aug 2026 04:22:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-27 14:15:15.160835
- Title: Trajectory-Level Continuous Action Representation for Robotic Manipulation
- Title(参考訳): ロボットマニピュレーションのための軌道レベル連続行動表現
- Abstract要約: 既存のビジュモータシステムは、しばしば制御周波数で行動表現を絡めるか、固定時間パラメータ化に依存する。
ロボット操作のための軌道レベル連続行動表現フレームワークであるCATを提案する。
Catは、固定されたリアルタイム間隔内でアクショントラジェクトリを、連続的な潜在トークンのセットにエンコードする。
- 参考スコア(独自算出の注目度): 31.92437041447019
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: We propose CAT, a trajectory-level continuous action representation framework for robotic manipulation. Existing visuomotor systems often entangle action representation with control frequency or rely on fixed temporal parameterizations. This leads to representational redundancy at high sampling rates and limits the modeling of critical motion. CAT instead encodes action trajectories within a fixed real-time interval into a set of continuous latent tokens. To ensure temporal consistency across varying control frequencies, we further incorporate a frequency-aware positional encoding that establishs a shared temporal coordinate system. Trajectory-level regularization further stabilizes the latent representation. This approach prevents representation growth with timestep density and avoids reliance on predefined temporal parameterizations. Extensive system-level evaluations on LIBERO, MimicGen, and real-world long-horizon manipulation tasks demonstrate that CAT-based policies consistently outperform both competitive VQ-based and continuous visuomotor baselines under matched training settings. Across various model backbones and control frequencies, CAT consistently improves success rates. These results highlight the advantages of trajectory-level continuous action modeling for scalable robotic manipulation across varying control rates.
- Abstract(参考訳): ロボット操作のための軌道レベル連続行動表現フレームワークであるCATを提案する。
既存のビジュモータシステムは、しばしば制御周波数で行動表現を絡めるか、固定時間パラメータ化に依存する。
これは高いサンプリングレートでの表現冗長性をもたらし、臨界運動のモデリングを制限する。
CATは代わりに、固定されたリアルタイムインターバル内のアクショントラジェクトリを連続した潜在トークンのセットにエンコードする。
制御周波数の異なる時間的整合性を確保するために,共用時間座標系を確立する周波数認識位置符号化を導入する。
軌道レベルの正規化は潜在表現をさらに安定化させる。
このアプローチは、時間ステップ密度による表現成長を防止し、予め定義された時間パラメータ化への依存を避ける。
LIBERO, MimicGen, および実世界の長期操作タスクに対するシステムレベルの大規模な評価は、CATベースのポリシーが一致したトレーニング設定下での競合VQベースのベースラインと継続的ビジュモータベースラインを一貫して上回っていることを示している。
様々なモデルバックボーンと制御周波数にわたって、CATは一貫して成功率を改善する。
これらの結果は、様々な制御速度でスケーラブルなロボット操作を実現するための軌道レベル連続動作モデリングの利点を強調している。
関連論文リスト
- SegDiff: Segmented Trajectory Diffusion for Consistent and Adaptive Robot Manipulation [65.81476183180527]
両パラダイムの長所を統合するクローズドループビズモータポリシであるSegDiffを紹介する。
SegDiffはデモをキーセグメンテーション間で動作セグメントに分解し、現在の状態から次のキーセグメンテーションまでの連続的な軌跡を予測することを学習する。
SegDiffは、さまざまなシミュレートされた実世界のシナリオにおいて、既存のアプローチよりも大きなパフォーマンス向上を示している。
論文 参考訳(メタデータ) (2026-07-13T02:48:03Z) - SPECTRA: Context-Conditioned Spectral Movement Primitives for Robot Skill Generalization [15.211665025521768]
本稿では,タスク空間のスキル生成と共同実行規則を結合した周波数領域模倣学習フレームワークを提案する。
実験では, タスクバンド再構築, 複合実証汚損に対する堅牢性, 分配外一般化, 共同空間動的許容性, エンドエフェクタ経路保存, フランカパンダロボットへの展開を評価した。
論文 参考訳(メタデータ) (2026-07-08T04:02:19Z) - Hierarchical Policy Learning via Spectral Decomposition [58.65543693788772]
ロボットの動作シーケンスにおける意味的分解を識別し,タスクレベルの動作意図と実行レベルの改善を分離する。
本稿では, 因果的粗大化過程として行動生成をモデル化した因果スペクトルポリシー(CSP)を提案する。
CSPは、精度に敏感な操作タスクにおいて、強いベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-06-28T19:22:40Z) - Frequency-Aware Flow Matching for Continuous and Consistent Robotic Action Generation [46.998628831231194]
既存の方法は離散化されたアクションチャンクに依存しており、不均一な制御で収集されたデモに対して脆弱である。
本稿では、連続的かつ時間的に一貫した動作を出力する周波数認識フローマッチング(FAFM)を提案する。
FAFMは成功率、マルチモーダル表現性、運動の滑らか性、収束速度、機械的バイアスに対する堅牢性、混合周波数入力を改善する。
論文 参考訳(メタデータ) (2026-06-18T11:58:30Z) - Sparse Autoencoders as a Steering Basis for Phase Synchronization in Graph-Based CFD Surrogates [6.396157607535812]
グラフベースのサロゲートモデルは、高忠実度CFDソルバに代わる高速な代替手段を提供するが、その不透明な潜在空間と制限された制御性は、安全クリティカルな設定での使用を制限する。
凍結サロゲートの潜伏空間を操作することにより, 位相ドリフトをポストホックで補正できるかどうかを問う。
本稿では、適切な表現と適切な介入機構を組み合わせた事前学習グラフベースのCFDモデルのための位相ステアリングフレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-28T07:03:44Z) - Enabling Dynamic Tracking in Vision-Language-Action Models via Time-Discrete and Time-Continuous Velocity Feedforward [11.066720921275648]
視覚言語アクション(VLA)モデルは、ロボット操作に非常に有望である。
厳格な産業用ロボットへの展開は、コンプライアンスと応答性の本質的にのトレードオフのため、依然として困難である。
本稿では、このトレードオフを解決するために、速度フィードフォワード項をVLAポリシーに統合することの重要性を示す。
論文 参考訳(メタデータ) (2026-03-17T07:50:00Z) - Towards Arbitrary Motion Completing via Hierarchical Continuous Representation [64.6525112550758]
Inlicit Representations(INR)に基づくNAMEと呼ばれる新しいパラメトリックアクティベーションによる階層的暗黙表現フレームワークを提案する。
本手法では,複数の時間スケールで動作列から特徴を抽出し,複雑な時間パターンを効果的に捕捉する階層的時間符号化機構を提案する。
論文 参考訳(メタデータ) (2025-12-24T14:07:04Z) - PatchTraj: Unified Time-Frequency Representation Learning via Dynamic Patches for Trajectory Prediction [14.48846131633279]
軌道予測のための時間周波数ジョイントモデリングを統合した動的パッチベースのフレームワークを提案する。
具体的には、軌道を生の時間列と周波数成分に分解し、動的パッチ分割を用いてマルチスケールセグメンテーションを行う。
その結果、拡張された埋め込みは強力な表現力を示し、バニラアーキテクチャを使用した場合でも正確な予測を可能にする。
論文 参考訳(メタデータ) (2025-07-25T09:55:33Z) - FreqPolicy: Frequency Autoregressive Visuomotor Policy with Continuous Tokens [47.735852718586216]
本稿では,階層的な周波数成分を段階的にモデル化するビジュモータポリシー学習のための新しいパラダイムを提案する。
さらに精度を高めるために,動作空間の滑らかさと連続性を維持する連続潜在表現を導入する。
我々の手法は、精度と効率の両方で既存の手法より優れている。
論文 参考訳(メタデータ) (2025-06-02T12:13:51Z) - A Poisson-Gamma Dynamic Factor Model with Time-Varying Transition Dynamics [51.147876395589925]
非定常PGDSは、基礎となる遷移行列が時間とともに進化できるように提案されている。
後続シミュレーションを行うために, 完全共役かつ効率的なギブスサンプリング装置を開発した。
実験により,提案した非定常PGDSは,関連するモデルと比較して予測性能が向上することを示した。
論文 参考訳(メタデータ) (2024-02-26T04:39:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。