論文の概要: SymmGrid: Super-Scaling On-Robot Learning with Parallelized Symmetries and Egocentric-Exocentric Visual Perception
- arxiv url: http://arxiv.org/abs/2607.26985v1
- Date: Wed, 29 Jul 2026 14:41:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.706124
- Title: SymmGrid: Super-Scaling On-Robot Learning with Parallelized Symmetries and Egocentric-Exocentric Visual Perception
- Title(参考訳): SymmGrid: 並列化された対称性とエゴセントリック・エクソセントリックな視覚知覚を用いた超スケーリングオンロボット学習
- Authors: Gabe Everett, Brice Gunter, Ryan Vander Stelt, Cleiver Ruiz-Martinez, Blake Hull, Juan Rojas,
- Abstract要約: 並列化された対称性にインスパイアされた軌道レベルの拡張フレームワークであるSymGridを提案する。
我々は、状態-作用対が許容可能な並列化不変変換を持つ対称性木の下でマルコフ決定過程(MDP)をモデル化する。
本研究では,実際のロボット操作接触タスクに対して,広範囲なトレーニングと評価を行う。
- 参考スコア(独自算出の注目度): 0.5125513146293734
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Deep reinforcement policy learning directly in physical robots (on-robot learning) remains bottlenecked by slow wall-clock training times. We present SymmGrid, a trajectory level augmentation framework inspired by parallelized symmetries that super-scales group transformations to significantly accelerate on-robot learning in both egocentric and exocentric visual setups. We model a Markov Decision Process (MDP) under a symmetry tree, in which state-action pairs have admissible parallelized invariant transformations that yield a geometric grid structure. The state is modelled with ego- or exocentric images and proprioception information. The latter require special treatment, in the form of homographies, to warp visual scenes in line with their corresponding spatial transformations. These parallelized transformations produce a large set of unique symmetric equivalences that populate the replay buffer with diverse and consistent experiences that speed up learning and improve performance. We present extensive training and evaluations performed directly on real robot manipulation contact tasks including peg-insertions, cable routing, and object relocations. Relative to SOTA, SymmGrid achieved wall-clock training convergence speed-ups of 1.37-2.17x, evaluation success rate improvements of 1.09x-1.27x, fastest training convergence times of 16.6, 10.9, and 79.3 minutes respectively. For trajectory wide assessments, we used normalized area under the curve (nAUC) ratios. SymmGrid achieved improvements of up to 2.59x. These results confirm that simple branch symmetries can have an outsized result due to super-scaling and bring us closer to sub-10 minute on-robot learning training in manipulation tasks suitable for arms and humanoids. The project page is available at symmgrid-robot.github.io
- Abstract(参考訳): 物理的なロボット(オンロボット学習)で直接学習する深層強化ポリシーは、ウォールタイムの遅いトレーニング時間によってボトルネックを被っている。
並列化された対称性にインスパイアされた軌道レベルの拡張フレームワークであるSymGridを提案する。
我々は、対称木の下でマルコフ決定過程(MDP)をモデル化し、状態-作用対が許容可能な並列化不変変換を持ち、幾何学的格子構造を生成する。
状態は、エゴ中心またはエキソセントリックなイメージとプロプレセプション情報でモデル化される。
後者は、ホモグラフィーの形で、視覚的なシーンを対応する空間的変換に合わせてワープするために特別な処理を必要とする。
これらの並列化変換は、リプレイバッファに様々な一貫した経験を投入し、学習をスピードアップし、パフォーマンスを向上させる、多くのユニークな対称同値を生成する。
我々は,ペグ・インサーション,ケーブル・ルーティング,オブジェクト・リロケーションを含む実際のロボット操作接触タスクに対して,広範なトレーニングと評価を行う。
SOTAとは対照的に、SimmGridは1.37-2.17xのウォールクロックトレーニング収束速度アップ、1.09x-1.27xの評価成功率改善、16.6、10.9、79.3分を達成した。
トラジェクティブワイドアセスメントでは,曲線(nAUC)比で正規化領域を用いた。
SymmGridは最大2.59倍の改善を達成した。
これらの結果から, 単純な分岐対称性は, スーパースケーリングによる大域的な結果が得られ, アームやヒューマノイドに適した操作作業において, 10分未満のオンロボット学習訓練に近づいたことが確認された。
プロジェクトページはsymmgrid-robot.github.ioで公開されている。
関連論文リスト
- SymTRELLIS: Symmetry-Enforced Voxel Latents for 3D Generation [10.616258272621836]
フローベースTRELLIS.2の3次元生成において任意の有限点群対称性を強制する手法であるSymTRELLISを提案する。
266の厳密な対称オブジェクトのキュレートされたベンチマークでは、SymTRELLISはTRELLIS.2、Hunyuan3D-2.1、TripoSGと比較して、すべての対称性エラーメトリクスを著しく削減している。
論文 参考訳(メタデータ) (2026-06-02T18:11:41Z) - EquiBim: Learning Symmetry-Equivariant Policy for Bimanual Manipulation [6.9686350006975]
EquiBimは、二元的操作のための対称性に等価なポリシー学習フレームワークである。
我々のアプローチは、観測空間と作用空間の両方における群作用として物理対称性を定式化する。
本研究は,シミュレーションにおける多様な観察・行動構成にまたがって評価し,実世界のデュアルアームシステム上での検証を行う。
論文 参考訳(メタデータ) (2026-03-09T16:09:18Z) - Robometer: Scaling General-Purpose Robotic Reward Models via Trajectory Comparisons [69.87766750714945]
汎用ロボット報酬モデルは通常、専門家によるデモンストレーションから絶対的なタスク進捗を予測するために訓練される。
本稿では、軌道内進行監視と軌道間優先監視を組み合わせたスケーラブルな報酬モデリングフレームワークRobometerを紹介する。
ロビオメーターは、専門家データに報酬等級を固定するフレームレベルのプログレス・ロスと、グローバルな順序制約を課す軌跡比較優先損失という2つの目的で訓練されている。
論文 参考訳(メタデータ) (2026-03-02T17:38:58Z) - OmniSAT: Compact Action Token, Faster Auto Regression [70.70037017501357]
我々は、コンパクトで転送可能なアクション表現を学ぶOmni Swift Action Tokenizerを紹介する。
その結果、離散トークン化はトレーニングシーケンスを6.8$times$に短縮し、ターゲットエントロピーを低下させる。
論文 参考訳(メタデータ) (2025-10-08T03:55:24Z) - Time Reversal Symmetry for Efficient Robotic Manipulations in Deep Reinforcement Learning [11.07447878082744]
時間反転対称性(英: Time Reversal symmetric)は、ドアの開閉や閉鎖といったロボット工学のタスクでよく見られる時間対称性の一種である。
本稿では,時間反転対称性向上型深層強化学習(TR-DRL)を提案する。
RobosuiteベンチマークとMetaWorldベンチマークの大規模な実験は、TR-DRLがシングルタスクとマルチタスクの両方で有効であることを示した。
論文 参考訳(メタデータ) (2025-05-20T04:40:49Z) - Symmetry Considerations for Learning Task Symmetric Robot Policies [12.856889419651521]
シンメトリーは多くの現実世界のロボットタスクの基本的な側面である。
現在の深層強化学習(DRL)アプローチは、対称性を効果的に活用することは滅多にない。
論文 参考訳(メタデータ) (2024-03-07T09:41:11Z) - Latent State Models of Training Dynamics [51.88132043461152]
異なるランダムなシードでモデルをトレーニングし、トレーニングを通じてさまざまなメトリクスを計算します。
次に、結果のメトリクス列に隠れマルコフモデル(HMM)を適合させる。
我々はHMM表現を用いて相転移を研究し、収束を遅くする潜伏状態(detour state)を特定する。
論文 参考訳(メタデータ) (2023-08-18T13:20:08Z) - Robot Learning with Sensorimotor Pre-training [98.7755895548928]
ロボット工学のための自己教師型感覚運動器事前学習手法を提案する。
我々のモデルはRTTと呼ばれ、センサモレータトークンのシーケンスで動作するトランスフォーマーである。
感覚運動の事前学習は、ゼロからトレーニングを一貫して上回り、優れたスケーリング特性を持ち、さまざまなタスク、環境、ロボット間での移動を可能にしている。
論文 参考訳(メタデータ) (2023-06-16T17:58:10Z) - Domain Adaptive Robotic Gesture Recognition with Unsupervised
Kinematic-Visual Data Alignment [60.31418655784291]
本稿では,マルチモダリティ知識,すなわちキネマティックデータとビジュアルデータを同時にシミュレータから実ロボットに伝達できる,教師なしドメイン適応フレームワークを提案する。
ビデオの時間的手がかりと、ジェスチャー認識に対するマルチモーダル固有の相関を用いて、トランスファー可能な機能を強化したドメインギャップを修復する。
その結果, 本手法は, ACCでは最大12.91%, F1scoreでは20.16%と, 実際のロボットではアノテーションを使わずに性能を回復する。
論文 参考訳(メタデータ) (2021-03-06T09:10:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。