論文の概要: SkillMemo: Expert-guided Skill Memory Framework for Compositional Embodied Manipulation
- arxiv url: http://arxiv.org/abs/2608.05970v1
- Date: Thu, 06 Aug 2026 12:46:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-07 17:43:06.752556
- Title: SkillMemo: Expert-guided Skill Memory Framework for Compositional Embodied Manipulation
- Title(参考訳): SkillMemo: 作曲操作のためのエキスパートガイド付きスキルメモリフレームワーク
- Abstract要約: Diffusion Policy (DP) や Vision-Language-Action (VLA) モデルを含む身体的視覚運動モデルは、ロボット操作ベンチマークで有望な性能を示した。
我々は,長時間の実証を潜在原子スキルに暗黙的に分解するスキルベースメモリ(SkillMemo)フレームワークを提案する。
- 参考スコア(独自算出の注目度): 72.14179740056073
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Embodied visuomotor models, including Diffusion Policy (DP) and Vision-Language-Action (VLA) models, have demonstrated promising performance on robotic manipulation benchmarks. However, their potential remains fundamentally constrained by the scarcity of large-scale embodied trajectory datasets, leading to insufficient compositional generalization in out-of-distribution (OOD) scenarios with limited capability to capture reusable skill structures. To address this limitation, we propose Skill-Based Memory (SkillMemo) framework that implicitly decomposes long-horizon demonstrations into latent atomic skills and integrates skill-level features into a dynamic episodic memory bank for solving compositional tasks. Specifically, we first introduce an expert-guided trajectory segmentation module built upon a Mixture-of-Experts (MoE) architecture, which implicitly partitions trajectories into distinct skill primitives represented by learned gating coefficients. We further design a skill-level episodic memory architecture that stores compact skill representations as retrievable key-value pairs. During inference, the memory bank retrieves the most relevant skill primitives which are subsequently fused with the model's current gating distribution, providing a robust contextual prior to refine action predictions. Extensive experiments on the simulation benchmark and real-world manipulation tasks demonstrate that SkillMemo consistently enhances both DP and VLA backbones, achieving state-of-the-art performance and outperforming $π_{0.5}$, while exhibiting strong compositional generalization to unseen task configurations.
- Abstract(参考訳): Diffusion Policy (DP) や Vision-Language-Action (VLA) モデルを含む身体的視覚運動モデルは、ロボット操作ベンチマークで有望な性能を示した。
しかし、それらのポテンシャルは、大規模なエンボディード・トラジェクトリー・データセットの不足によって基本的に制限されており、再利用可能なスキル構造を捕捉する能力に制限のあるアウト・オブ・ディストリビューション(OOD)のシナリオでは、構成上の一般化が不十分である。
この制限に対処するため、我々は、長軸デモを潜在原子スキルに暗黙的に分解するスキルベースメモリ(SkillMemo)フレームワークを提案し、スキルレベルの機能を構成課題を解決するための動的エピソードメモリバンクに統合する。
具体的には、まず、Mixture-of-Experts (MoE)アーキテクチャ上に構築された専門家誘導軌道分割モジュールを導入し、学習ゲーティング係数で表される異なるスキルプリミティブにトラジェクトリを暗黙的に分割する。
さらに、コンパクトなスキル表現を検索可能なキーと値のペアとして格納する、スキルレベルのエピソードメモリアーキテクチャを設計する。
推論中、メモリバンクは、その後モデルの現在のゲーティング分布と融合した最も関連性の高いスキルプリミティブを検索し、アクション予測を洗練する前に堅牢なコンテキストを提供する。
シミュレーションベンチマークと実世界の操作タスクに関する大規模な実験により、SkillMemoはDPとVLAの両方のバックボーンを一貫して強化し、最先端のパフォーマンスを達成し、π_{0.5}$を上回りながら、目に見えないタスク構成に強い構成的一般化を示した。
関連論文リスト
- Decoupling the Declarative from the Procedural in Vision-Language-Action Models [65.22639791239932]
オブジェクト固有のデモから振る舞いをクローンするように訓練されたポリシーは、そのオブジェクトを超えて一般化されなければならない。
情報フローを再構成した新しいビジョン・ランゲージ・アクションモデルであるw$2$VLAを提案する。
最先端のVLAとは異なり、我々のモジュラーアプローチは知識表現の分離に成功している。
論文 参考訳(メタデータ) (2026-06-19T14:43:58Z) - Tying the Loop -- Tied Expert Layers in Mixture-of-Experts Language Models [50.34585122347149]
これは連続的なトランスフォーマー層にまたがるエキスパートパラメータを共有するアーキテクチャ修正である。
我々は、OLMoE、Qwen3、DeepSeekスタイルのMoEなど、一般的な最先端アーキテクチャにおけるこのアプローチを評価した。
論文 参考訳(メタデータ) (2026-06-15T15:08:09Z) - Eigenvectors of Experts are Training-free Non-collapsing Routers [14.774596844618396]
SMOE(Sparse Mixture of Experts)アーキテクチャは、入力トークンを専門専門家のサブセットにルーティングすることで、LLM(Large Language Models)のトレーニング効率を向上させる。
彼らの顕著な成功にもかかわらず、SMoEモデルのトレーニングと推論の両方が専門家の崩壊問題に悩まされている。
本稿では, 崩壊問題に対処するために, 専門家のスペクトル特性を利用する新しい, トレーニング不要なフレームワークであるSingular Value Decomposition SMoEを提案する。
論文 参考訳(メタデータ) (2026-05-29T08:27:10Z) - CP-MoE: Consistency-Preserving Mixture-of-Experts for Continual Learning [16.033361968793162]
大型言語モデル (LLM) と視覚言語モデル (VLM) における連続学習の大きな障害は、依然として破滅的な忘れ方である。
CP-MoEは、タスク固有の初期更新をキャプチャし、安定した専門家への統合をガイドする、一貫した専門家を中心に構築された継続的学習フレームワークである。
CP-MoE を LLM と VLM をベースとした MoE モデルを用いて一様および多モード連続学習ベンチマークで検証する。
論文 参考訳(メタデータ) (2026-05-18T06:31:14Z) - ECHO: Continuous Hierarchical Memory for Vision-Language-Action Models [40.14860028616163]
メモリ容量は、長期操作タスクにおけるビジョン・ランゲージ・アクション(VLA)モデルの性能を決定する重要な要因である。
本稿では,連続階層空間内で動作する新しいメモリフレームワークECHOを提案する。
双曲型オートエンコーダを用いることで、ECHOはVLA隠された状態をこの空間にマッピングする。
論文 参考訳(メタデータ) (2026-05-09T13:06:33Z) - $M^2$-VLA: Boosting Vision-Language Models for Generalizable Manipulation via Layer Mixture and Meta-Skills [25.17452377052361]
現在のVision-Language-Action(VLA)モデルは、主にエンドツーエンドの微調整に依存している。
本稿では,汎用VLMがロボット操作の強力なバックボーンとして機能できることを実証するM2$-VLAを提案する。
これを解決するために、密接な意味的特徴からタスククリティカル情報を選択的に抽出するMixture of Layers(MoL)戦略を導入する。
論文 参考訳(メタデータ) (2026-04-27T08:44:12Z) - Going with the Flow: Koopman Behavioral Models as Implicit Planners for Visuo-Motor Dexterity [1.6865201067073452]
本稿では,一様挙動モデル (UBMs) を紹介する。
Koopman-UBM は UBM の最初のインスタンス化であり、潜在視覚的特徴と固有受容的特徴の結合フローが構造化線形システムによって制御される統一表現を学習する。
論文 参考訳(メタデータ) (2026-02-07T07:18:00Z) - Foundation Model for Skeleton-Based Human Action Understanding [56.89025287217221]
本稿では,統一骨格に基づくDense Representation Learningフレームワークを提案する。
USDRLはトランスフォーマーベースのDense Spatio-Temporal (DSTE)、Multi-Grained Feature Deorrelation (MG-FD)、Multi-Perspective Consistency Training (MPCT)で構成されている。
論文 参考訳(メタデータ) (2025-08-18T02:42:16Z) - ContextFormer: Redefining Efficiency in Semantic Segmentation [48.81126061219231]
畳み込み法は、局所的な依存関係をうまく捉えるが、長距離関係に苦慮する。
ビジョントランスフォーマー(ViT)は、グローバルなコンテキストキャプチャでは優れるが、高い計算要求によって妨げられる。
我々は,リアルタイムセマンティックセグメンテーションの効率,精度,堅牢性のバランスをとるために,CNN と ViT の強みを活用したハイブリッドフレームワーク ContextFormer を提案する。
論文 参考訳(メタデータ) (2025-01-31T16:11:04Z) - Skeleton2vec: A Self-supervised Learning Framework with Contextualized
Target Representations for Skeleton Sequence [56.092059713922744]
予測対象として高レベルな文脈化機能を使用することで,優れた性能が得られることを示す。
具体的には、シンプルで効率的な3D行動表現学習フレームワークであるSkeleton2vecを提案する。
提案するSkeleton2vecは,従来の手法より優れ,最先端の結果が得られる。
論文 参考訳(メタデータ) (2024-01-01T12:08:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。