論文の概要: Compositional Motion Generation from Demonstration with Object-Centric Neural Fields
- arxiv url: http://arxiv.org/abs/2607.07129v1
- Date: Wed, 08 Jul 2026 08:20:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 22:50:30.321427
- Title: Compositional Motion Generation from Demonstration with Object-Centric Neural Fields
- Title(参考訳): 物体中心ニューラル場を用いたデモからの構成運動生成
- Authors: Ahmet Ercan Tekden, Yasemin Bekiroglu,
- Abstract要約: 本稿では,ロボットの動作の合成モデリングを可能にする生成学習フレームワークを提案する。
我々は、標準の神経場と潜在条件の変形を統合するオブジェクト中心の神経表現のシーンを描画する。
シミュレーションでは,提案モデルを用いて長期操作タスクを完了させる。
- 参考スコア(独自算出の注目度): 1.4916971861796382
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Compositionality, by organizing complex behavior as combinations of simpler elements, enables robot learning that is scalable and data efficient. Leveraging this principle, we propose a generative learning-from-demonstration framework that enables compositional modeling of robotic behavior by connecting perception and motion through shared object-level representations. We render scenes from object-centric neural representations that integrate canonical neural fields with latent-conditioned deformations, capturing positional and geometric variations in a smooth, consistent, and interpretable way. For motion generation, a temporal mixture-of-experts (MoE) employs a gating mechanism to combine object-conditioned movement primitives over time, producing complete trajectories. This spatial-temporal compositionality maintains the data efficiency of movement primitives while grounding motion in visual structure, enabling systematic generalization across diverse scene configurations. In simulation, long-horizon manipulation tasks are successfully completed using the proposed model, which requires significantly less training data than other image-based baselines. Real-world experiments further demonstrate the method's robustness to noise, its ability to generalize at the category level through language-based segmentation models, and its capacity to operate directly on 3D scene representations.
- Abstract(参考訳): 構成性は、複雑な振る舞いを単純な要素の組み合わせとしてまとめることで、スケーラブルでデータ効率のよいロボット学習を可能にする。
本原理を応用して,オブジェクトレベルの共有表現を通して知覚と動きを結合することにより,ロボット行動の合成モデリングを可能にする生成学習フレームワークを提案する。
我々は、標準の神経場と潜在条件の変形を統合し、スムーズで一貫性があり、解釈可能な方法で位置的および幾何学的変動を捉えたオブジェクト中心の神経表現のシーンを描画する。
運動生成において、時間的混合(MoE)は、時間とともにオブジェクト条件の運動プリミティブを結合するゲーティング機構を使用し、完全な軌道を生成する。
この空間時間構成性は、視覚構造における動きを接地しながら、移動プリミティブのデータ効率を維持し、多様なシーン構成を体系的に一般化することを可能にする。
シミュレーションでは、画像ベースベースラインよりもトレーニングデータが少なく、提案モデルを用いて長距離操作タスクを成功させる。
実世界の実験では、この手法の雑音に対する堅牢性、言語に基づくセグメンテーションモデルによるカテゴリレベルでの一般化能力、そして3Dシーン表現を直接操作する能力がさらに実証されている。
関連論文リスト
- GenMatter: Perceiving Physical Objects with Generative Matter Models [50.121713214509604]
人間は、独立して移動可能な物質塊を構成する移動体をしっかりと分断する。
既存のコンピュータビジョンシステムは、様々な設定で機能する統一されたアプローチを欠いている。
階層的に低レベルの運動キューと高レベルの外観特徴を粒子にグループ化する生成モデルを提案する。
論文 参考訳(メタデータ) (2026-04-24T02:18:18Z) - ArtLLM: Generating Articulated Assets via 3D LLM [19.814132638278547]
ArtLLMは、完全な3Dメッシュから直接高品質な調音資産を生成するための新しいフレームワークである。
コアとなるのは,大規模な調音データセットに基づいてトレーニングされた,3Dマルチモーダルな大規模言語モデルだ。
実験の結果,ArtLLMは部品配置精度と接合予測の両方で最先端の手法を著しく上回ることがわかった。
論文 参考訳(メタデータ) (2026-03-01T15:07:46Z) - Kinematify: Open-Vocabulary Synthesis of High-DoF Articulated Objects [59.51185639557874]
本稿では,任意のRGB画像やテキスト記述から直接音声オブジェクトを合成するフレームワークであるKinematifyを紹介する。
提案手法は, 高DoFオブジェクトに対する運動的トポロジの推測と静的幾何からの関節パラメータの推定という2つの課題に対処する。
論文 参考訳(メタデータ) (2025-11-03T07:21:42Z) - HEIR: Learning Graph-Based Motion Hierarchies [30.232977288956814]
本研究では、データから直接構造化された解釈可能な動き関係を学習する一般的な階層的な動きモデリング手法を提案する。
グラフに基づく階層構造を用いて観測された動きを表現し、グローバルな絶対運動を親継承パターンと局所的な動き残差に明示的に分解する。
実験の結果,本手法は1次元および2次元の動作階層を再構成し,動的3次元スプレイティングシーンのベースラインよりもリアルで解釈可能な変形を生じさせることがわかった。
論文 参考訳(メタデータ) (2025-10-30T17:57:40Z) - GaussianArt: Unified Modeling of Geometry and Motion for Articulated Objects [4.717906057951389]
本稿では,3次元ガウスモデルを用いて幾何学と運動を共同でモデル化する統一表現を提案する。
この定式化により、運動分解の堅牢性が向上し、最大で20個の部分を持つ明瞭な物体をサポートする。
提案手法は, 広範囲な物体の形状復元と動き推定において, 常に優れた精度を達成できることを示す。
論文 参考訳(メタデータ) (2025-08-20T17:59:08Z) - IAAO: Interactive Affordance Learning for Articulated Objects in 3D Environments [56.85804719947]
IAAOは知的エージェントのための明示的な3Dモデルを構築するフレームワークで,対話を通して環境内の明瞭な物体の理解を得る。
マスク特徴とビュー一貫性ラベルを多視点画像から抽出し,まず3次元ガウススティング(3DGS)を用いて各オブジェクト状態の階層的特徴とラベルフィールドを構築する。
次に、3Dガウスプリミティブ上でオブジェクトと部分レベルのクエリを実行し、静的および明瞭な要素を識別し、大域的な変換と局所的な調音パラメータをアベイランスとともに推定する。
論文 参考訳(メタデータ) (2025-04-09T12:36:48Z) - Learning semantical dynamics and spatiotemporal collaboration for human pose estimation in video [3.2195139886901813]
マルチレベル意味論と多フレーム人間のポーズ推定を学習する新しいフレームワークを提案する。
具体的には、まずマルチタスクコンテキストを設計し、再構築戦略を示す。
この戦略は、光学(パッチ)立方体とフレームの特徴を徐々に隠蔽することにより、フレーム間の多時的意味関係を探索するモデルを刺激する。
論文 参考訳(メタデータ) (2025-02-15T00:35:34Z) - Relational Object-Centric Actor-Critic [44.99833362998488]
近年の研究では、アンタングルオブジェクト表現は、イメージベースでオブジェクト中心の強化学習タスクにおけるポリシー学習に役立つことが強調されている。
本稿では,アクタ批判的アプローチとモデルに基づくアプローチを統合した,オブジェクト中心強化学習アルゴリズムを提案する。
シミュレーションされた3次元ロボット環境と構成構造を持つ2次元環境において,本手法の評価を行った。
論文 参考訳(メタデータ) (2023-10-26T06:05:12Z) - Robust and Controllable Object-Centric Learning through Energy-based
Models [95.68748828339059]
我々の研究は概念的にシンプルで一般的なアプローチであり、エネルギーベースモデルを通してオブジェクト中心の表現を学習する。
既存のアーキテクチャに容易に統合でき、高品質なオブジェクト中心表現を効果的に抽出できることを示す。
論文 参考訳(メタデータ) (2022-10-11T15:11:15Z) - MoDi: Unconditional Motion Synthesis from Diverse Data [51.676055380546494]
多様な動きを合成する無条件生成モデルであるMoDiを提案する。
我々のモデルは、多様な、構造化されていない、ラベルなしのモーションデータセットから完全に教師なしの設定で訓練されている。
データセットに構造が欠けているにもかかわらず、潜在空間は意味的にクラスタ化可能であることを示す。
論文 参考訳(メタデータ) (2022-06-16T09:06:25Z) - Conditional Object-Centric Learning from Video [34.012087337046005]
我々は、リアルな合成シーンのための光の流れを予測するために、スロット注意を逐次拡張する。
我々は,このモデルの初期状態が,第1フレーム内の物体の質量の中心など,小さなヒントの集合に条件付けるだけで,インスタンスのセグメンテーションを大幅に改善できることを示す。
これらの利点は、トレーニング分布を超えて、新しいオブジェクト、新しいバックグラウンド、より長いビデオシーケンスに一般化される。
論文 参考訳(メタデータ) (2021-11-24T16:10:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。