論文の概要: Object-Centric Conditioning for Visuomotor Flow Matching
- arxiv url: http://arxiv.org/abs/2609.24155v2
- Date: Tue, 29 Sep 2026 09:49:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:46.510232
- Title: Object-Centric Conditioning for Visuomotor Flow Matching
- Title(参考訳): ビジュモータフローマッチングのための物体中心条件付け
- Abstract要約: SlotFlowは、堅牢なビジュモータ操作のためのオブジェクト中心のフローマッチングポリシーである。
視力障害と重度の空間摂動下での頑健性の改善を示した。
- 参考スコア(独自算出の注目度): 24.0519425670241
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Robot visuomotor policies are commonly formulated as autoregressive, diffusion-based, or more recently, flow matching models. Among them, Action-to-Action (A2A) flow matching improves inference efficiency by initializing generation from historical action priors rather than stochastic noise. However, stale historical motion patterns and entangled global visual representations can jointly reduce robustness under spatial out-of-distribution (OOD) shifts and visual distractors. In this work, we propose SlotFlow, an object-centric flow matching policy for robust visuomotor manipulation. SlotFlow decouples scene observations into semantic ("what") features and lightweight image-plane spatial ("where") cues to provide object-aware policy conditioning and current-state grounding. The semantic representation suppresses irrelevant background correlations, while the spatial cue improves adaptation to shifted object configurations. Extensive simulation and real-world experiments demonstrate improved robustness under visual distractors and severe spatial perturbations while preserving the low-step inference efficiency of A2A. Controlled initialization and perception ablations further identify object-centric grounding as a major source of the gains and show that it complements, rather than replaces, useful historical motion priors.
- Abstract(参考訳): ロボットビジュモータポリシーは、一般的に自己回帰的、拡散ベース、あるいは最近ではフローマッチングモデルとして定式化されている。
このうち、アクション・ツー・アクション(A2A)フローマッチングは、確率ノイズではなく、過去のアクション先行から生成されることを初期化することにより、推論効率を向上させる。
しかし、歴史的動きパターンや絡み合ったグローバルな視覚表現は、空間的アウト・オブ・ディストリビューション(OOD)シフトと視覚的障害の下で、強靭性を共同的に減少させることができる。
本研究では,ロバストなビジュモータ操作のためのオブジェクト中心フローマッチングポリシであるSlotFlowを提案する。
SlotFlowはシーンの観察をセマンティックな特徴("What")と軽量な画像平面空間("where")に切り離し、オブジェクト対応のポリシー条件と現状のグラウンドを提供する。
意味表現は無関係な背景相関を抑えるが、空間キューはシフトした対象構成への適応を改善する。
広汎なシミュレーションと実世界の実験により、A2Aの低ステップ推論効率を保ちながら、視覚的イントラクタと重度の空間摂動下でのロバスト性の改善が示された。
制御された初期化と知覚の短縮により、オブジェクト中心の接地は利得の主要な源となり、それが有用な歴史的な前兆を置き換えるのではなく、補完することを示している。
関連論文リスト
- MSACT: Multistage Spatial Alignment for Stable Low-Latency Fine Manipulation [4.439585594082787]
実世界の微視的操作、特に双方向操作では、低レイテンシ制御と安定した視覚的位置決めが必要となる。
ACTのようなアクションチャンキングポリシーは、低レイテンシの実行とデータ効率を可能にするが、空間的一貫性を明示することなく、密集した視覚的特徴に依存している。
安定な2次元アテンションポイントを抽出し,時間的アライメントロスを伴う将来のアテンションシーケンスを共同で予測する多段階空間アテンションモジュールを提案する。
論文 参考訳(メタデータ) (2026-05-01T07:35:15Z) - Enhancing Eye Feature Estimation from Event Data Streams through Adaptive Inference State Space Modeling [68.1289208938377]
イベントベースのデータストリームから目の特徴抽出を効率的かつ低エネルギーで行うことができる。
本稿では,特徴抽出のための新しいアーキテクチャである強調型推論状態空間モデル(AISSM)を紹介する。
また、トレーニング効率を向上させる新しい学習手法を開発・評価する。
論文 参考訳(メタデータ) (2026-03-14T18:47:08Z) - SuperFlow++: Enhanced Spatiotemporal Consistency for Cross-Modal Data Pretraining [62.433137130087445]
SuperFlow++は、連続するカメラペアを使用して事前トレーニングと下流タスクを統合する新しいフレームワークである。
SuperFlow++は様々なタスクや運転条件で最先端のメソッドよりも優れています。
強力な一般化性と計算効率により、SuperFlow++は、自動運転におけるデータ効率の高いLiDARベースの認識のための新しいベンチマークを確立する。
論文 参考訳(メタデータ) (2025-03-25T17:59:57Z) - ALOcc: Adaptive Lifting-Based 3D Semantic Occupancy and Cost Volume-Based Flow Predictions [91.55655961014027]
シーン理解には3次元セマンティック占有とフロー予測が不可欠である。
本稿では,3つの改善点を目標とした視覚ベースのフレームワークを提案する。
我々の純粋な畳み込みアーキテクチャは、セマンティック占有率とジョイントセマンティックフロー予測の両方のために、複数のベンチマーク上で新しいSOTA性能を確立する。
論文 参考訳(メタデータ) (2024-11-12T11:32:56Z) - STARFlow: Spatial Temporal Feature Re-embedding with Attentive Learning for Real-world Scene Flow [5.476991379461233]
両ユークリッド空間における全点対に一致する大域的注意流埋め込みを提案する。
我々は、新しいドメイン適応損失を利用して、合成から実世界への動き推論のギャップを埋める。
提案手法は,実世界のLiDARスキャンデータセットにおいて特に顕著な結果を得て,各種データセットの最先端性能を実現する。
論文 参考訳(メタデータ) (2024-03-11T04:56:10Z) - Regularizing Self-supervised 3D Scene Flows with Surface Awareness and Cyclic Consistency [3.124750429062221]
2つの新たな一貫性損失を導入し、クラスタを拡大し、異なるオブジェクトに分散するのを防ぐ。
提案した損失はモデル独立であり、既存のモデルの性能を大幅に向上させるためにプラグアンドプレイ方式で使用できる。
また,4つの標準センサ一様駆動データセット上で,フレームワークの有効性と一般化能力を示す。
論文 参考訳(メタデータ) (2023-12-12T11:00:39Z) - Adaptive Multi-source Predictor for Zero-shot Video Object Segmentation [68.56443382421878]
ゼロショットビデオオブジェクトセグメンテーション(ZVOS)のための新しい適応型マルチソース予測器を提案する。
静的オブジェクト予測器では、RGBソースは、同時に深度および静注ソースに変換される。
実験の結果,提案モデルは3つのZVOSベンチマークにおいて最先端の手法よりも優れていることがわかった。
論文 参考訳(メタデータ) (2023-03-18T10:19:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。