論文の概要: CLASP: Closed-loop Asynchronous Spatial Perception for Open-vocabulary Desktop Object Grasping
- arxiv url: http://arxiv.org/abs/2604.11320v1
- Date: Mon, 13 Apr 2026 11:22:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-14 20:13:16.498271
- Title: CLASP: Closed-loop Asynchronous Spatial Perception for Open-vocabulary Desktop Object Grasping
- Title(参考訳): CLASP:Open-vocabulary Desktop Object Graspingのためのクローズドループ非同期空間知覚
- Authors: Yiran Ling, Wenxuan Li, Siying Dong, Yize Zhang, Xiaoyao Huang, Jing Jiang, Ruonan Li, Jie Liu,
- Abstract要約: 本稿では,マルチモーダル認識,論理的推論,状態反射フィードバックを統合した非同期クローズドループフレームワークを提案する。
提案手法は多種多様な物体をまたいだ顕著な一般化を示し, sim-to-realのギャップを埋め, 例外的な堅牢性を提供する。
- 参考スコア(独自算出の注目度): 11.536272883557041
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Robot grasping of desktop object is widely used in intelligent manufacturing, logistics, and agriculture.Although vision-language models (VLMs) show strong potential for robotic manipulation, their deployment in low-level grasping faces key challenges: scarce high-quality multimodal demonstrations, spatial hallucination caused by weak geometric grounding, and the fragility of open-loop execution in dynamic environments. To address these challenges, we propose Closed-Loop Asynchronous Spatial Perception(CLASP), a novel asynchronous closed-loop framework that integrates multimodal perception, logical reasoning, and state-reflective feedback. First, we design a Dual-Pathway Hierarchical Perception module that decouples high-level semantic intent from geometric grounding. The design guides the output of the inference model and the definite action tuples, reducing spatial illusions. Second, an Asynchronous Closed-Loop Evaluator is implemented to compare pre- and post-execution states, providing text-based diagnostic feedback to establish a robust error-correction loop and improving the vulnerability of traditional open-loop execution in dynamic environments. Finally, we design a scalable multi-modal data engine that automatically synthesizes high-quality spatial annotations and reasoning templates from real and synthetic scenes without human teleoperation. Extensive experiments demonstrate that our approach significantly outperforms existing baselines, achieving an 87.0% overall success rate. Notably, the proposed framework exhibits remarkable generalization across diverse objects, bridging the sim-to-real gap and providing exceptional robustness in geometrically challenging categories and cluttered scenarios.
- Abstract(参考訳): 視覚言語モデル(VLM)はロボット操作の強い可能性を示しているが、低レベル把握への展開は、高品質なマルチモーダルなデモの欠如、弱い幾何学的接地による空間幻覚、動的環境におけるオープンループ実行の脆弱さといった大きな課題に直面している。
これらの課題に対処するため,我々は,マルチモーダル認識,論理的推論,状態反射フィードバックを統合した新しい非同期クローズドループフレームワークであるClosed-Loop Asynchronous Spatial Perception (CLASP)を提案する。
まずDual-Pathway Hierarchical Perceptionモジュールを設計し、幾何学的接地から高レベルの意味的意図を分離する。
この設計は推論モデルと定動作タプルの出力をガイドし、空間錯覚を低減させる。
第二に、非同期クローズドループ評価器は、実行前状態と実行後状態を比較し、テキストベースの診断フィードバックを提供することで、堅牢なエラー訂正ループを確立し、動的環境における従来のオープンループ実行の脆弱性を改善する。
最後に,人間の遠隔操作を伴わない実シーンや合成シーンから高品質な空間アノテーションと推論テンプレートを自動的に合成するスケーラブルなマルチモーダルデータエンジンを設計する。
大規模な実験は、我々のアプローチが既存のベースラインを著しく上回り、全体の成功率87.0%に達することを示した。
特に,本提案フレームワークは,多種多様な対象にまたがる顕著な一般化を示し,Sim-to-realギャップをブリッジし,幾何学的に難解なカテゴリや散在するシナリオにおいて,例外的な堅牢性を提供する。
関連論文リスト
- ManipArena: Comprehensive Real-world Evaluation of Reasoning-Oriented Generalist Robot Manipulation [66.02142169323521]
Vision-Language-ActionモデルとWorld Modelは最近、汎用ロボットインテリジェンスのための有望なパラダイムとして登場した。
既存のベンチマークは、主にシミュレータ中心であり、制御性を提供するが、知覚ノイズによって引き起こされる現実のギャップを捉えることができない。
シミュレーションと実世界の実行を橋渡しする標準化された評価フレームワークであるManipArenaを紹介する。
論文 参考訳(メタデータ) (2026-03-30T15:06:41Z) - AGILE: Hand-Object Interaction Reconstruction from Video via Agentic Generation [45.753757870577196]
本稿では,対話学習のためのエージェント生成にパラダイムを転換する,堅牢なフレームワークAGILEを紹介する。
我々はAGILEがグローバルな幾何学的精度でベースラインを上回り、先行技術が頻繁に崩壊する挑戦的なシーケンスに対して、例外的な堅牢性を証明していることを示す。
論文 参考訳(メタデータ) (2026-02-04T15:42:58Z) - TRACER: Texture-Robust Affordance Chain-of-Thought for Deformable-Object Refinement [37.77903164878976]
TRACER は Texture-Robust Affordance Chain-of- Thought with dEformable-object Refinement framework である。
セマンティック推論から外見が損なわれ、物理的に一貫した機能領域の洗練まで、階層横断的なマッピングを提供する。
Fine-AGDDO15データセットと実世界のロボットプラットフォームで実施された実験は、TRACERが精度を著しく向上することを示した。
論文 参考訳(メタデータ) (2026-01-28T03:12:18Z) - Generalizable Geometric Prior and Recurrent Spiking Feature Learning for Humanoid Robot Manipulation [90.90219129619344]
本稿では,スパイキング機能を備えたR-prior-S, Recurrent Geometric-priormodal Policyを提案する。
物理的現実の高レベル推論を基礎として、軽量な2次元幾何学的帰納バイアスを利用する。
ロボット行動生成におけるデータ効率問題に対して,再帰的適応スパイクネットワークを導入する。
論文 参考訳(メタデータ) (2026-01-13T23:36:30Z) - Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy [73.75271615101754]
本稿では,Transformerアーキテクチャを活用した拡張性のあるフレームワークであるDitaについて紹介する。
Ditaはコンテキスト内コンディショニング(context conditioning)を採用しており、歴史的観察から生の視覚トークンと識別されたアクションをきめ細やかなアライメントを可能にする。
Ditaは、さまざまなカメラパースペクティブ、観察シーン、タスク、アクションスペースの横断的なデータセットを効果的に統合する。
論文 参考訳(メタデータ) (2025-03-25T15:19:56Z) - EmbodiedVSR: Dynamic Scene Graph-Guided Chain-of-Thought Reasoning for Visual Spatial Tasks [24.41705039390567]
EmbodiedVSR (Embodied Visual Space Reasoning) は動的シーングラフ誘導型Chain-of-Thought (CoT)推論を統合する新しいフレームワークである。
本手法はタスク固有の微調整なしでゼロショット空間推論を可能にする。
実験により,我々のフレームワークは,既存のMLLM法よりも精度と推論コヒーレンスにおいて優れていることが示された。
論文 参考訳(メタデータ) (2025-03-14T05:06:07Z) - Diffusion Transformer Policy [48.50988753948537]
本稿では,拡散変圧器ポリシー(Diffusion Transformer Policy)と呼ばれる多モード拡散変圧器を提案し,連続的なエンドエフェクタ動作をモデル化する。
トランスのスケーリング機能を活用することで、提案手法は、多種多様なロボットデータセットにわたる継続的エンドエフェクタアクションを効果的にモデル化することができる。
論文 参考訳(メタデータ) (2024-10-21T12:43:54Z) - Efficient High-Resolution Visual Representation Learning with State Space Model for Human Pose Estimation [60.80423207808076]
高解像度の視覚表現を維持しながら長距離依存関係をキャプチャすることは、人間のポーズ推定のような密集した予測タスクに不可欠である。
マルチスケールの畳み込み操作で視覚状態空間モデルを拡張する動的ビジュアル状態空間(DVSS)ブロックを提案する。
HRVMambaは効率的な高分解能表現学習のための新しいモデルである。
論文 参考訳(メタデータ) (2024-10-04T06:19:29Z) - Language-guided Robot Grasping: CLIP-based Referring Grasp Synthesis in
Clutter [14.489086924126253]
本研究は, 乱雑な場面において, 自然言語で参照される物体のつかみポーズを予測する, つかみ合成を参照する作業に焦点をあてる。
既存のアプローチでは、参照対象をまずセグメント化し、適切な把握を提案し、自然屋内シーンの複雑さを捉えないプライベートデータセットやシミュレータで評価される。
本稿では,CLIPの視覚的接地機能を利用して,画像とテキストのペアから直接合成を学習する新しいエンド・ツー・エンド・モデル(CROG)を提案する。
論文 参考訳(メタデータ) (2023-11-09T22:55:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。