論文の概要: Kitchen Robotic Manipulation utilizing Foundation Models
- arxiv url: http://arxiv.org/abs/2608.04042v1
- Date: Tue, 04 Aug 2026 05:07:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.400057
- Title: Kitchen Robotic Manipulation utilizing Foundation Models
- Title(参考訳): 基礎モデルを用いたキッチンロボットマニピュレーション
- Abstract要約: このパイプラインは、オープンボキャブラリオブジェクト検出、マルチビューセグメンテーション、インスタンス認識3D再構成、および6次元ポーズ推定と把握計画のための2D-3D特徴融合戦略を統合する。
最高のパフォーマンス構成は、20ステージのキッチンベンチマークで89.12%のADIを達成する。
- 参考スコア(独自算出の注目度): 7.653086213350448
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Deploying robots in everyday human environments requires perception systems that are both robust and adaptable to diverse, dynamic conditions. In this work, we present a modular perception pipeline for household manipulation tasks, with a focus on dishware handling in kitchen environments. The pipeline integrates open-vocabulary object detection, multi-view segmentation, instance-aware 3D reconstruction, and a 2D-3D feature fusion strategy for 6D pose estimation and grasp planning. Its modular design enables systematic substitution of multiple visual and geometric foundation models, allowing us to identify the best-performing configuration through extensive evaluation on a custom kitchen dataset. The best-performing configuration (LLMDet + SAMv2 + DINOv2 + GeoTransformer) achieves an ADI of 89.12\% on the 20-scene kitchen benchmark with cluttered and occluded conditions. Furthermore, real-world demonstrations confirm that the best configuration can be deployed on physical robots without environment-specific retraining, successfully executing tasks such as sink-to-dishwasher transfer and cup stacking. It validates the adaptability and scalability of the pipeline and highlights its potential as a practical framework for household robotic systems. Our code and supplementary materials are available at https://raivlab.github.io/FM_kitchen .
- Abstract(参考訳): ロボットを日常の人間環境に配置するには、多様な動的条件に頑健で適応可能な知覚システムが必要である。
本研究では,キッチン環境における食器類処理に焦点をあてた,家庭用操作タスクのためのモジュール型認識パイプラインを提案する。
このパイプラインは、オープンボキャブラリオブジェクト検出、マルチビューセグメンテーション、インスタンス認識3D再構成、および6次元ポーズ推定と把握計画のための2D-3D特徴融合戦略を統合する。
そのモジュラー設計により、複数の視覚的および幾何学的基礎モデルの体系的な置換が可能となり、カスタムキッチンデータセットの広範な評価により、最も優れた構成を特定できる。
最高のパフォーマンス設定(LLMDet + SAMv2 + DINOv2 + GeoTransformer)は、乱雑で閉塞状態の20ステージのキッチンベンチマークで89.12\%のADIを達成する。
さらに、実世界のデモでは、環境固有のリトレーニングなしに、物理的なロボットに最適な設定をデプロイできることを確認し、シンク・トゥ・ディッシュワッシャーの転送やカップの積み上げといったタスクをうまく実行した。
パイプラインの適応性とスケーラビリティを検証し、家庭用ロボットシステムの実践的なフレームワークとしての可能性を強調している。
私たちのコードと補足資料はhttps://raivlab.github.io/FM_kitchen で公開されています。
関連論文リスト
- RoboCousin: Build Your Own Simulation Playground for Robust Bimanual Robotic Manipulation [16.581929671943325]
双方向操作ポリシーは、大規模で多様なトレーニングデータセットを必要とする。
既存のパイプラインは通常、クローズドアセットライブラリと事前に定義されたシーン内で動作します。
本稿ではシミュレーションベースのデータ生成プラットフォームであるRoboCousinを紹介する。
論文 参考訳(メタデータ) (2026-09-08T07:13:07Z) - GASE: Gaussian Splatting-Based Automated System for Reconstructing Embodied-Simulation Environments [63.222920701596564]
実世界での実施エージェントの訓練には熟練したオペレーターと高価なハードウェアが必要である。
シミュレーション環境は、大規模で費用対効果の高いデータ拡張を可能にすることで、魅力的な代替手段を提供する。
シミュレーションシーンを最小限のsim-to-realギャップで高速に構築することは、ロボット学習において重要な目標となっている。
論文 参考訳(メタデータ) (2026-06-16T05:00:42Z) - AFUN: Towards an Affordance Foundation Model for Functionality Understanding [12.890216832485647]
我々は,機能理解のための手頃な基礎モデルに向けたステップとして,我々のモデルを提示する。
我々は、異種ロボット、人間、シミュレーション、現実世界のスキャンデータを共有価格スキーマに変換する大規模な標準化データパイプラインを構築します。
私たちのモデルは、4つのベンチマークから8つのテストセットにまたがる大きなマージンで、すべてのベースラインを上回ります。
論文 参考訳(メタデータ) (2026-06-01T17:50:16Z) - Asset Harvester: Extracting 3D Assets from Autonomous Driving Logs for Simulation [63.01022057888141]
Asset Harvesterはイメージ・ツー・3Dモデルとエンドツーエンドのパイプラインで、実際の運転ログからスパース・イン・ザ・ワン・オブジェクトの観察を完全なシミュレーション可能なアセットに変換する。
SparseViewDiTは、限定角度ビューやその他の実世界のデータ課題に対処するように明示的に設計されている。
論文 参考訳(メタデータ) (2026-04-20T16:20:57Z) - ABot-M0: VLA Foundation Model for Robotic Manipulation with Action Manifold Learning [31.000965640377128]
ABot-M0は、システマティックデータキュレーションパイプラインを構築するフレームワークである。
これは不均一な生データを統一的で効率的な表現にエンドツーエンドに変換することを可能にする。
ABot-M0はデュアルストリーム機構を通じてモジュール認識をサポートする。
論文 参考訳(メタデータ) (2026-02-11T16:47:01Z) - DeFM: Learning Foundation Representations from Depth for Robotics [49.77188649197404]
DeFMはロボットアプリケーションのための深度画像に基づいて訓練された自己教師型基礎モデルである。
DeFMは幾何学的および意味的な表現を学び、様々な環境、タスク、センサーに一般化する。
最先端の性能を達成し、シミュレーションから実環境への強力な一般化を実証する。
論文 参考訳(メタデータ) (2026-01-26T19:45:31Z) - Mirage2Matter: A Physically Grounded Gaussian World Model from Video [87.9732484393686]
我々は、グラフィック駆動の世界モデリングおよびシミュレーションフレームワークであるSimulate Anythingを紹介する。
実世界の環境を3次元ガウススプレイティング(3DGS)による写実的シーン表現に再構築する。
次に、生成モデルを利用して、物理的に現実的な表現を復元し、精度校正ターゲットを介してシミュレーション環境に統合する。
論文 参考訳(メタデータ) (2026-01-24T07:43:57Z) - SceneFoundry: Generating Interactive Infinite 3D Worlds [22.60801815197924]
SceneFoundryは、機能的な家具を備えたアパートスケールの3Dワールドを生成する言語誘導拡散フレームワークである。
本フレームワークは,多様なシーンタイプや環境にまたがって,構造的に妥当でセマンティック・コヒーレントで,機能的にインタラクティブな環境を生成する。
論文 参考訳(メタデータ) (2026-01-09T14:33:10Z) - URDF-Anything: Constructing Articulated Objects with 3D Multimodal Language Model [76.08429266631823]
3次元マルチモーダル大言語モデル(MLLM)に基づくエンドツーエンドの自動再構築フレームワークを提案する。
URDF-Anythingは、ポイントクラウドとテキストマルチモーダル入力に基づく自己回帰予測フレームワークを使用して、幾何学的セグメンテーションと運動論的パラメータ予測を協調的に最適化する。
シミュレーションと実世界の両方のデータセットの実験は、我々の手法が既存の手法よりも大幅に優れていることを示した。
論文 参考訳(メタデータ) (2025-11-02T13:45:51Z) - Optimizing Grasping in Legged Robots: A Deep Learning Approach to Loco-Manipulation [0.6533458718563319]
本稿では,腕を備えた四足歩行の把握能力を高めるための枠組みを提案する。
そこで我々は,ジェネシスシミュレーション環境内にパイプラインを構築し,共通物体の把握試行の合成データセットを生成する。
このデータセットは、オンボードのRGBとディープカメラからのマルチモーダル入力を処理するU-Netのようなアーキテクチャで、カスタムCNNのトレーニングに使用された。
四脚ロボットの完全な枠組みを検証した。
論文 参考訳(メタデータ) (2025-08-24T17:47:56Z) - RoboPearls: Editable Video Simulation for Robot Manipulation [81.18434338506621]
RoboPearlsは、ロボット操作のための編集可能なビデオシミュレーションフレームワークである。
3D Gaussian Splatting (3DGS)に基づいて構築されたRoboPearlsは、フォトリアリスティックでビュー一貫性のあるシミュレーションの構築を可能にする。
我々は、RLBench、COLOSSEUM、Ego4D、Open X-Embodiment、現実世界のロボットなど、複数のデータセットやシーンで広範な実験を行う。
論文 参考訳(メタデータ) (2025-06-28T05:03:31Z) - Mixed Diffusion for 3D Indoor Scene Synthesis [55.94569112629208]
提案するMiDiffusionは,可塑性3次元屋内シーンを合成するための混合離散連続拡散モデルである。
床条件の3次元シーン合成において,最先端の自己回帰モデルおよび拡散モデルより優れることを示す。
論文 参考訳(メタデータ) (2024-05-31T17:54:52Z) - Learning to Rearrange Deformable Cables, Fabrics, and Bags with
Goal-Conditioned Transporter Networks [36.90218756798642]
ケーブル、布、バッグなどの変形可能な物体を再配置し、操作することは、ロボット操作における長年の課題である。
1D, 2D, 3Dの変形可能な構造を持つシミュレーションベンチマークスイートを開発した。
本稿では,ロボット操作学習のためのモデルアーキテクチャであるTransporter Networksに目標条件を組み込むことを提案する。
論文 参考訳(メタデータ) (2020-12-06T22:21:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。