論文の概要: Habitat 2.0: Training Home Assistants to Rearrange their Habitat
- arxiv url: http://arxiv.org/abs/2106.14405v1
- Date: Mon, 28 Jun 2021 05:42:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2021-06-29 17:44:41.140164
- Title: Habitat 2.0: Training Home Assistants to Rearrange their Habitat
- Title(参考訳): Habitat 2.0: ホームアシスタントのトレーニング
- Abstract要約: インタラクティブな3D環境で仮想ロボットを訓練するためのシミュレーションプラットフォームHabitat 2.0(H2.0)を紹介する。
エンボディされたAIスタックのすべてのレベル – データ、シミュレーション、ベンチマークタスク – にコントリビューションを行います。
- 参考スコア(独自算出の注目度): 122.54624752876276
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We introduce Habitat 2.0 (H2.0), a simulation platform for training virtual
robots in interactive 3D environments and complex physics-enabled scenarios. We
make comprehensive contributions to all levels of the embodied AI stack - data,
simulation, and benchmark tasks. Specifically, we present: (i) ReplicaCAD: an
artist-authored, annotated, reconfigurable 3D dataset of apartments (matching
real spaces) with articulated objects (e.g. cabinets and drawers that can
open/close); (ii) H2.0: a high-performance physics-enabled 3D simulator with
speeds exceeding 25,000 simulation steps per second (850x real-time) on an
8-GPU node, representing 100x speed-ups over prior work; and, (iii) Home
Assistant Benchmark (HAB): a suite of common tasks for assistive robots (tidy
the house, prepare groceries, set the table) that test a range of mobile
manipulation capabilities. These large-scale engineering contributions allow us
to systematically compare deep reinforcement learning (RL) at scale and
classical sense-plan-act (SPA) pipelines in long-horizon structured tasks, with
an emphasis on generalization to new objects, receptacles, and layouts. We find
that (1) flat RL policies struggle on HAB compared to hierarchical ones; (2) a
hierarchy with independent skills suffers from 'hand-off problems', and (3) SPA
pipelines are more brittle than RL policies.
- Abstract(参考訳): 仮想ロボットをインタラクティブな3d環境や複雑な物理シナリオで訓練するためのシミュレーションプラットフォームであるhabitat 2.0(h2.0)を紹介する。
エンボディされたAIスタックのすべてのレベル – データ、シミュレーション、ベンチマークタスクに包括的なコントリビューションを行います。
具体的には、 (i) replicacad: a artist-authored, annotated, reconfigurable 3d dataset of apartments (matching real spaces) with articulated objects (例えば)。
キャビネットと引き出しの開閉が可能なキャビネット) h2.0: 8-gpuノード上で毎秒25,000のシミュレーションステップ(リアルタイム850倍)を超える高速で、以前の作業よりも100倍のスピードアップを表現できる、高性能な物理可能な3dシミュレータ。
これらの大規模エンジニアリングコントリビューションにより、大規模での深層強化学習(RL)と長距離構造化タスクにおける古典的センスプランクト(SPA)パイプラインを体系的に比較することができ、新しいオブジェクト、レセプタクル、レイアウトへの一般化に重点を置いている。
その結果,(1) フラットなRL政策は階層的な政策に比べてHABに苦しむこと,(2) 独立したスキルを持つ階層は「ハンドオフ問題」に悩まされ,(3) SPAパイプラインはRL政策よりも脆弱であることがわかった。
関連論文リスト
- From Foundation to Application: Improving VLA Models in Practice [62.1552185059214]
3つの機能ドメインの改善を通じてLingBot-VLAを進化させるLingBot-VLA 2.0を提案する。
以前のバージョンと比較して、データ処理パイプラインを改訂し、事前トレーニングのために約6万時間のデータをキュレートします。
特に,本システムでは,頭部,腰,移動台,器用な手の自由度を考慮し,ロボットがより複雑なタスクを現実的なシナリオでこなせるようにしている。
論文 参考訳(メタデータ) (2026-07-07T15:33:12Z) - HomeWorld: A Unified Floorplan-to-Furnished Framework for Generating Controllable, Densely Interactive Whole-Home Scenes [36.81011113715663]
室内シーン生成はロボットシミュレーションと近代インテリアデザインに不可欠である。
室内シーンの合成を制御可能なステージに分解する統合階層型フレームワークを提案する。
実験とユーザスタディにより、我々のパイプラインはよりレイアウトの多様性とより強力な3Dデザインの魅力を持つ屋内空間を生産していることが示された。
論文 参考訳(メタデータ) (2026-06-04T16:58:43Z) - GS-Playground: A High-Throughput Photorealistic Simulator for Vision-Informed Robot Learning [55.272458304179025]
GS-Playgroundは、エンド・ツー・エンドの知覚学習を促進するために設計されたマルチモーダル・シミュレーション・フレームワークである。
このシステムは640x480の解像度で104 FPSのスループットを達成し、大規模な視覚的RLの障壁を著しく低減する。
論文 参考訳(メタデータ) (2026-04-28T10:05:39Z) - HoloBrain-0 Technical Report [24.68330043768013]
HoloBrain-0はVLA(Vision-Language-Action)フレームワークである。
本システムの中核となるVLAアーキテクチャは,マルチビューカメラパラメータやキネマティックな記述を含む,ロボットのエンボディメントを明示的に組み込んだ新しいアーキテクチャである。
1) 強力な事前トレーニングされたVLA基盤、(2) 複数のシミュレーションスイートと実世界のタスクのためのトレーニング後のチェックポイント、(3) データキュレーション、モデルトレーニング、デプロイメントのためのフルスタックのVLAインフラストラクチャであるRoboOrchardを含む、HoloBrainエコシステム全体をオープンソースにしています。
論文 参考訳(メタデータ) (2026-02-12T15:21:04Z) - MolmoSpaces: A Large-Scale Open Ecosystem for Robot Navigation and Manipulation [56.30931340537373]
MolmoSpacesは、ロボットポリシーのベンチマークをサポートするための、完全にオープンなエコシステムである。
MolmoSpacesは230万以上の屋内環境で構成されている。
MolmoSpaces-Benchは8つのタスクのベンチマークスイートで、ロボットが私たちの多様なシーンとリッチな注釈付きオブジェクトと対話する。
論文 参考訳(メタデータ) (2026-02-11T20:16:31Z) - SpatialReasoner: Active Perception for Large-Scale 3D Scene Understanding [13.974575930417709]
H$2$U3D (Holistic House Understanding in 3D) は3次元視覚質問応答データセットである。
また,空間ツールを自律的に起動して3Dシーンを探索する能動的知覚フレームワークであるSpatialReasonerを提案する。
論文 参考訳(メタデータ) (2025-12-02T22:49:01Z) - InternVLA-M1: A Spatially Guided Vision-Language-Action Framework for Generalist Robot Policy [138.89177083578213]
空間接地とロボット制御のための統合フレームワークであるInternVLA-M1を紹介する。
InternVLA-M1は、(i)2.3M以上の空間的推論データに基づく空間的グラウンドトレーニングと(ii)空間的に誘導された後トレーニングという、2段階のパイプラインを使用する。
結果: InternVLA-M1 は SimplerEnv Google Robot で+14.6%、WidowX で+17%、LIBERO Franka で+4.3% で、空間誘導なしでその変種を上回った。
論文 参考訳(メタデータ) (2025-10-15T17:30:05Z) - SpaceVista: All-Scale Visual Spatial Reasoning from mm to km [43.506658643163405]
本稿は,2つの課題に対処することで,多様なシナリオをまたいだ空間的推論を促進することを目的とする。
屋内の3Dスキャンと、データセットのキュレーションのための労働集約的な手作業アノテーションに大きく依存する。
本稿では,構造化空間推論システム,スケール・アウェア・モデリング,プログレッシブ・トレーニング・パラダイムを統合した総合的なソリューションを提案する。
論文 参考訳(メタデータ) (2025-10-10T17:59:46Z) - RoboRefer: Towards Spatial Referring with Reasoning in Vision-Language Models for Robotics [54.441878000440965]
空間参照は、3D物理世界と相互作用するエンボディロボットの基本的な能力である。
本稿では,まず空間的理解を正確に行うことのできる3次元VLMであるRoboReferを提案する。
RFTで訓練されたRoboReferは最先端の空間理解を実現し、平均成功率は89.6%である。
論文 参考訳(メタデータ) (2025-06-04T17:59:27Z) - ManiSkill-HAB: A Benchmark for Low-Level Manipulation in Home Rearrangement Tasks [18.672482188560622]
MS-HABは、低レベルの操作と家庭内オブジェクト再構成のための総合的なベンチマークである。
我々は、現実的な低レベル制御をサポートし、GPUメモリ使用率のごく一部で、事前の魔法の把握実装の3倍の速度を達成する。
論文 参考訳(メタデータ) (2024-12-09T01:29:24Z) - RoboCasa: Large-Scale Simulation of Everyday Tasks for Generalist Robots [25.650235551519952]
本稿では,汎用ロボットを日常的に訓練するための大規模シミュレーションフレームワークであるRoboCasaを紹介する。
私たちは、150以上のオブジェクトカテゴリと数十の対話可能な家具とアプライアンスに対して、何千もの3Dアセットを提供しています。
本実験は, 大規模模倣学習のための合成ロボットデータを用いて, スケーリングの傾向を明らかにするものである。
論文 参考訳(メタデータ) (2024-06-04T17:41:31Z) - SPOC: Imitating Shortest Paths in Simulation Enables Effective Navigation and Manipulation in the Real World [46.02807945490169]
シミュレーションにおける最短パスプランナーの模倣は,RGBセンサ(深度マップやGPS座標なし)のみを用いて,シミュレーションと現実世界の両方でオブジェクトの操作,探索,操作を行うエージェントを生成することを示す。
この驚くべき結果は、エンドツーエンドのトランスフォーマーベースのSPOCアーキテクチャ、広範な画像拡張と組み合わせた強力なビジュアルエンコーダによって実現されます。
論文 参考訳(メタデータ) (2023-12-05T18:59:45Z) - ManiSkill2: A Unified Benchmark for Generalizable Manipulation Skills [24.150758623016195]
我々は、一般化可能な操作スキルのための次世代のSAPIEN ManiSkillベンチマークであるManiSkill2を紹介する。
ManiSkill2には、2000以上のオブジェクトモデルと4M以上のデモフレームを備えた20の操作タスクファミリが含まれている。
幅広いアルゴリズムをサポートする統一インターフェースと評価プロトコルを定義する。
高速な視覚入力学習アルゴリズムにより、CNNベースのポリシーでサンプルを約2000 FPSで収集することができる。
論文 参考訳(メタデータ) (2023-02-09T14:24:01Z) - Parallel Reinforcement Learning Simulation for Visual Quadrotor
Navigation [4.597465975849579]
強化学習(Reinforcement Learning、RL)は、ロボットに物理的な世界の中をナビゲートするように教えるエージェントベースのアプローチである。
本稿では,AirSim上に構築された並列学習を効率的に行うシミュレーションフレームワークを提案する。
このフレームワーク上に構築されたApe-Xは、AirSim環境の分散トレーニングを組み込むように修正されている。
論文 参考訳(メタデータ) (2022-09-22T15:27:42Z) - ProcTHOR: Large-Scale Embodied AI Using Procedural Generation [55.485985317538194]
ProcTHORは、Embodied AI環境の手続き的生成のためのフレームワークである。
ナビゲーション、アレンジメント、アーム操作のための6つの具体化されたAIベンチマークに対して、最先端の結果を実証する。
論文 参考訳(メタデータ) (2022-06-14T17:09:35Z) - BEHAVIOR in Habitat 2.0: Simulator-Independent Logical Task Description
for Benchmarking Embodied AI Agents [31.499374840833124]
高速なシミュレーション速度の恩恵を受けるため、Habitat 2.0にBEHAVIORアクティビティのサブセットを組み込む。
ベンチマークがAIの分野で果たした触媒効果に触発されて、コミュニティはエンボディされたAIのための新しいベンチマークを探している。
論文 参考訳(メタデータ) (2022-06-13T21:37:31Z) - Megaverse: Simulating Embodied Agents at One Million Experiences per
Second [75.1191260838366]
私たちは、強化学習と具体化AI研究のための新しい3DシミュレーションプラットフォームであるMegaverseを紹介します。
MegaverseはDeepMind Labより最大70倍速い。
私たちはMegaverseを使って、複数の単一エージェントタスクとマルチエージェントタスクからなる新しいベンチマークを構築します。
論文 参考訳(メタデータ) (2021-07-17T03:16:25Z) - The ThreeDWorld Transport Challenge: A Visually Guided Task-and-Motion
Planning Benchmark for Physically Realistic Embodied AI [96.86091264553613]
3Dワールドトランスポートチャレンジと呼ばれる視覚誘導と物理駆動のタスク・アンド・モーション計画ベンチマークを紹介します。
この課題では、シミュレーションされた実家環境において、2つの9-DOF関節アームを備えたエンボディエージェントをランダムに生成する。
エージェントは、家の周りに散在するオブジェクトの小さなセットを見つけ、それらをピックアップし、望ましい最終的な場所に輸送する必要があります。
論文 参考訳(メタデータ) (2021-03-25T17:59:08Z) - Large Batch Simulation for Deep Reinforcement Learning [101.01408262583378]
我々は,視覚複雑な3次元環境における深層強化学習に基づく学習を,事前作業よりも2桁高速化する。
単一のGPUマシンで1秒間に19,000フレーム以上の経験と最大72,000フレーム/秒のエンドツーエンドのトレーニング速度を実現します。
バッチシミュレーションと性能最適化を組み合わせることで、1つのGPU上の複雑な3D環境において、従来の最先端システムでトレーニングされたエージェントの精度の97%から97%まで、ポイントナビゲーションエージェントをトレーニングできることを実証する。
論文 参考訳(メタデータ) (2021-03-12T00:22:50Z) - Reactive Long Horizon Task Execution via Visual Skill and Precondition
Models [59.76233967614774]
シミュレーションで学習したモデルを用いて、単純なタスクプランナの構成要素をグラウンド化することで、見知らぬロボットタスクを達成できるシミュレート・トゥ・リアル・トレーニングのアプローチについて述べる。
シミュレーションでは91.6%から98%,実世界の成功率は10%から80%に増加した。
論文 参考訳(メタデータ) (2020-11-17T15:24:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。