論文の概要: LENS: LLM-guided Environment Simplification for Planning and Control in Clutter
- arxiv url: http://arxiv.org/abs/2607.19633v1
- Date: Wed, 22 Jul 2026 00:05:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 18:51:37.943546
- Title: LENS: LLM-guided Environment Simplification for Planning and Control in Clutter
- Title(参考訳): LENS: クラッタの計画と制御のためのLCM誘導環境の簡易化
- Abstract要約: 現実世界の多目的クラッタは、汎用ロボット操作の扱いが難しいままだ。
本研究では,既存の計画および制御スタック上に,シーン固有のタスク固有の,適応的な抽象化を自動生成するプラグイン・アンド・プレイ・フィックスを提案する。
LENSは、タスクの進行に応じてクローズドループ内で(例えば、積み重ねられたオブジェクト)やプルーニング(例えば、遠くのオブジェクト)のシーンエンティティをマージすることで、区切りされた抽象的なシーン表現を生成する。
- 参考スコア(独自算出の注目度): 27.19814803889672
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Despite recent advances in general-purpose robotic manipulation, real-world multi-object clutter remains challenging to handle for today's prevalent approaches. The problem scales in complexity due to more objects and collisions, more unpredictable contact physics, distractors, and task ambiguity. Bridging this gap to real-world deployment requires effective scene abstractions; yet today, producing such abstractions requires extensive task-specific manual engineering, which does not scale. These abstractions are costly to generate and difficult to adjust or fine-tune. We instead propose a plug-and-play fix to automatically generate scene-specific, task-specific, adaptively updating abstractions on top of existing planning and control stacks. LLM-guided Environment Simplification (LENS) produces a de-cluttered abstracted scene representation by merging (e.g., stacked objects) or pruning (e.g., distant objects) scene entities in a closed loop in response to task progress. These dynamic, task-relevant abstractions are versatile and easy to use. In our experiments, we show that LENS improves classical planning, model-based control, and a vision-language-action model, across a diverse set of highly cluttered manipulation scenes. Project website: https://lens-2026.github.io/.
- Abstract(参考訳): 近年の汎用ロボット操作の進歩にもかかわらず、現実のマルチオブジェクト・クラッタは、今日の一般的なアプローチを扱うのが困難なままである。
この問題は、より多くの物体や衝突、予測不可能な接触物理、邪魔者、タスクのあいまいさによって複雑さが拡大する。
現実のデプロイメントにこのギャップを埋めるには、効果的なシーン抽象化が必要ですが、今日では、そのような抽象化を生成するには、スケールしない広範なタスク固有の手動エンジニアリングが必要です。
これらの抽象化は生成に費用がかかり、調整や微調整が難しい。
代わりに、既存の計画および制御スタック上に、シーン固有のタスク固有の、適応的な抽象化を自動生成するプラグイン・アンド・プレイの修正を提案する。
LLM誘導環境単純化(LENS)は、タスクの進行に応じて、クローズドループ内で(例えば、積み重ねられたオブジェクト)またはプルーニング(例えば、離れたオブジェクト)シーンエンティティをマージして、非クラッタ化されたシーン表現を生成する。
これらの動的なタスク関連抽象化は、汎用的で使いやすくなります。
実験の結果,LENSは古典的計画,モデルベース制御,視覚言語行動モデルの改善を,多種多様な乱雑な操作シーンで実現していることがわかった。
プロジェクトウェブサイト: https://lens-2026.github.io/.com
関連論文リスト
- LAMP: Long-Horizon Adaptive Manipulation Planning for Multi-Robot Collaboration in Cluttered Space [6.871611081512488]
マルチロボット操作には、接触形成、結合力学下でのロボットの動き、衝突回避に関する共同推論が必要である。
既存のアプローチは、強化学習を通じてエンドツーエンドの問題を解決することを学ぶか、より単純なサロゲート問題に計画を制限するかのいずれかである。
完全連結空間上でのトラクタブルな探索を可能にする2つのプランナを備えた長水平適応マニピュレーション計画フレームワークを提案する。
論文 参考訳(メタデータ) (2026-06-28T12:12:48Z) - Task Editing for Generalizable 3D Visuomotor Policy Learning [50.590696755853365]
3Dビジュモータポリシーは、深度マップと点雲が空間的推論のための豊富な幾何学的情報を提供するため、複雑なロボット操作に有望な方向を提供する。
既存の手法では、人間中心のデモにオブジェクト中心の変換を適用することで、データ効率を改善するためにデモ生成戦略が一般的である。
本稿では,タスク中心の編集の観点から多様な軌道を生成する新しいデモ生成フレームワークであるTask-Editを提案する。
論文 参考訳(メタデータ) (2026-06-05T07:54:49Z) - LDHP: Library-Driven Hierarchical Planning for Non-prehensile Dexterous Manipulation [3.829270241398111]
非包括的操作は、非構造化設定で、細く、大きく、または、その他の非移植不可能なオブジェクトを扱うのに不可欠である。
事前の計画と探索に基づく手法は、しばしばアドホックな手動設計に依存するか、物理的に実現不可能な動作を生成する。
本稿では,ライブラリ駆動型階層型プランナ(LDHP)を提案する。
論文 参考訳(メタデータ) (2026-03-14T08:54:49Z) - MORE: Mobile Manipulation Rearrangement Through Grounded Language Reasoning [13.535721260188694]
MOREはゼロショットモバイル操作計画タスクを解決するための言語モデルの能力を高めるための新しいアプローチである。
BEHAVIOR-1Kベンチマークから81の多様な再配置タスクに対してMOREを評価し,ベンチマークのかなりの割合をうまく解決するための最初のアプローチとなる。
論文 参考訳(メタデータ) (2025-05-05T21:26:03Z) - Flex: End-to-End Text-Instructed Visual Navigation from Foundation Model Features [59.892436892964376]
本稿では,視覚に基づく制御ポリシを用いて,ロバストな閉ループ性能を実現するために必要な最小限のデータ要件とアーキテクチャ適応について検討する。
この知見はFlex (Fly lexically) で合成され, 凍結パッチワイド特徴抽出器として, 事前学習された視覚言語モデル (VLM) を用いたフレームワークである。
本研究では,本手法の有効性を,行動クローンによる訓練を実世界のシーンに応用した,四重項フライ・トゥ・ターゲットタスクに適用した。
論文 参考訳(メタデータ) (2024-10-16T19:59:31Z) - A Meta-Engine Framework for Interleaved Task and Motion Planning using Topological Refinements [51.54559117314768]
タスク・アンド・モーション・プランニング(タスク・アンド・モーション・プランニング、TAMP)は、自動化された計画問題の解決策を見つけるための問題である。
本稿では,TAMP問題のモデル化とベンチマークを行うための,汎用的でオープンソースのフレームワークを提案する。
移動エージェントと複数のタスク状態依存障害を含むTAMP問題を解決する革新的なメタ技術を導入する。
論文 参考訳(メタデータ) (2024-08-11T14:57:57Z) - DoraemonGPT: Toward Understanding Dynamic Scenes with Large Language Models (Exemplified as A Video Agent) [73.10899129264375]
本稿では,LLMによる動的シーン理解のための包括的かつ概念的にエレガントなシステムであるドラモンGPTについて検討する。
質問/タスクのあるビデオが与えられた場合、DoraemonGPTは入力されたビデオをタスク関連の属性を格納するシンボリックメモリに変換することから始める。
我々は,DoraemonGPTの有効性を,3つのベンチマークといくつかのアプリ内シナリオで広範囲に評価した。
論文 参考訳(メタデータ) (2024-01-16T14:33:09Z) - NOD-TAMP: Generalizable Long-Horizon Planning with Neural Object Descriptors [16.475094344344512]
一般化可能なオブジェクト中心機能を生成するニューラルオブジェクト記述子(NOD)と,多段階タスクを解決するための短軸スキルをチェーンするタスク・アンド・モーション・プランニング(TAMP)フレームワークの2つのパラダイムを組み合わせることを提案する。
我々は,少数の人間による実験から短い操作軌跡を抽出し,NOD特徴を用いてこれらの軌跡を適応させる,TAMPベースのフレームワークNOD-TAMPを紹介する。
論文 参考訳(メタデータ) (2023-11-02T18:26:28Z) - RoboTAP: Tracking Arbitrary Points for Few-Shot Visual Imitation [36.43143326197769]
Track-Any-Point (TAP) モデルは、デモ中の関連する動きを分離し、低レベルのコントローラをパラメータ化して、シーン構成の変化をまたいでこの動きを再現する。
この結果は,形状整合,積み重ね,さらには接着や物体の付着といった完全な経路追従といった複雑な物体配置タスクを解くことのできるロバストなロボットポリシーで示される。
論文 参考訳(メタデータ) (2023-08-30T11:57:04Z) - Plan, Eliminate, and Track -- Language Models are Good Teachers for
Embodied Agents [99.17668730578586]
事前訓練された大言語モデル(LLM)は、世界に関する手続き的な知識をキャプチャする。
Plan, Eliminate, and Track (PET)フレームワークはタスク記述をハイレベルなサブタスクのリストに変換する。
PETフレームワークは、人間の目標仕様への一般化のために、SOTAよりも15%改善されている。
論文 参考訳(メタデータ) (2023-05-03T20:11:22Z) - Planning with Spatial-Temporal Abstraction from Point Clouds for
Deformable Object Manipulation [64.00292856805865]
空間抽象と時間抽象の両方を組み込んだ空間抽象型PlAnning(PASTA)を提案する。
我々のフレームワークは,高次元の3次元観測を潜時ベクトルの集合にマッピングし,潜時集合表現の上のスキルシーケンスを計画する。
本手法は,実世界のオブジェクト操作を効果的に行うことができることを示す。
論文 参考訳(メタデータ) (2022-10-27T19:57:04Z) - Discovering Objects that Can Move [55.743225595012966]
手動ラベルなしでオブジェクトを背景から分離する、オブジェクト発見の問題について検討する。
既存のアプローチでは、色、テクスチャ、位置などの外観の手がかりを使用して、ピクセルをオブジェクトのような領域に分類する。
私たちは、動的オブジェクト -- 世界で独立して動くエンティティ -- にフォーカスすることを選びます。
論文 参考訳(メタデータ) (2022-03-18T21:13:56Z) - A Long Horizon Planning Framework for Manipulating Rigid Pointcloud
Objects [25.428781562909606]
本稿では,剛体物体の操作に伴う長期計画問題の解決のための枠組みを提案する。
提案手法はオブジェクトサブゴールの空間における計画であり,ロボットとオブジェクトの相互作用のダイナミクスに関する推論からプランナーを解放する。
論文 参考訳(メタデータ) (2020-11-16T18:59:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。