論文の概要: SYMBOLIZER: Symbolic Model-free Task Planning with VLMs
- arxiv url: http://arxiv.org/abs/2604.17830v1
- Date: Mon, 20 Apr 2026 05:32:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-21 21:52:52.712238
- Title: SYMBOLIZER: Symbolic Model-free Task Planning with VLMs
- Title(参考訳): Symboliizer: VLMを用いた記号型モデルフリータスクプランニング
- Authors: Sami Azirar, Zlatan Ajanovic, Hermann Blum,
- Abstract要約: 従来のタスク・アンド・モーション・プランニング(TAMP)システムは、タスク・プランニングの物理モデルとタスク・プランニングの離散的シンボリック・モデルに依存している。
ビジュアル言語モデル(VLM)は、望まれるゼロショットの視覚的理解を示す。
未確認問題に対してよく一般化するフレームワークを提案する。
- 参考スコア(独自算出の注目度): 7.564784873669823
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Traditional Task and Motion Planning (TAMP) systems depend on physics models for motion planning and discrete symbolic models for task planning. Although physics model are often available, symbolic models (consisting of symbolic state interpretation and action models) must be meticulously handcrafted or learned from labeled data. This process is both resource-intensive and constrains the solution to the specific domain, limiting scalability and adaptability. On the other hand, Visual Language Models (VLMs) show desirable zero-shot visual understanding (due to their extensive training on heterogeneous data), but still achieve limited planning capabilities. Therefore, integrating VLMs with classical planning for long-horizon reasoning in TAMP problems offers high potential. Recent works in this direction still lack generality and depend on handcrafted, task-specific solutions, e.g. describing all possible objects in advance, or using symbolic action models. We propose a framework that generalizes well to unseen problem instances. The method requires only lifted predicates describing relations among objects and uses VLMs to ground them from images to obtain the symbolic state. Planning is performed with domain-independent heuristic search using goal-count and width-based heuristics, without need for action models. Symbolic search over VLM-grounded state-space outperforms direct VLM-based planning and performs on par with approaches that use a VLM-derived heuristic. This shows that domain-independent search can effectively solve problems across domains with large combinatorial state spaces. We extensively evaluate on extensively evaluate our method and achieve state-of-the-art results on the ProDG and ViPlan benchmarks.
- Abstract(参考訳): 従来のタスク・アンド・モーション・プランニング(TAMP)システムは、タスク・プランニングの物理モデルとタスク・プランニングの離散的シンボリック・モデルに依存している。
物理モデルはしばしば利用可能であるが、記号的モデル(記号的状態解釈とアクションモデルで構成されている)は慎重に手作りするか、ラベル付きデータから学習する必要がある。
このプロセスはリソース集約的であり、特定のドメインに対するソリューションを制約し、スケーラビリティと適応性を制限する。
一方、ビジュアル言語モデル(VLM)は、(異種データの広範なトレーニングのため)望ましくゼロショットの視覚的理解を示すが、計画能力は限られている。
したがって、TAMP問題におけるVLMと古典的計画の統合は、高い可能性を秘めている。
この方向の最近の研究は、一般性に欠けており、手作りのタスク固有のソリューション、例えば、事前に全ての可能なオブジェクトを記述すること、あるいはシンボリック・アクション・モデルを使用することに依存している。
未確認問題に対してよく一般化するフレームワークを提案する。
この方法は、オブジェクト間の関係を記述した昇降述語のみを必要とし、VLMを使用して画像からそれらをグラウンドしてシンボル状態を得る。
プランニングは、目標数と幅に基づくヒューリスティックを用いてドメインに依存しないヒューリスティック検索を行い、アクションモデルを必要としない。
VLMを基底とした状態空間のシンボリックサーチは、直接的なVLMベースの計画よりも優れており、VLM由来のヒューリスティックなアプローチと同等である。
このことは、ドメインに依存しない探索が、大きな組合せ状態空間を持つ領域間の問題を効果的に解決できることを示している。
提案手法を広範に評価し,ProDGおよびViPlanベンチマークの最先端結果を得た。
関連論文リスト
- ViPlan: A Benchmark for Visual Planning with Symbolic Predicates and Vision-Language Models [8.715289208498053]
シンボル述語と視覚言語モデル(VLM)を用いたビジュアルプランニングのための最初のオープンソースベンチマークであるViPlanを紹介する。
我々は,複数のサイズのオープンソースVLMファミリを,選択されたクローズドモデルとともにベンチマークし,VLMを基盤としたシンボルプランニングと,モデルを直接使用してアクションを提案する。
正確な画像のグラウンド化が不可欠であるBlocksworldでは、直接VLM計画よりも優れているという象徴的な計画があるが、家庭用ロボティクスのタスクではその逆が当てはまる。
論文 参考訳(メタデータ) (2025-05-19T14:38:15Z) - LLM-Generated Heuristics for AI Planning: Do We Even Need Domain-Independence Anymore? [87.71321254733384]
大規模言語モデル(LLM)は、特定の計画問題に適した計画手法を生成することができる。
LLMは、いくつかの標準IPCドメインで最先端のパフォーマンスを達成することができる。
これらの結果がパラダイムシフトを意味するのか、既存の計画手法をどのように補完するかについて議論する。
論文 参考訳(メタデータ) (2025-01-30T22:21:12Z) - ET-Plan-Bench: Embodied Task-level Planning Benchmark Towards Spatial-Temporal Cognition with Foundation Models [38.89166693142495]
ET-Plan-Benchは、Large Language Models (LLMs) を用いたタスク計画の具体化のためのベンチマークである。
様々な難易度や複雑さのレベルにおいて、制御可能で多様な実施タスクが特徴である。
我々のベンチマークでは、大規模で定量化され、高度に自動化され、きめ細かな診断フレームワークとして認識されている。
論文 参考訳(メタデータ) (2024-10-02T19:56:38Z) - VSP: Assessing the dual challenges of perception and reasoning in spatial planning tasks for VLMs [102.36953558562436]
視覚言語モデル(VLM)は、エキサイティングな言語モデル(LM)のクラスである。
VLMの未調査能力の1つは、視覚空間計画である。
本研究は,これらのモデルにおける空間計画能力を概ね評価するベンチマークを提案する。
論文 参考訳(メタデータ) (2024-07-02T00:24:01Z) - Details Make a Difference: Object State-Sensitive Neurorobotic Task Planning [15.03025428687218]
オブジェクトの状態は現在の状態や状態を反映しており、ロボットのタスク計画と操作にとって重要である。
近年,LLM (Large Language Models) とVLM (Vision-Language Models) は,計画生成において顕著な能力を示している。
我々は、事前学習ニューラルネットワークによって強化されたタスク計画エージェントであるObject State-Sensitive Agent (OSSA)を紹介する。
論文 参考訳(メタデータ) (2024-06-14T12:52:42Z) - DiMSam: Diffusion Models as Samplers for Task and Motion Planning under Partial Observability [58.75803543245372]
タスク・アンド・モーション・プランニング(TAMP)アプローチは多段階自律ロボット操作の計画に適している。
本稿では,TAMPシステムを用いた拡散モデルの構築により,これらの制限を克服することを提案する。
古典的TAMP, 生成モデリング, 潜伏埋め込みの組み合わせによって, 多段階制約に基づく推論が可能となることを示す。
論文 参考訳(メタデータ) (2023-06-22T20:40:24Z) - Learning Models as Functionals of Signed-Distance Fields for
Manipulation Planning [51.74463056899926]
本研究では,シーン内のオブジェクトを表す符号付き距離場の目的を学習する,最適化に基づく操作計画フレームワークを提案する。
オブジェクトを符号付き距離場として表現することは、ポイントクラウドや占有率の表現よりも高い精度で、様々なモデルの学習と表現を可能にする。
論文 参考訳(メタデータ) (2021-10-02T12:36:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。