論文の概要: PDDLCoder: Agentic PDDL Generation for LLM-Assisted Symbolic Planning
- arxiv url: http://arxiv.org/abs/2608.16637v1
- Date: Mon, 17 Aug 2026 14:34:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.747689
- Title: PDDLCoder: Agentic PDDL Generation for LLM-Assisted Symbolic Planning
- Title(参考訳): PDDLコーダ:LDM支援シンボリックプランニングのためのエージェントPDDL生成
- Abstract要約: 提案するPDDLCoderは,計画仕様を反復的に生成,解析,洗練する自然言語からのPDDL生成のためのエージェントフレームワークである。
NL-pddlgymテストセットの実験は、PDDLCoderがテスト計画問題の89.6%を適用可能な計画を生成することを示している。
- 参考スコア(独自算出の注目度): 0.4433169165028139
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: LLMs remain unreliable for long-horizon planning, often generating logically inconsistent or non-applicable plans. Recent hybrid methods instead translate natural language into the Planning Domain Definition Language (PDDL), allowing symbolic planners to produce verifiable plans. However, existing methods frequently rely on rigid generation pipelines, a partial PDDL definition, or human feedback. Furthermore, their evaluation is hindered by the lack of standardized benchmarks with automated verification. To address these limitations, we present PDDLCoder, an agentic framework for PDDL generation from natural language that iteratively generates, analyzes, and refines planning specifications. We further introduce NL-pddlgym, a benchmark dataset comprising 711 planning problems across 23 domains with executable gym environments for the automated verification of plan applicability. Experiments on the NL-pddlgym test set containing 106 problems across 4 held-out domains show that PDDLCoder generates applicable plans for 89.6\% of tested planning problems. This improves upon our adaptations of previous PDDL generation methods, which achieved up to 45.3\%, and outperforms direct LLM planning approaches, which reached up to 74.5\% on the same test set. Our work demonstrates the effectiveness of agentic PDDL generation for planning and establishes a reproducible benchmark for future research on LLM-assisted symbolic planning.
- Abstract(参考訳): LLMは長期計画には信頼できないままであり、論理的に一貫性のない計画や適用不可能な計画を生成することが多い。
近年のハイブリッドな手法では、自然言語をPDDL(Planning Domain Definition Language)に変換することで、シンボリックプランナーが検証可能な計画を作成することができる。
しかし、既存の手法は、しばしば厳格な生成パイプライン、部分的なPDDL定義、あるいは人間のフィードバックに依存している。
さらに、それらの評価は、自動検証による標準ベンチマークの欠如によって妨げられている。
これらの制約に対処するために,提案するPDDLCoderは,計画仕様を反復的に生成,解析,洗練する自然言語からのPDDL生成のためのエージェントフレームワークである。
さらに、NL-pddlgymというベンチマークデータセットを導入し、23のドメインにまたがる711の計画問題と実行可能なジム環境を用いて、計画適用性の自動検証を行う。
NL-pddlgymテストセットの実験では、4つの保持領域に106の問題がある。
これにより、最大45.3 %に達するPDDL生成手法の適応性が向上し、同じテストセットで最大74.5 %に達する直接LCM計画手法よりも優れる。
本研究は, エージェントPDDL生成による計画立案の有効性を実証し, 今後のLLM支援記号計画研究のための再現可能なベンチマークを確立するものである。
関連論文リスト
- Toward Secure and Reliable PDDL Formalization of Large Language Models with Planner-in-the-Loop Feedback [11.629045437889943]
計画はしばしば実行可能かつ検証可能な象徴的な仕様を必要とする。
提案するNL-PDDL-Benchは,自然言語とPDDLの仕様作成のためのベンチマークである。
また、バリデータとプランナ診断を用いて、実行不可能な仕様を改訂する、ループ内プランナフレームワークを提案する。
論文 参考訳(メタデータ) (2026-06-29T02:08:30Z) - PlanningBench: Generating Scalable and Verifiable Planning Data for Evaluating and Training Large Language Models [52.48858778580074]
計画は大規模言語モデル(LLM)の基本的な機能である
PlanningBenchは、評価とトレーニングの両方のためのスケーラブルで多様な検証可能な計画データを生成するためのフレームワークである。
論文 参考訳(メタデータ) (2026-05-20T08:10:15Z) - How Far Are LLMs from Symbolic Planners? An NLP-Based Perspective [2.580765958706854]
提案手法では,NLP の操作により,生成した計画のNLP に基づく評価と,計画の復元を行う3つの段階からなるリカバリパイプラインを提案する。
本研究は, 計画生成における基礎的理由づけの明確な証拠は得られず, 従来の計画立案者の品質と信頼性に乏しく, NLPに基づく計画解析と回復機構を併用したパイプラインが依然として不足していることを示す。
論文 参考訳(メタデータ) (2025-08-02T10:20:52Z) - PGPO: Enhancing Agent Reasoning via Pseudocode-style Planning Guided Preference Optimization [58.465778756331574]
本稿では,効果的なエージェント学習のためのPGPOと呼ばれる疑似コード型計画優先最適化手法を提案する。
2つの計画指向の報酬により、PGPOは、高品質なPコードプランを生成するLLMエージェントの能力をさらに強化する。
実験により、PGPOは代表エージェントベンチマークよりも優れた性能を示し、現在のリードベースラインより優れていることが示された。
論文 参考訳(メタデータ) (2025-06-02T09:35:07Z) - Unifying Inference-Time Planning Language Generation [27.998081619086477]
計画の行は、計画を生成するのではなく、計画言語で形式的な表現を生成するためにLLMを使用する。
中間表現に基づく統一フレームワークを提案する。
我々は、言語生成パイプラインを計画するためのレシピを提供し、それらの様々なコンポーネントの有効性を示す一連の結論を導き出す。
論文 参考訳(メタデータ) (2025-05-20T17:25:23Z) - An Extensive Evaluation of PDDL Capabilities in off-the-shelf LLMs [11.998185452551878]
大規模言語モデル(LLM)は、コード生成とチェーン・オブ・シークレット推論に習熟している。
本研究では,計画ドメイン定義言語(PDDL)の理解と生成のためのLLMの可能性を評価する。
論文 参考訳(メタデータ) (2025-02-27T15:13:07Z) - Leveraging Environment Interaction for Automated PDDL Translation and Planning with Large Language Models [7.3238629831871735]
大規模言語モデル(LLM)は、様々な自然言語タスクにおいて顕著な性能を示している。
潜在的な解決策として、計画ドメイン定義言語(PDDL)へのプランニングの問題が提案されている。
LLMと環境フィードバックを利用してPDDLドメインと問題記述ファイルを自動生成する手法を提案する。
論文 参考訳(メタデータ) (2024-07-17T19:50:51Z) - Planetarium: A Rigorous Benchmark for Translating Text to Structured Planning Languages [20.62336315814875]
計画タスクの自然言語記述からPDDLコードを生成する言語モデルの性能を評価するためのベンチマークである textitPlanetarium を紹介する。
textitPlanetariumは、生成したPDDLの正しさを柔軟に評価する新しいPDDL同値アルゴリズムと、145,918のテキスト-PDDLペアのデータセットを備える。
論文 参考訳(メタデータ) (2024-07-03T17:59:53Z) - Exploring and Benchmarking the Planning Capabilities of Large Language Models [57.23454975238014]
この研究は、大規模言語モデル(LLM)の計画能力を改善するための基礎を築いた。
我々は、古典的な計画ベンチマークと自然言語シナリオの両方を含む包括的なベンチマークスイートを構築した。
本研究は,LLM計画の強化を目的としたマルチショットインコンテキスト学習について検討し,文脈長の増大と計画性能の向上の関係について検討する。
論文 参考訳(メタデータ) (2024-06-18T22:57:06Z) - PDDLEGO: Iterative Planning in Textual Environments [56.12148805913657]
テキスト環境における計画は、現在のモデルにおいても長年にわたる課題であることが示されている。
我々は,あるサブゴールの部分的な計画に導く計画表現を反復的に構築するPDDLEGOを提案する。
数ショットのPDDLEGOで作成するプランは,Coin Collectorシミュレーションでエンドツーエンドのプランを生成するよりも43%効率がよいことを示す。
論文 参考訳(メタデータ) (2024-05-30T08:01:20Z) - PROC2PDDL: Open-Domain Planning Representations from Texts [56.627183903841164]
Proc2PDDLは、専門家によるPDDL表現と組み合わせたオープンドメインの手続きテキストを含む最初のデータセットである。
以上の結果から, GPT-3.5は0%, GPT-4は35%, Proc2PDDLは極めて困難であることが示唆された。
論文 参考訳(メタデータ) (2024-02-29T19:40:25Z) - Automating the Generation of Prompts for LLM-based Action Choice in PDDL Planning [59.543858889996024]
大規模言語モデル(LLM)は、様々なNLPタスクに革命をもたらした。
LLMを利用してPDDL入力からNLプロンプトを自動的に生成する方法を示す。
我々のNLプロンプトはPDDLプロンプトや単純なテンプレートベースのNLプロンプトよりも優れた性能が得られる。
論文 参考訳(メタデータ) (2023-11-16T11:55:27Z) - AdaPlanner: Adaptive Planning from Feedback with Language Models [56.367020818139665]
大規模言語モデル(LLM)は、最近、シーケンシャルな意思決定タスクの自律的エージェントとして機能する可能性を実証している。
本研究では,LLMエージェントが環境フィードバックに応じて自己生成計画を適応的に改善することのできるクローズドループアプローチであるAdaPlannerを提案する。
幻覚を緩和するために,様々なタスク,環境,エージェント機能にまたがる計画生成を容易にするコードスタイルのLCMプロンプト構造を開発した。
論文 参考訳(メタデータ) (2023-05-26T05:52:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。