論文の概要: LLM-Flax : Generalizable Robotic Task Planning via Neuro-Symbolic Approaches with Large Language Models
- arxiv url: http://arxiv.org/abs/2604.26569v1
- Date: Wed, 29 Apr 2026 11:53:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-30 15:59:36.382048
- Title: LLM-Flax : Generalizable Robotic Task Planning via Neuro-Symbolic Approaches with Large Language Models
- Title(参考訳): LLM-Flax : 大規模言語モデルを用いたニューロシンボリックアプローチによる汎用ロボットタスク計画
- Abstract要約: LLM-Flax は、PDDLドメインファイルのみを指定して、ローカルにホストされた LLM を使用して、3つの手作業のソースをすべて排除するフレームワークである。
10x10,12x12,15x15グリッドで,MazeNamoベンチマークの3段階すべてを評価する。
12x12のエキスパートでは、LSM-FlaxがSR 0.733に達し、手動プランナーは完全に失敗する(SR 0.000)。
- 参考スコア(独自算出の注目度): 1.647210198730602
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Deploying a neuro-symbolic task planner on a new domain today requires significant manual effort: a domain expert must author relaxation and complementary rules, and hundreds of training problems must be solved to supervise a Graph Neural Network (GNN) object scorer. We propose LLM-Flax, a three-stage framework that eliminates all three sources of manual effort using a locally hosted LLM given only a PDDL domain file. Stage 1 automatically generates relaxation and complementary rules via structured prompting with format validation and self-correction. Stage 2 introduces LLM-guided failure recovery with a feasibility-gated budget policy that explicitly reserves API latency cost before each LLM call, preventing the downstream relaxation fallback from being starved. Stage 3 replaces the domain-trained GNN entirely with zero-shot LLM object importance scoring, requiring no training data. We evaluate all three stages on the MazeNamo benchmark across 10x10, 12x12, and 15x15 grids (8 benchmarks total). LLM-Flax achieves average SR 0.945 versus the manual baseline's 0.828 (+0.117), matching or outperforming manual rules on every one of the eight benchmarks. On 12x12 Expert, LLM-Flax attains SR 0.733 where the manual planner fails entirely (SR 0.000); on 15x15 Hard, it achieves SR 1.000 versus Manual's 0.900. Stage 3 demonstrates feasibility (SR 0.720 on 12x12 Hard with no training data) but faces a context-window bottleneck at scale, pointing to the primary open challenge for future work.
- Abstract(参考訳): ドメインの専門家は、リラックスと補完ルールを記述し、グラフニューラルネットワーク(GNN)オブジェクトスコアラを監督するためには、数百のトレーニング問題を解決しなければならない。
LLM-Flaxは,PDDLドメインファイルのみを指定してローカルにホストされたLLMを用いて,3つの手作業の源泉をすべて除去する3段階フレームワークである。
ステージ1は、形式検証と自己補正による構造化プロンプトを通じて、緩和と補完ルールを自動的に生成する。
ステージ2では、LDM呼び出し毎にAPIレイテンシコストを明示的に保留し、ダウンストリーム緩和のフォールバックの飢餓を防止する、実現可能な権限付き予算ポリシを備えた、LSM誘導の障害復旧が導入されている。
ステージ3はドメインで訓練されたGNNを完全にゼロショットLLMオブジェクトの重要度スコアに置き換え、トレーニングデータを必要としない。
10x10,12x12,15x15グリッド(合計8ベンチマーク)で,MazeNamoベンチマークの3段階すべてを評価する。
LLM-Flax は、手動ベースラインの0.828 (+0.117) に対して平均 SR 0.945 を達成する。
12x12のエキスパートでは、LSM-FlaxがSR 0.733に達し、手動プランナーは完全に失敗する(SR 0.000)。
ステージ3は実現可能性を示す(訓練データを持たないハードのSR 0.720)が、コンテキスト・ウィンドウのボトルネックに直面しており、将来の作業における主要なオープンな課題を示している。
関連論文リスト
- Benchmarking LLMs for Threat Level Determination [1.8453032748632798]
脅威レベル決定のタスクにおいて,大規模言語モデル (LLM) をベンチマークする。
その結果,ゼロショットモデルでは,脅威レベルを正確に割り当てる能力が制限され,性能が低下することが示唆された。
しかし、微調整されたモデルは大幅に改善され、基本アーキテクチャによってF1スコアは0.40から0.58に到達した。
論文 参考訳(メタデータ) (2026-09-07T14:55:42Z) - From Production Traffic to Post-Training: Building a Self-Hosted LLM That Covers the Corporate Request Mix [55.08143827481755]
200以上の内部アプリケーションから1つのモデルにトラフィックを集約します。
我々は、各軸ごとに別々のGRPOエキスパートを訓練し、2段階のSLERPを介してそれらをマージする。
このモデルは、プラットフォームトラフィックの50%、月1億6600万リクエストをサービスコストのごく一部で吸収する。
論文 参考訳(メタデータ) (2026-09-01T17:39:26Z) - Plan Verification for LLM-Based Embodied Task Completion Agents [10.439882851477162]
大規模言語モデル(LLM)に基づくタスク計画とそれに対応するAIの人間による実演は騒々しいかもしれない。
審査員が行動系列を批判し、プランナーLLMが修正を適用する反復検証フレームワークを提案する。
論文 参考訳(メタデータ) (2025-09-02T19:06:56Z) - How Many Parameters Does Your Task Really Need? Task Specific Pruning with LLM-Sieve [2.33361323991006]
大きな言語モデル(LLM)は、リソース制約された設定において、狭いタスクのためにますますデプロイされる。
LLM-Sieveは,タスク性能の維持に必要な最小パラメータサブセットにLCMを適用可能なフレームワークである。
論文 参考訳(メタデータ) (2025-05-23T20:17:20Z) - Towards Efficient Automatic Self-Pruning of Large Language Models [55.90119819642064]
トレーニング後の構造化プルーニングは、トレーニングを必要とせずに大規模言語モデルを熟成する有望なソリューションである。
この問題を緩和する鍵は、各レイヤのプルーニング率を正確に決定することにある、と我々は主張する。
我々は、レイヤワイドプルーニングレートを効率的に検索するLLMのためのエンドツーエンドの自動自動プルーニングフレームワークである$textbfSelf-Prunerを紹介した。
論文 参考訳(メタデータ) (2025-02-20T09:59:50Z) - Universal Model Routing for Efficient LLM Inference [69.86195589350264]
モデルルーティングは,大規模言語モデル(LLM)の推論コストを削減する手法である
動的ルーティング問題に対する新しいアプローチであるUniRouteを提案する。
これらは理論的に最適なルーティングルールの推定であり、過大なリスクバウンドによってそれらのエラーを定量化する。
論文 参考訳(メタデータ) (2025-02-12T20:30:28Z) - WALL-E: World Alignment by Rule Learning Improves World Model-based LLM Agents [55.64361927346957]
大規模言語モデル(LLM)による規則の勾配なし学習のためのニューロシンボリックアプローチを提案する。
我々のLLMエージェントWALL-Eはモデル予測制御(MPC)上に構築されている
MinecraftとALFWorldにおけるオープンワールドの課題について、WALL-Eは既存の方法よりも高い成功率を達成する。
論文 参考訳(メタデータ) (2024-10-09T23:37:36Z) - LLM2LLM: Boosting LLMs with Novel Iterative Data Enhancement [79.31084387589968]
事前訓練された大規模言語モデル(LLM)は、現在、自然言語処理タスクの大部分を解決するための最先端技術である。
LLM2LLMは、教師のLLMを使って小さなシードデータセットを強化するデータ拡張戦略である。
GSM8Kデータセットでは最大24.2%、CaseHOLDでは32.6%、SNIPSでは32.0%、TRECでは52.6%、SST-2では39.8%の改善が達成された。
論文 参考訳(メタデータ) (2024-03-22T08:57:07Z) - Human-Instruction-Free LLM Self-Alignment with Limited Samples [64.69906311787055]
本研究では,人間の関与なしに,大規模言語モデル(LLM)を反復的に自己調整するアルゴリズムを提案する。
既存の研究と異なり、我々のアルゴリズムは人造指示にも報酬にも依存せず、人間の関与を著しく減らしている。
提案手法は,LLMの自己一般化能力を解き明かし,ほぼゼロに近い人的監督と整合性を持たせることができることを示す。
論文 参考訳(メタデータ) (2024-01-06T14:00:12Z) - TRACE: A Comprehensive Benchmark for Continual Learning in Large
Language Models [52.734140807634624]
調整された大規模言語モデル(LLM)は、タスク解決、指示に従うこと、安全性を確保することにおいて、例外的な能力を示す。
既存の連続学習ベンチマークでは、LLMをリードする上で十分な課題が欠如している。
LLMにおける継続学習を評価するための新しいベンチマークであるTRACEを紹介する。
論文 参考訳(メタデータ) (2023-10-10T16:38:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。