論文の概要: Language Model Planners do not Scale, but do Formalizers?
- arxiv url: http://arxiv.org/abs/2603.23844v1
- Date: Wed, 25 Mar 2026 02:01:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-26 21:06:11.086644
- Title: Language Model Planners do not Scale, but do Formalizers?
- Title(参考訳): 言語モデルプランナはスケールしないが、形式化はできるのか?
- Authors: Owen Jiang, Cassie Huang, Ashish Sabharwal, Li Zhang,
- Abstract要約: 最近の研究は、LCMが、推論トレースをスケールするように訓練された人でさえ、計画上の問題を解決するのが複雑すぎると満足できないという圧倒的な証拠を示している。
LLMフォーミュラは、従来のBlocksWorldドメインでは、最大10,165ドルという巨大な状態空間の完全な精度を維持している。
計画領域定義言語(PDDL)など,問題記述の一行が指数関数的に多くの形式言語に対応するような未解決問題を導入する。
- 参考スコア(独自算出の注目度): 24.304261654384927
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Recent work shows overwhelming evidence that LLMs, even those trained to scale their reasoning trace, perform unsatisfactorily when solving planning problems too complex. Whether the same conclusion holds for LLM formalizers that generate solver-oriented programs remains unknown. We systematically show that LLM formalizers greatly out-scale LLM planners, some retaining perfect accuracy in the classic BlocksWorld domain with a huge state space of size up to $10^{165}$. While performance of smaller LLM formalizers degrades with problem complexity, we show that a divide-and-conquer formalizing technique can greatly improve its robustness. Finally, we introduce unraveling problems where one line of problem description realistically corresponds to exponentially many lines of formal language such as the Planning Domain Definition Language (PDDL), greatly challenging LLM formalizers. We tackle this challenge by introducing a new paradigm, namely LLM-as-higher-order-formalizer, where an LLM generates a program generator. This decouples token output from the combinatorial explosion of the underlying formalization and search space.
- Abstract(参考訳): 最近の研究は、LCMが、推論トレースをスケールするように訓練された人でさえ、計画上の問題を解決するのが複雑すぎると満足できないという圧倒的な証拠を示している。
ソルバ指向プログラムを生成する LLM の形式化について、同じ結論が成立するかどうかは不明だ。
LLMフォーミュラは,従来のBlocksWorldドメインにおいて,最大10〜165ドルという巨大な状態空間を持つ完全精度を維持している。
より小型のLCMフォーマライザの性能は問題複雑度で劣化するが, 分割とコンカライザのフォーマライズ技術により, その堅牢性を大幅に向上させることができることを示す。
最後に,問題記述の一行が,計画ドメイン定義言語 (PDDL) などの指数関数的に多くの形式言語に対応し,LLM形式化に非常に挑戦する未解決問題を紹介する。
本稿では,LLM がプログラム生成器を生成する LLM-as-higher-order-formalizer という新しいパラダイムを導入することで,この問題に対処する。
これは、基礎となる形式化と探索空間の組合せ爆発からのトークン出力を分離する。
関連論文リスト
- Are LLMs Better Formalizers than Solvers on Complex Problems? [9.711592497202401]
最近の研究のトレンドは、大規模言語モデル(LLM)を形式化子として、エンドツーエンドの解決子としてではなく、使用することを提唱している。
この優位性は,実生活における制約満足度の問題に負わないことを示す。
論文 参考訳(メタデータ) (2025-05-19T15:35:17Z) - Combining LLM Code Generation with Formal Specifications and Reactive Program Synthesis [0.7580487359358722]
大規模言語モデル(LLM)は精度に苦しむが、リスクの高いアプリケーションには適さない。
コード生成を LLM で処理する部分と,形式的なメソッドベースのプログラム合成で処理する部分の2つに分割する手法を提案する。
論文 参考訳(メタデータ) (2024-09-18T15:59:06Z) - Delta-CoMe: Training-Free Delta-Compression with Mixed-Precision for Large Language Models [79.46938238953916]
多様なアプリケーションへの微調整された大規模言語モデル(LLM)は、複雑な要求を満たすために不可欠である。
近年の研究では、微調整LDMをベースモデルと対応するデルタウェイトに分解し、低ランクまたは低ビットのアプローチで圧縮してコストを削減することが示唆されている。
本研究では,従来の低ランク圧縮法と低ビット圧縮法がタスク固有の微調整LDMのモデル性能を著しく損なうことを観察する。
論文 参考訳(メタデータ) (2024-06-13T07:57:27Z) - From Words to Actions: Unveiling the Theoretical Underpinnings of LLM-Driven Autonomous Systems [59.40480894948944]
大規模言語モデル (LLM) は、物理世界の意思決定問題を解くことができる。
このモデルの下で、LLM Plannerは、プロンプトを介して言語ベースのサブゴールを反復的に生成することにより、部分的に観測可能なマルコフ決定プロセス(POMDP)をナビゲートする。
我々は,事前学習したLLMプランナーが,文脈内学習を通じてベイズ的集計模倣学習(BAIL)を効果的に行うことを証明した。
論文 参考訳(メタデータ) (2024-05-30T09:42:54Z) - LLMs Can't Plan, But Can Help Planning in LLM-Modulo Frameworks [18.068035947969044]
計画と推論タスクにおけるLLM(Large Language Models)の役割には、かなりの混乱がある。
自己回帰型LSMは、それ自体で計画や自己検証を行うことはできない、と我々は主張する。
本稿では,LLMの強みと外部モデルベース検証器を併用した bf LLM-Modulo Framework のビジョンを提案する。
論文 参考訳(メタデータ) (2024-02-02T14:43:18Z) - LLM-Pruner: On the Structural Pruning of Large Language Models [65.02607075556742]
大規模言語モデル(LLM)は、言語理解と生成において顕著な能力を示している。
タスク非依存であり、元のトレーニングデータセットへの依存を最小限に抑えるという2つの制約の範囲内でLLMの圧縮に取り組む。
LLM-Prunerという名前のこの手法は、非臨界結合構造を選択的に除去する構造プルーニングを採用する。
論文 参考訳(メタデータ) (2023-05-19T12:10:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。