論文の概要: GRASP: Generating, Revising, and Assessing for Strategic Planning with Agentic AI
- arxiv url: http://arxiv.org/abs/2609.30147v1
- Date: Thu, 24 Sep 2026 17:11:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 21:10:10.146007
- Title: GRASP: Generating, Revising, and Assessing for Strategic Planning with Agentic AI
- Title(参考訳): GRASP:エージェントAIによる戦略的計画の生成、修正、評価
- Abstract要約: 大規模言語モデル(LLM)は通常、タスクの複雑さが増加するにつれて信頼性が低下するパフォーマンスプロファイルを示す。
我々は、$textbfGRASP$を導入して、複雑なタスクのための高品質な自然言語実行プランを作成するという課題に対処する。
GRASPは、特別なコンテキスト分離されたモジュール間で計画パイプラインを分離する。
- 参考スコア(独自算出の注目度): 36.644786364066796
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large Language Models (LLMs) typically exhibit a performance profile where reliability degrades as task complexity increases. We address the challenge of generating high-quality natural language executable plans for complex tasks by introducing $\textbf{GRASP}$, a strategy-aware, multi-stage planning framework. GRASP decouples the planning pipeline across specialized, context-isolated modules: it pre-compiles global macro-guidelines (GenPlan), explores alternative localized strategies within isolated context windows (RevPlan), and independently evaluates trajectories using a multi-criteria discriminator (VerPlan). Empirical evaluations show that GRASP consistently establishes a new state-of-the-art frontier across diverse datasets, yielding substantial accuracy gains over direct LLM planners on Natural Plan Calendar Scheduling ($\sim$12.4$\%$$\uparrow$), ZebraLogic ($\sim$30.8$\%$$\uparrow$), and SciBench Math. Crucially, under multi-task scaling-where standard planners suffer immediate performance collapse-GRASP completely flattens the multi-task degradation penalty. In interleaved dual-task environments, GRASP achieves an absolute accuracy gain of up to 16.7$\%$ over direct LLM planners. Furthermore, by isolating context and enforcing strict macro-regularization, GRASP outperforms frontier reasoning models (such as GPT-5-mini) by a margin of 14.5$\%$.
- Abstract(参考訳): 大規模言語モデル(LLM)は通常、タスクの複雑さが増加するにつれて信頼性が低下するパフォーマンスプロファイルを示す。
戦略対応多段階計画フレームワークである$\textbf{GRASP}$を導入することで,複雑なタスクのための高品質な自然言語実行計画を生成するという課題に対処する。
グローバルマクロガイドライン(GenPlan)をプリコンパイルし、分離されたコンテキストウィンドウ(RevPlan)内の別のローカライズされた戦略を探索し、マルチクレータ識別器(VerPlan)を使用してトラジェクトリを独立に評価する。
実験的な評価によると、GRASPはさまざまなデータセットにまたがる新たな最先端のフロンティアを一貫して確立しており、Natural Plan Calendar Scheduling(\sim$12.4$\%$\uparrow$)、ZebraLogic(\sim$30.8$\%$\uparrow$)、SciBench Math(英語版)の直接LLMプランナーよりもかなり精度が向上している。
重要なことに、マルチタスクのスケーリング環境では、標準プランナーは直ちにパフォーマンスが低下し、GRASPはマルチタスクの劣化のペナルティを完全にフラットにする。
インターリーブされたデュアルタスク環境では、GRASPは直接LLMプランナーよりも最大16.7$\%の精度を得る。
さらに、文脈を分離し、厳密なマクロ規則化を強制することにより、GRASPはフロンティア推論モデル(GPT-5-miniなど)を14.5$\%のマージンで上回る。
関連論文リスト
- Scale-Plan: Scalable Language-Enabled Task Planning for Heterogeneous Multi-Robot Teams [11.964765256346857]
不均質なマルチロボットシステムのための長期タスクプランニングは、実環境における協調チームの配置に不可欠である。
自然言語命令からタスク関連問題表現をコンパクトに生成する,スケーラブルなLLM支援フレームワークであるScale-Planを提案する。
計画に先立って無関係な情報をフィルタリングすることにより、スケールプランは効率的な分解、割り当て、長期計画生成を可能にします。
論文 参考訳(メタデータ) (2026-03-09T18:13:18Z) - MagicAgent: Towards Generalized Agent Planning [73.21129030631421]
汎用エージェント計画に特化して設計された基盤モデルである textbfMagicAgent について述べる。
多様な計画タスクにまたがる高品質なトラジェクトリを生成する軽量でスケーラブルな合成データフレームワークを提案する。
MagicAgent-32B と MagicAgent-30B-A3B は様々なオープンソースベンチマークにおいて優れた性能を発揮することを示す。
論文 参考訳(メタデータ) (2026-02-22T01:39:16Z) - Diverse Planning with Simulators via Linear Temporal Logic [1.684937603700545]
$textttFBI_textttLTL$は、シミュレーションベースの計画問題のために明示的に設計された多種多様なプランナーである。
これらベースの多様性モデルを検索プロセスに直接統合することにより、$textttFBI_textttLTL$は、意味的に多様なプランの生成を保証する。
論文 参考訳(メタデータ) (2025-10-20T10:59:09Z) - PLAN-TUNING: Post-Training Language Models to Learn Step-by-Step Planning for Complex Problem Solving [66.42260489147617]
大規模言語モデルから合成タスク分解を蒸留するフレームワークであるPLAN-TUNINGを紹介する。
複雑な推論を改善するために、教師付きおよび強化学習の目的を通したプランチューン細管モデル。
本分析は,計画軌道が複雑な推論能力をいかに改善するかを示す。
論文 参考訳(メタデータ) (2025-07-10T07:30:44Z) - On The Planning Abilities of OpenAI's o1 Models: Feasibility, Optimality, and Generalizability [59.72892401927283]
さまざまなベンチマークタスクでOpenAIのo1モデルの計画能力を評価する。
その結果,o1-preview は GPT-4 よりもタスク制約に順応していることがわかった。
論文 参考訳(メタデータ) (2024-09-30T03:58:43Z) - Describe, Explain, Plan and Select: Interactive Planning with Large Language Models Enables Open-World Multi-Task Agents [26.78244595330595]
「$underlineD$escribe」は、Large Language Models(LLMs)に基づく対話型計画手法である。
DEPSは、計画実行プロセスの$textitdescription$を統合することで、初期LLM生成の$textitplan$のエラー修正を容易にする。
実験は、70以上のMinecraftタスクを確実に達成できる最初のゼロショットマルチタスクエージェントのマイルストーンとなる。
論文 参考訳(メタデータ) (2023-02-03T06:06:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。