論文の概要: Deconstructing Spatial Complexity: Hierarchical Decomposition for LLM Spatial Reasoning
- arxiv url: http://arxiv.org/abs/2605.28144v1
- Date: Wed, 27 May 2026 08:26:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-28 17:38:55.891348
- Title: Deconstructing Spatial Complexity: Hierarchical Decomposition for LLM Spatial Reasoning
- Title(参考訳): 空間複雑性の分解:LLM空間推論のための階層的分解
- Authors: Yi Wang, Haojie Lu, Zhaofan Zhang, Li Chen, Sihong Xie,
- Abstract要約: 本稿では,LLM空間推論における階層的タスク分解の新しい手法を提案する。
本手法は,ナビゲーション,計画,戦略ゲームなどの空間的タスクにおけるLLM性能を大幅に向上させる。
この研究は、現実世界のアプリケーションにおけるLLMの道を開いた。
- 参考スコア(独自算出の注目度): 15.510513857489416
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: LLMs have shown remarkable proficiency in general language understanding and reasoning. However, they consistently underperform in spatial reasoning that severely limits their application, particularly in embodied intelligence. Inspired by the success of hierarchical reinforcement learning, this paper introduces a novel method for hierarchical task decomposition in LLM spatial reasoning. Our approach guides LLMs to decompose complex tasks into manageable sub-tasks by identifying key intermediate states and generating simplified sub-environments. However, we identify that LLMs often fail to derive optimal intermediate states due to their insufficient spatial prior, leading to sub-optimal task decomposition. To address this limitation and enhance its planning capability, we propose the MCTS-Guided Group Relative Policy Optimization (M-GRPO), where we reformulate the UCT formula by incorporating the LLM's prior predictive probabilities alongside its epistemic uncertainty. Furthermore, we implement a more fine-grained advantage function, enabling the model to learn optimal path planning. Experimental results demonstrate that our method substantially improves LLM performance on spatial tasks, including navigation, planning, and strategic games, achieving state-of-the-art results. This work paves the way for LLMs in real-world applications.
- Abstract(参考訳): LLMは、一般的な言語理解と推論において顕著な熟練を見せている。
しかし、それらは、特に具体的知性において、その応用を著しく制限する空間的推論において、一貫して性能が劣っている。
階層的強化学習の成功に触発されて,LLM空間推論における階層的タスク分解の新しい手法を提案する。
提案手法では, 複雑なタスクを管理可能なサブタスクに分解し, 鍵となる中間状態を特定し, 単純化したサブ環境を生成する。
しかし, LLMは空間的先行性に乏しいため, 最適中間状態の導出に失敗することが多く, 準最適タスクの分解に繋がる。
MCTS-Guided Group Relative Policy Optimization (M-GRPO) は,この制限に対処し,その計画能力を向上させるために,LLMの既往の予測確率と,その疫学的不確実性とを組み込むことで,UCTの公式を再構成する。
さらに、よりきめ細かい利点関数を実装し、モデルが最適な経路計画を学習できるようにする。
実験の結果,航法,計画,戦略ゲームなど空間的タスクにおけるLLM性能が大幅に向上し,最先端の成果が得られた。
この研究は、現実世界のアプリケーションにおけるLLMの道を開いた。
関連論文リスト
- Guiding Reasoning in Small Language Models with LLM Assistance [23.3038074903744]
小さな言語モデルは、深く、多段階の論理的推論を必要とするタスクに適していると疑念を抱いた。
本稿では,Small Reasons, Large Hintsというフレームワークについて紹介する。
数学的推論データセットを用いた実験により, ターゲットとなる外部足場の性能が著しく向上することが示された。
論文 参考訳(メタデータ) (2025-04-14T06:32:45Z) - Option Discovery Using LLM-guided Semantic Hierarchical Reinforcement Learning [16.654435148168172]
大規模言語モデル(LLM)は、推論と意思決定において顕著な将来性を示している。
サンプル効率,一般化,マルチタスク適応性を向上させるため,LDSCと呼ばれるLCM誘導階層型RLフレームワークを提案する。
論文 参考訳(メタデータ) (2025-03-24T15:49:56Z) - Embodied CoT Distillation From LLM To Off-the-shelf Agents [6.318203525449058]
DeDerは、大規模言語モデル(LLM)から具体的推論能力を分解し、蒸留するためのフレームワークである。
ALFREDベンチマークによる我々の実験は、DeDerが先進的な言語計画と蒸留アプローチを超越していることを示している。
論文 参考訳(メタデータ) (2024-12-16T07:18:02Z) - Q*: Improving Multi-step Reasoning for LLMs with Deliberative Planning [53.6472920229013]
大規模言語モデル(LLM)は多くの自然言語タスクにおいて印象的な能力を示している。
LLMは多段階推論を行う際にエラー、幻覚、矛盾する文を生成する傾向がある。
本稿では,LLMの復号化過程を検討計画で導くためのフレームワークであるQ*を紹介する。
論文 参考訳(メタデータ) (2024-06-20T13:08:09Z) - Exploring and Benchmarking the Planning Capabilities of Large Language Models [57.23454975238014]
この研究は、大規模言語モデル(LLM)の計画能力を改善するための基礎を築いた。
我々は、古典的な計画ベンチマークと自然言語シナリオの両方を含む包括的なベンチマークスイートを構築した。
本研究は,LLM計画の強化を目的としたマルチショットインコンテキスト学習について検討し,文脈長の増大と計画性能の向上の関係について検討する。
論文 参考訳(メタデータ) (2024-06-18T22:57:06Z) - From Words to Actions: Unveiling the Theoretical Underpinnings of LLM-Driven Autonomous Systems [59.40480894948944]
大規模言語モデル (LLM) は、物理世界の意思決定問題を解くことができる。
このモデルの下で、LLM Plannerは、プロンプトを介して言語ベースのサブゴールを反復的に生成することにより、部分的に観測可能なマルコフ決定プロセス(POMDP)をナビゲートする。
我々は,事前学習したLLMプランナーが,文脈内学習を通じてベイズ的集計模倣学習(BAIL)を効果的に行うことを証明した。
論文 参考訳(メタデータ) (2024-05-30T09:42:54Z) - Towards Efficient LLM Grounding for Embodied Multi-Agent Collaboration [68.29746557968107]
本稿では,多エージェント協調のための新しいフレームワークを提案する。これは,効率的な自己調整のための強化アドバンテージフィードバック(Reinforced Advantage feedback, ReAd)を導入する。
Over-AIと難解なRoCoBenchの実験は、ReAdが成功率のベースラインを超え、エージェントの相互作用ステップを著しく減少させることを示している。
論文 参考訳(メタデータ) (2024-05-23T08:33:19Z) - LgTS: Dynamic Task Sampling using LLM-generated sub-goals for
Reinforcement Learning Agents [10.936460061405157]
LgTS (LLM-Guided Teacher-Student Learning) を提案する。
提案手法では,提案したサブゴールを達成するための事前訓練されたポリシーも必要としない。
論文 参考訳(メタデータ) (2023-10-14T00:07:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。