論文の概要: NeSyFS: A Neuro-symbolic Fast-Slow Thinking Framework for LLM Agent under Partial Observability
- arxiv url: http://arxiv.org/abs/2607.28942v2
- Date: Mon, 03 Aug 2026 20:04:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 13:15:27.405758
- Title: NeSyFS: A Neuro-symbolic Fast-Slow Thinking Framework for LLM Agent under Partial Observability
- Title(参考訳): NeSyFS: 部分観察可能なLLMエージェントのためのニューロシンボリック高速思考フレームワーク
- Abstract要約: 大規模言語モデル(LLM)は、自己回帰、検索強化生成、科学的発見などの応用において、自律的なエージェントとしてますます多くデプロイされている。
これは、信念状態推論、タスク目的のミスアライメント、不確実性の下での計画など、いくつかの重要な課題を導入します。
本稿では,LLMエージェントのためのニューロシンボリック・ファストスロー思考(NeSyFS)フレームワークを提案する。
- 参考スコア(独自算出の注目度): 16.584782300163862
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recently Large Language Models (LLMs) have been increasingly deployed as autonomous agents in applications such as self-reflection, retrieval-augmented generation, and scientific discovery. In these settings, agents must act based on limited observations rather than full environmental states, leading to partial observability. This introduces several key challenges: belief state inference, task objective misalignment, and planning under uncertainty. Prior approaches typically condition actions on full or summarized action-observation histories whose redundant and irrelevant information can mislead the decision making of LLM agent. Inspired by human cognition, we propose a novel neuro-symbolic fast-slow thinking (NeSyFS) framework for LLM agent, addressing the challenges introduced by partial observability in a unified approach. We use a knowledge graph (KG) to represent the belief state, providing triplets as context for every module of NeSyFS. The fast-thinking module performs reactive action, while slow-thinking conducts a new uncertainty-aware planning by following the high-level structure of twisted sequential Monte Carlo (TSMC) algorithm. To mitigate the misalignment of task objective, a reflection module is used to reflect fast-thinking actions, and also switches to the slow-thinking module whenever reactive actions repeatedly fail. Experiments on three representative benchmarks, i.e. ALFWorld, Webshop, and ScienceWorld, demonstrate significant advantages over previous methods.
- Abstract(参考訳): 近年のLarge Language Models (LLM) は、自己回帰、検索強化生成、科学的発見などの応用において、自律的なエージェントとしてますます多くデプロイされている。
これらの設定では、エージェントは完全な環境状態ではなく、限られた観測に基づいて行動しなければなりません。
これは、信念状態推論、タスク目的のミスアライメント、不確実性の下での計画など、いくつかの重要な課題を導入します。
従来のアプローチでは、冗長で無関係な情報がLDMエージェントの意思決定を誤解させる可能性がある、完全なまたは要約されたアクション・オブザーブレーション履歴に対する条件アクションが一般的であった。
そこで我々は,LLMエージェントのためのニューロシンボリック・ファストスロー思考(NeSyFS)フレームワークを提案する。
我々は知識グラフ(KG)を用いて信念状態を表現し、NeSyFSの各モジュールのコンテキストとして三重項を提供する。
高速思考モジュールは反応作用を行い、スロー思考は、ツイスト・シーケンシャルモンテカルロ(TSMC)アルゴリズムの高レベル構造に従うことによって、新しい不確実性認識計画を実行する。
タスク目的のミスアライメントを軽減するために、リフレクションモジュールは、迅速な思考動作を反映するために使用され、また、繰り返し発生する反応動作が失敗するたびに、スロー思考モジュールに切り替える。
ALFWorld、Webshop、ScienceWorldの3つの代表的なベンチマーク実験は、従来の手法よりも大きな利点を示している。
関連論文リスト
- SchemeArena: Factorized Stress Testing of Scheming in LLM Agents [15.436206398870986]
計画の主な要因は、機器の目標、環境の余裕、監視条件、そして認識された結果である。
SCHEMEARENAは、スケーラブルなシェーミングストレステストのための400-scenarioベンチマークである。
SCOUTは、エージェントの推論と行動から引き出された証拠を判断するスケジュールモニターである。
論文 参考訳(メタデータ) (2026-09-08T02:02:51Z) - Self-Evolving Agentic Image Restoration via Deliberate Planning and Intuitive Execution [27.721743933778004]
自己進化型エージェント画像復元は、シーケンシャルな意思決定問題として復元を定式化する。
二重プロセス理論にインスパイアされたSEARは直感的実行器と自由計画器から構成される。
合成および実世界のベンチマークの実験は、その強い知覚と量的性能を示す。
論文 参考訳(メタデータ) (2026-06-27T15:21:47Z) - A2RBench: An Automatic Paradigm for Formally Verifiable Abstract Reasoning Benchmark Generation [59.98516959731531]
抽象推論能力は、抽象ルールを抽出し適用するためのLLMの知性と能力を反映する。
既存のベンチマークは、高価な手作業のアノテーション、そのスケールの制限、あるいは真の推論ではなく暗記のリスク測定に頼っている。
我々はA2RBenchという名の自動パイプラインを導入し、生成、拡張、評価、分析を行う。
論文 参考訳(メタデータ) (2026-05-17T06:14:20Z) - Think Anywhere in Code Generation [89.9273351013764]
Think-Anywhereは、LLMがコード生成中にオンデマンドで思考を実行することを可能にする、新しい推論メカニズムである。
我々は,Think-Anywhereが既存の推論手法と最近のポストトレーニング手法の両方に対して最先端の性能を達成することを示す。
分析の結果,Think-Anywhereは高エントロピー位置での推論を適応的に実行し,解釈可能性を高めることができることがわかった。
論文 参考訳(メタデータ) (2026-03-31T16:24:03Z) - Farther the Shift, Sparser the Representation: Analyzing OOD Mechanisms in LLMs [100.02824137397464]
難易度が増大する入力に遭遇した場合,大規模言語モデルが内部表現をどのように適応するかを検討する。
タスクの難易度が増大するにつれて、LLMの最後の隠れ状態は実質的にスペーサーとなる。
この空間性-微分的関係は、様々なモデルや領域で観測可能である。
論文 参考訳(メタデータ) (2026-03-03T18:48:15Z) - The Landscape of Agentic Reinforcement Learning for LLMs: A Survey [103.32591749156416]
エージェント強化学習(Agentic RL)の出現は、大規模言語モデル(LLM RL)に適用された従来の強化学習からパラダイムシフトを示している。
本研究では, LLM-RLの縮退した単段階マルコフ決定過程(MDPs)と, エージェントRLを定義する部分可観測マルコフ決定過程(POMDPs)とを対比することにより, この概念シフトを定式化する。
論文 参考訳(メタデータ) (2025-09-02T17:46:26Z) - Who Sees What? Structured Thought-Action Sequences for Epistemic Reasoning in LLMs [1.090218572228214]
本研究では,LLMをベースとしたReActフレームワークの性能向上のための構造化例の可能性について検討した。
本稿では、最適ゴールパス(G型)、情報ノードパス(E型)、ステップバイステップの最適決定シーケンス(L型)の3つのカテゴリの例を生成する、構造化された解処理パイプラインを提案する。
L型の例は、明確化要求と全体的なアクションステップをわずかに削減するが、一貫性のある改善は得られない。
論文 参考訳(メタデータ) (2025-08-20T09:36:53Z) - MARBLE: A Multi-Agent Rule-Based LLM Reasoning Engine for Accident Severity Prediction [1.3102025155414727]
交通安全システムにおいて,事故重大度予測が重要な役割を担っている。
既存の方法はしばしばモノリシックモデルやブラックボックスプロンプトに依存している。
本稿では,多エージェントルールに基づくLLMエンジンを提案し,その重大性予測タスクを,専門的推論エージェントのチーム間で分解する。
論文 参考訳(メタデータ) (2025-07-07T11:27:49Z) - Benchmarking Spatiotemporal Reasoning in LLMs and Reasoning Models: Capabilities and Challenges [4.668749313973097]
本稿では,Large Language Models (LLMs) とLarge Reasoning Models (LRMs) を3段階の推論複雑性で体系的に評価する。
モデルが直接、あるいはPython Code Interpreterによって応答する26の課題をキュレートします。
LRMは、様々な難易度を持つタスク間で堅牢なパフォーマンスを示し、しばしば従来の第一原理に基づく手法と競合する。
論文 参考訳(メタデータ) (2025-05-16T18:32:35Z) - ReMA: Learning to Meta-think for LLMs with Multi-Agent Reinforcement Learning [53.817538122688944]
Reinforced Meta-thinking Agents (ReMA) を導入し,Large Language Models (LLMs) の推論からメタ思考行動を求める。
ReMAは、推論プロセスを2つの階層的なエージェントに分解する。戦略上の監視と計画を生成するハイレベルなメタ思考エージェントと、詳細な実行のための低レベルな推論エージェントである。
単ターン実験による実験結果から、ReMAは複雑な推論タスクにおいて単エージェントRLベースラインよりも優れることが示された。
論文 参考訳(メタデータ) (2025-03-12T16:05:31Z) - Reason for Future, Act for Now: A Principled Framework for Autonomous
LLM Agents with Provable Sample Efficiency [53.8779374188643]
本稿では,推論と行動のオーケストレーションを行うための,証明可能な後悔の保証を備えた原則的枠組みを提案する。
具体的には、メモリバッファから学習する推論のためのプロンプトテンプレートを設計し、長い水平線上で将来の軌道を計画する。
各ステップにおいて、LLMエージェントは計画された軌跡の初期動作("act for now")を受け取り、収集したフィードバックをメモリバッファに格納し、推論ルーチンを再起動して、将来の軌跡を新しい状態から再設計する。
論文 参考訳(メタデータ) (2023-09-29T16:36:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。