論文の概要: Towards Improving Sequential Decision-Making in LLM Agents via Experience Memory
- arxiv url: http://arxiv.org/abs/2608.03420v1
- Date: Tue, 04 Aug 2026 10:12:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.123651
- Title: Towards Improving Sequential Decision-Making in LLM Agents via Experience Memory
- Title(参考訳): 経験記憶によるLCMエージェントの逐次決定処理の改善に向けて
- Authors: Jakub Rada, Viliam Lisý,
- Abstract要約: 大規模言語モデルは単発推論タスクで大幅に改善されているが、シーケンシャルな意思決定における性能はよく理解されていない。
本研究では,完全観測可能な2プレイヤーゼロサムゲームについて検討する。
ゲーム後リフレクションとルール抽出は, モデル重みを変更することなく, tic-tac-toeに対して測定可能な改善をもたらすことを示す。
- 参考スコア(独自算出の注目度): 3.4935179780034242
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models have improved substantially on single-shot reasoning tasks, but their performance in sequential decision-making is less well understood. We study this on fully-observable two-player zero-sum games, which provide ground-truth evaluation: outcomes are determined by the rules, and optimality of individual moves can be computed or approximated, without relying on a judge model. Across model tiers, LLMs play suboptimally in simple games such as tic-tac-toe or Connect Four, and lose to MCTS opponents. Obfuscations that preserve the game tree but rewrite its surface form leave performance largely unchanged, indicating the gap is not fully explained by recall of memorized strategies. Motivated by this performance gap, we introduce an agentic framework enhanced with an experience memory designed for the sequential setting and addressing common challenges of sequential decision-making such as credit assignment. We show that post-game reflection and rule extraction yield measurable improvements on tic-tac-toe without modifying the model weights.
- Abstract(参考訳): 大規模言語モデルは単発推論タスクで大幅に改善されているが、シーケンシャルな意思決定における性能はよく理解されていない。
ルールによって結果が決定され、判断モデルに頼ることなく、個々の動きの最適性を計算または近似することができる。
モデル層全体では、LCMはtic-tac-toeやConnect Fourのような単純なゲームで亜最適にプレイし、MCTSの対戦相手に負ける。
ゲームツリーを保存し、表面のフォームを書き換える難読化はパフォーマンスをほとんど変更せず、記憶された戦略を思い出すことによって、そのギャップが完全に説明されないことを示す。
この性能ギャップに起因して、クレジット代入のようなシーケンシャルな意思決定の課題に対処し、シーケンシャルな設定のために設計された経験記憶を付加したエージェント型フレームワークを導入する。
ゲーム後リフレクションとルール抽出は, モデル重みを変更することなく, tic-tac-toeに対して測定可能な改善をもたらすことを示す。
関連論文リスト
- Strategy, Not Payoffs: A Behavioural Embedding of Normal-Form Games [8.99869329367482]
ゲーム間の微調整後, LLMの戦略能力の変化をゲーム埋め込みで説明し, 予測できるかどうかを検討する。
既存の構造的埋め込みはゲームのアイデンティティを記憶し、一般化に失敗するが、動作的埋め込みはホールドアウトゲームのパフォーマンス変化を確実に予測する。
論文 参考訳(メタデータ) (2026-07-30T00:10:21Z) - Spatial Reasoning in LLM Game Agents: Impact of Causal Context and Multi-Step Planning [56.67877550139192]
さまざまなモデルスケール、推論モード、計画的地平線をまたいだ実験を行います。
空間ナビゲーションを分離する5つの難易度を持つ3つのカスタムゲームからなる集中型GVGAIベンチマークを提案する。
提案手法により, より正確な位置の同定が可能であるが, 座標マッチングの全体的な性能は, より小さなモデルに限られていることがわかった。
論文 参考訳(メタデータ) (2026-07-22T12:10:45Z) - Beyond the Current Observation: Evaluating Multimodal Large Language Models in Controllable Non-Markov Games [69.57330692969543]
RNG-Benchは、過去の観測を再構築するベースモデルの能力を分離するために設計されたベンチマークスイートである。
RNG-Benchには2つの補完ゲームがある: マッチングペア(英語版) - 特定の場所でカードのIDを短期間明らかにする) と、エゴセントリックなビューを空間地図に統合する3D Maze である。
最も難しい構成では、約128Kのトークンと350のイメージ入力のコンテキストが必要であり、フロンティアMLLMによる飽和には程遠いままである。
論文 参考訳(メタデータ) (2026-06-17T17:59:34Z) - How Far Are LLMs from Professional Poker Players? Revisiting Game-Theoretic Reasoning with Agentic Tool Use [52.394999779049606]
大規模言語モデル(LLMs)は、ハイテイクなドメインにますます適用されています。
LLMは従来のアルゴリズムと競合しない。
ツール統合推論フレームワークであるToolPokerを提案する。
論文 参考訳(メタデータ) (2026-01-31T05:45:25Z) - LLM CHESS: Benchmarking Reasoning and Instruction-Following in LLMs through Chess [30.797553771114746]
LLM CHESSは,大規模言語モデル(LLM)における推論と命令追従能力の一般化を調査するための評価フレームワークである。
我々は,移動品質,移動法則,幻覚行動,ゲーム持続時間などの行動指標を用いて,ランダムな相手と対戦することで,50以上のオープンかつクローズドなソースモデルをランク付けする。
トップ推論モデルのサブセットとして,可変構成のスキルを持つチェスエンジンと対戦して,Elo推定を導出する。
論文 参考訳(メタデータ) (2025-12-01T18:51:08Z) - GAMEBoT: Transparent Assessment of LLM Reasoning in Games [54.49589494014147]
GAMEBoTは、大規模言語モデルの厳格な評価のために設計されたゲームアリーナである。
我々は,8つのゲームにまたがる17の卓越したLSMをベンチマークし,様々な戦略能力とゲーム特性について検討した。
以上の結果から,LDMに詳細なCoTプロンプトが付与されている場合でも,GAMEBoTは大きな課題となることが示唆された。
論文 参考訳(メタデータ) (2024-12-18T08:32:53Z) - Auto-Encoding Bayesian Inverse Games [36.06617326128679]
ゲームの性質が不明な逆ゲーム問題を考える。
既存の最大推定手法は、未知のパラメータの点推定のみを提供する。
ベイズ的視点を採り、ゲームパラメータの後方分布を構成する。
この構造化されたVAEは、観測された相互作用のラベルのないデータセットから訓練することができる。
論文 参考訳(メタデータ) (2024-02-14T02:17:37Z) - Bandit Linear Optimization for Sequential Decision Making and
Extensive-Form Games [102.23975166536326]
tree-form sequential decision making (tfsdm) は、エージェントと潜在的に敵対的な環境の間のツリー形式の相互作用をモデル化することで、古典的なワンショット意思決定を拡張する。
これは、各プレイヤーが幅広い形式のゲームで直面するオンライン意思決定問題、およびマルコフ決定プロセス、およびエージェントが観測された履歴を条件とする部分観察可能なマルコフ決定プロセスをキャプチャする。
本稿では, (i) 線形時間損失と (ii) $o(sqrtt)$ cumulative regret の両方を提供する拡張dmのバンディット線形最適化問題に対する最初のアルゴリズムを提案する。
論文 参考訳(メタデータ) (2021-03-08T05:00:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。