論文の概要: CAST: Game Solvers as Turn-Level Teachers for LLM Agents
- arxiv url: http://arxiv.org/abs/2607.25308v1
- Date: Tue, 28 Jul 2026 05:39:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 20:50:42.721972
- Title: CAST: Game Solvers as Turn-Level Teachers for LLM Agents
- Title(参考訳): LLMエージェントのターンレベル教師としてのゲームソリューション
- Abstract要約: 大きな言語モデル(LLM)を訓練して、長距離ゲームで動作させることは、ジェネラリストの意思決定に向けた有望なステップである。
デンサープロセスの信号はこのターンレベルの信用を欠く可能性があるが、既存の情報源は安価で正確な情報を維持することは難しい。
本稿では,ゲームソルバの状態値の変化をデザイナの利点に変換し,ターンレベルの信号としてRLVRに注入するCASTを提案する。
- 参考スコア(独自算出の注目度): 78.2379284312811
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Training large language models (LLMs) to act in long-horizon games is a promising step toward generalist decision-making, yet reinforcement learning with verifiable rewards (RLVR) relies on sparse final rewards that reveal little about which decisions determine success. Denser process signals could supply this missing turn-level credit, but existing sources are hard to keep both cheap and accurate. We observe that changes in a game solver's state value reveal whether an action advances the state toward success. Building on this insight, we propose CAST (Credit Assignment from Solver Teachers), which converts these value changes into solver advantages and injects them into RLVR as turn-level signals. We further show that, under a soft-optimal solver assumption, maximizing the solver advantage is equivalent to on-policy distillation from the solver, requiring only scalar values rather than teacher logits. Across Sokoban, Minesweeper, and Rush Hour, CAST outperforms all trained baselines on every game under both in-domain and unseen-difficulty evaluation and achieves the highest average zero-shot performance on ALFWorld and WebShop. Our code is available at https://github.com/Wloner0809/CAST.
- Abstract(参考訳): 大きな言語モデル(LLM)をロングホライゾンゲームで動作させる訓練は、汎用的な意思決定に向けた有望なステップであるが、検証可能な報酬(RLVR)による強化学習は、どの決定が成功するかをほとんど明らかにしない、希少な最終報酬に依存している。
デンサープロセスの信号はこのターンレベルの信用を欠く可能性があるが、既存の情報源は安価で正確な情報を維持することは難しい。
ゲーム解決者の状態値の変化は、アクションが成功に向かって状態を前進させるかどうかを明らかにする。
そこで本研究では,CAST(Credit Assignment from Solver Teachers)を提案し,これらの値変化を解答器の利点に変換し,ターンレベルの信号としてRLVRに注入する。
さらに,ソフト・最適解法仮定の下では,解法の優位性を最大化することは,解法からのオンライン蒸留と等価であり,教師のロジットよりもスカラー値のみを必要とすることを示す。
Sokoban、Minesweeper、Rush Hourの他、CASTはドメイン内および目に見えない両方の評価の下でトレーニングされたすべてのベースラインを上回り、ALFWorldとWebShopで最高のゼロショットパフォーマンスを達成する。
私たちのコードはhttps://github.com/Wloner0809/CASTで公開されています。
関連論文リスト
- LLM-as-a-Verifier: A General-Purpose Verification Framework [74.40111651545979]
本稿では,汎用検証フレームワーク LLM-as-a-Verifier を紹介する。
追加のトレーニングを必要とせずに、エージェントタスクに対してきめ細かいフィードバックを提供する。
いくつかのベンチマークで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-07-06T17:59:35Z) - Reinforcement Learning without Ground-Truth Solutions can Improve LLMs [47.0243847990524]
LLMを訓練するための検証可能な報酬(RLVR)による強化学習は、典型的には報酬を割り当てるために根底からの回答に依存している。
我々は,スコアベース最適化タスクにLLMをトレーニングするtextbfRanking-textbf誘発のtextbfverible framework (RiVER)を導入する。
論文 参考訳(メタデータ) (2026-06-25T17:59:36Z) - Odysseus: Scaling VLMs to 100+ Turn Decision-Making in Games via Reinforcement Learning [50.464623632604976]
本研究では,スーパーマリオランドにおける長期意思決定のための視覚言語モデル(VLM)の学習について検討する。
本稿では,軽量なターンレベルの批評家によるPPOの適応版を提案し,トレーニングの安定性とサンプル効率を大幅に向上させる。
我々は,VLMエージェントのオープントレーニングフレームワークであるOdysseusを紹介し,ゲーム内の複数のレベルにおいて,実質的なゲインを達成する。
論文 参考訳(メタデータ) (2026-05-01T02:05:56Z) - GAMEBoT: Transparent Assessment of LLM Reasoning in Games [54.49589494014147]
GAMEBoTは、大規模言語モデルの厳格な評価のために設計されたゲームアリーナである。
我々は,8つのゲームにまたがる17の卓越したLSMをベンチマークし,様々な戦略能力とゲーム特性について検討した。
以上の結果から,LDMに詳細なCoTプロンプトが付与されている場合でも,GAMEBoTは大きな課題となることが示唆された。
論文 参考訳(メタデータ) (2024-12-18T08:32:53Z) - Dense Reward for Free in Reinforcement Learning from Human Feedback [64.92448888346125]
我々は報酬モデルが単にスカラー出力よりも多くの情報を含んでいるという事実を活用している。
私たちは、これらの注意重みを使って、完了全体に沿って報酬を再分配します。
経験的に、トレーニングを安定化し、学習速度を加速し、実際は、より良い局所最適性をもたらす可能性があることを示す。
論文 参考訳(メタデータ) (2024-02-01T17:10:35Z) - Scaling Laws for Imitation Learning in Single-Agent Games [28.257046559127875]
我々は,モデルとデータサイズを慎重にスケールアップすることで,シングルエージェントゲームにおける模倣学習環境に類似した改善がもたらされるかどうかを検討する。
われわれはまずAtariのさまざまなゲームについて実験を行い、その後NetHackの非常に挑戦的なゲームに焦点を当てた。
IL損失と平均戻り値は計算予算とスムーズに一致し,相関関係が強く,計算最適ILエージェントの訓練には電力法則が適用されることがわかった。
論文 参考訳(メタデータ) (2023-07-18T16:43:03Z) - Provably Efficient Generalized Lagrangian Policy Optimization for Safe
Multi-Agent Reinforcement Learning [105.7510838453122]
制約付きマルコフゲームを用いたオンライン安全なマルチエージェント強化学習について検討する。
我々は,このラグランジアン問題を解くための高信頼強化学習アルゴリズムを開発した。
提案アルゴリズムは,オンラインミラー降下によるミニマックス決定主元変数と,投影勾配ステップによる双対変数を更新する。
論文 参考訳(メタデータ) (2023-05-31T22:09:24Z) - A Ranking Game for Imitation Learning [22.028680861819215]
模倣を、$textitpolicy$と$textitreward$関数の間の2プレイヤーランキングベースのStackelbergゲームとして扱う。
このゲームは、オフラインの好みから学習する逆強化学習(IRL)法と方法の両方の多くのサブセットを含んでいる。
本研究では,均衡条件下での準最適模倣学習を容易にするために,政策性能のランク付けに使用される損失関数の要件を理論的に分析する。
論文 参考訳(メタデータ) (2022-02-07T19:38:22Z) - Doubly Optimal No-Regret Online Learning in Strongly Monotone Games with Bandit Feedback [29.553652241608997]
本研究では,テキストモオと強いモノトーンゲームの研究を行い,その学習方法について検討した。
我々はまず,新しい帯域学習アルゴリズムを構築し,$tildeTheta(nsqrtT)$の単一エージェント最適後悔を実現することを示す。
そこで我々は,このオープンな問題を解決し,広範にわたるバンディットゲーム理論学習に寄与した。
論文 参考訳(メタデータ) (2021-12-06T08:27:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。