論文の概要: Stratagem: Learning Transferable Reasoning via Trajectory-Modulated Game Self-Play
- arxiv url: http://arxiv.org/abs/2604.17696v1
- Date: Mon, 20 Apr 2026 01:20:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-21 21:52:52.643994
- Title: Stratagem: Learning Transferable Reasoning via Trajectory-Modulated Game Self-Play
- Title(参考訳): Stratagem: Trajectory-Modulated Game Self-Playによるトランスファー可能な推論学習
- Authors: Xiachong Feng, Deyi Yin, Xiaocheng Feng, Yi Jiang, Libo Qin, Yangfan Ye, Lei Huang, Weitao Ma, Qiming Li, Yuxuan Gu, Bing Qin, Lingpeng Kong,
- Abstract要約: 本稿では,ドメイン特異性とコンテキストスタシスの2つの基本的障壁に対処するSTRATAGEMを提案する。
数学的推論、一般的な推論、コード生成ベンチマークにわたる実験は、大幅な改善を示している。
- 参考スコア(独自算出の注目度): 85.2683525068614
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Games offer a compelling paradigm for developing general reasoning capabilities in language models, as they naturally demand strategic planning, probabilistic inference, and adaptive decision-making. However, existing self-play approaches rely solely on terminal game outcomes, providing no mechanism to distinguish transferable reasoning patterns from game-specific heuristics. We present STRATAGEM, which addresses two fundamental barriers to reasoning transfer: domain specificity, where learned patterns remain anchored in game semantics, and contextual stasis, where static game contexts fail to cultivate progressive reasoning. STRATAGEM selectively reinforces trajectories exhibiting abstract, domain-agnostic reasoning through a Reasoning Transferability Coefficient, while incentivizing adaptive reasoning development via a Reasoning Evolution Reward. Experiments across mathematical reasoning, general reasoning, and code generation benchmarks demonstrate substantial improvements, with particularly strong gains on competition-level mathematics where multi-step reasoning is critical. Ablation studies and human evaluation confirm that both components contribute to transferable reasoning.
- Abstract(参考訳): ゲームは、戦略的計画、確率的推論、適応的な意思決定を自然に要求するので、言語モデルにおける一般的な推論能力を開発するための魅力的なパラダイムを提供する。
しかし、既存のセルフプレイアプローチは終端ゲーム結果のみに依存しており、ゲーム固有のヒューリスティックと転送可能な推論パターンを区別するメカニズムを提供していない。
本稿では,学習パターンがゲームセマンティクスに固定されたままの領域特異性と,静的なゲームコンテキストが進行的推論を育むのに失敗するコンテキストスタシスの2つの基本的障壁に対処するSTRATAGEMを提案する。
STRATAGEMは、Reasoning Transferability Coefficientを介して抽象的でドメインに依存しない推論を示す軌跡を選択的に強化し、Reasoning Evolution Rewardを介して適応推論開発をインセンティブ化する。
数学的推論、一般的な推論、コード生成ベンチマークにわたる実験は、特に多段階推論が重要となる競合レベルの数学において、大幅な改善を示す。
アブレーション研究と人的評価により、双方の成分が伝達可能な推論に寄与することが確認された。
関連論文リスト
- Learning Structured Reasoning via Tractable Trajectory Control [99.75278337895024]
Ctrl-Rは、トラクタブルな軌道制御を通じて構造化推論を学ぶためのフレームワークである。
Ctrl-Rは,従来達成できなかった推論パターンを効果的に探索し,内部化することができることを示す。
論文 参考訳(メタデータ) (2026-03-02T09:18:19Z) - GeoReason: Aligning Thinking And Answering In Remote Sensing Vision-Language Models Via Logical Consistency Reinforcement Learning [12.987952829880363]
GeoReasonは、内部思考と最終的な決定を同期させるように設計されたフレームワークである。
まず、4000の推論軌道を含む論理駆動型データセットGeoReason-Benchを構築した。
次に,(1)推論の構文とドメインの専門知識をモデルに組み込むための知識初期化の促進,(2)推論の信頼性を向上するための一貫性を考慮した強化学習,という2段階の学習戦略を定式化する。
論文 参考訳(メタデータ) (2026-01-07T17:26:41Z) - From Hypothesis to Premises: LLM-based Backward Logical Reasoning with Selective Symbolic Translation [8.104087344683604]
仮説駆動型後方論理推論(HBLR)を提案する。
中心となる考え方は、信頼を意識したシンボリック翻訳と仮説駆動の後方推論を統合することである。
HBLRは、精度と効率の両方において、強いベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2025-12-03T01:52:31Z) - LLMs as Strategic Agents: Beliefs, Best Response Behavior, and Emergent Heuristics [0.0]
大規模言語モデル(LLM)は、他のエージェントの振る舞いを推論する必要のあるドメインにますます適用されています。
現状のフロンティアモデルでは, 目的的推論記憶における信念コヒーレントなベストレスポンス行動を示す。
複雑さが増大する中で、明示的な再帰は、安定した、モデル固有の、既知の人間のバイアスとは異なる選択規則を内部的に生成する手段を与える。
論文 参考訳(メタデータ) (2025-10-12T21:40:29Z) - CTRLS: Chain-of-Thought Reasoning via Latent State-Transition [57.51370433303236]
チェーン・オブ・シント(CoT)推論は、大規模な言語モデルで複雑な問題を解釈可能な中間ステップに分解することを可能にする。
我々は,遅延状態遷移を伴うマルコフ決定プロセス(MDP)としてCoT推論を定式化するフレームワークであるgroundingSを紹介する。
我々は、ベンチマーク推論タスクにおける推論精度、多様性、探索効率の改善を示す。
論文 参考訳(メタデータ) (2025-07-10T21:32:18Z) - A Survey on Latent Reasoning [100.54120559169735]
大きな言語モデル(LLM)は印象的な推論機能を示している。
中間ステップを言語化するCoT推論は、モデルの表現帯域幅を制限する。
潜在的推論は、モデルの連続的な隠れ状態に完全にマルチステップの推論を実行することで、このボトルネックに対処する。
論文 参考訳(メタデータ) (2025-07-08T17:29:07Z) - AdapThink: Adaptive Thinking Preferences for Reasoning Language Model [32.47427081297578]
強化学習(RL)に基づくポストトレーニングは、言語モデルの複雑な推論能力を大幅に向上させた。
しかし、この緩やかな思考のパラダイムは、効率を推理する上で重要な課題である。
より効率的な思考を促すために,適応的なポストトレーニングフレームワークAdapThinkを提案する。
論文 参考訳(メタデータ) (2025-06-23T02:06:04Z) - From Heuristic to Analytic: Cognitively Motivated Strategies for
Coherent Physical Commonsense Reasoning [66.98861219674039]
ヒューリスティック分析推論(HAR)戦略は、モデル決定のための合理化のコヒーレンスを大幅に改善する。
以上の結果から, PLM推論の一貫性と信頼性を効果的に向上できる可能性が示唆された。
論文 参考訳(メタデータ) (2023-10-24T19:46:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。