論文の概要: Tropical Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2610.02478v1
- Date: Thu, 01 Oct 2026 20:56:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.085521
- Title: Tropical Reinforcement Learning
- Title(参考訳): 熱帯強化学習
- Abstract要約: 本稿では,代数の簡単な変化に基づく熱帯強化学習を提案する。
代替解の確率を追加する代わりに、その最大値を取ると、熱帯の半環が生成される。
これにより、異なるロールアウトから来た場合でも、最高のプレフィックスと共有状態の最高のサフィックスミーティングを結合できるため、真のコンポジションが可能になる。
- 参考スコア(独自算出の注目度): 32.70308957883499
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reinforcement learning for large language models typically maximizes expected return, adding up the probabilities of all successful trajectories. However, the classical sum formulation can only report how often the model policy succeeds, not which solution actually worked, and because probabilities sum to one, reinforcing one solution can make the model forget another that was never shown to be wrong. This makes expected return a poor fit for compositional reasoning, where a solution must be assembled from reasoning steps that the model produces in separate, often failed, attempts but rarely produces together. To address this, we propose Tropical Reinforcement Learning, which rests on a simple change of algebra: instead of adding the probabilities of alternative solutions, we take their maximum, which yields the tropical semiring. The value of a state then becomes the log-probability of its most likely verified solution, together with an explicit path that can be replayed and reused. This enables true composition, since the best prefix and the best suffix meeting at a shared state can be joined even when they come from different rollouts. To put this into practice, we introduce TROPIC, a training algorithm for deterministic, resettable environments with verifiable outcomes. On four agentic tasks (Sokoban, Countdown, FrozenLake, WebShop), TROPIC outperforms the strongest on-policy baselines by up to 16 percentage points. Changing the algebra of reinforcement learning, not just its estimators, can thus substantially improve compositional reasoning in language models
- Abstract(参考訳): 大規模言語モデルの強化学習は、典型的には期待されるリターンを最大化し、すべての成功した軌道の確率を増大させる。
しかし、古典的な和の定式化は、モデルポリシーがどれだけの頻度で成功するか、どの解が実際に機能するか、確率が1つに等しいため、ある解を補強することは、モデルが間違っていることが決して示されていないことを忘れさせる。
これにより、予想されるリターンは、構成的推論に適さない。そこでは、モデルが別々に、しばしば失敗するが、一緒に生成されることは滅多にない推論ステップから、ソリューションを組み立てなければならない。
これを解決するために,代用解の確率を加味する代わりに,その最大値を取ることで,熱帯半環が得られるという,簡単な代数学の変化に依拠する熱帯強化学習を提案する。
状態の値は、再生や再利用が可能な明示的なパスとともに、最も可能性の高い検証されたソリューションのログ確率になる。
これにより、異なるロールアウトから来た場合でも、最高のプレフィックスと共有状態の最高のサフィックスミーティングを結合できるため、真のコンポジションが可能になる。
そこで本研究では,決定論的かつ再設定可能な環境のためのトレーニングアルゴリズムTROPICを紹介する。
4つのエージェントタスク(Sokoban、Countdown、FrozenLake、WebShop)において、TROPICは最大16ポイントの政治的なベースラインを上回っている。
強化学習の代数の変化は、その推定値だけでなく、言語モデルにおける構成的推論を大幅に改善することができる。
関連論文リスト
- Test-Time Scaling with Diffusion Language Models via Reward-Guided Stitching [66.39914384073145]
本稿では,安価な拡散サンプリング推論をステップレベル候補の再利用プールに変換する自己整合性フレームワークを提案する。
ステップレベルの再結合は、難しい問題に対して最も有益であることがわかった。
トレーニング不要のフレームワークは、6つの数学およびコーディングタスクの平均精度を最大2倍改善します。
論文 参考訳(メタデータ) (2026-02-26T11:08:39Z) - Answer-Consistent Chain-of-thought Reinforcement Learning For Multi-modal Large Langauge Models [33.398631680508814]
本稿では,GRPOアルゴリズムを補助的整合性チェックで修正するAnswer-Consistent Reinforcement Learningを提案する。
我々は、オリジナルとポストシャッフルの両方の回答が一致して正しい場合にのみ高い報酬を与える一貫性検証報酬を設計する。
我々は、ACREを挑戦的なビデオ推論ベンチマークとマルチモーダル数学推論ベンチマークで評価し、平均2.2%と1.5%の改善を達成した。
論文 参考訳(メタデータ) (2025-10-11T08:32:52Z) - Why Can't Transformers Learn Multiplication? Reverse-Engineering Reveals Long-Range Dependency Pitfalls [54.57326125204404]
言語モデルはますます能力が高くなっているが、多桁乗算という一見単純なタスクではまだ失敗している。
直観的連鎖を通して乗法をうまく学習するモデルをリバースエンジニアリングすることでなぜ研究する。
論文 参考訳(メタデータ) (2025-09-30T19:03:26Z) - Probabilistic Token Alignment for Large Language Model Fusion [100.30692772017238]
大規模言語モデル(LLM)をスクラッチからトレーニングすると、ユニークな機能と強みを持つモデルが得られるが、コストがかかり、しばしば冗長な機能をもたらす。
既存のモデル融合における重要な課題は、手動で定義された語彙のアライメントに依存することである。
PTA-LLM と呼ばれるアライメントのための一般およびソフトマッピングとして確率的トークンアライメント法を提案する。
論文 参考訳(メタデータ) (2025-09-21T23:18:24Z) - The Majority is not always right: RL training for solution aggregation [53.1050856072799]
我々はアグリゲータモデルをトレーニングし、最終的な正解をレビューし、精査し、合成する。
重要な要素は、簡単なトレーニング例と厳しいトレーニング例のバランスを取ることだ。
我々の手法であるAggLMは、強いルールベースと報酬モデルベースラインの両方を上回ります。
論文 参考訳(メタデータ) (2025-09-08T16:39:38Z) - Thinkless: LLM Learns When to Think [57.857534644932194]
推論モデル(Reasoning Language Models)は、複雑な論理的推論を必要とするタスクにおいて顕著な性能を示す。
我々は,LLMが短文推論と長文推論を適応的に選択できる学習可能なフレームワークであるThinklessを提案する。
Minerva Algebra、MATH-500、GSM8Kなどのベンチマークでは、Thinklessはロングチェーン思考の使用を50%から90%削減することができる。
論文 参考訳(メタデータ) (2025-05-19T17:24:16Z) - Recursive Introspection: Teaching Language Model Agents How to Self-Improve [30.086494067593268]
RISE: Recursive IntroSpEctionは,大規模言語モデルを微調整する手法である。
実験の結果,RISEはLlama2,Llama3,Mistralの各モデルに対して,数学推論タスクのターン数を増やすことで自己改善を可能にすることがわかった。
論文 参考訳(メタデータ) (2024-07-25T17:35:59Z) - Uncertainty Estimation for Language Reward Models [5.33024001730262]
言語モデルは、テキストコーパスの教師なしトレーニングからさまざまな能力を学ぶことができる。
人間がラベル付きデータを提供するよりも選択肢を選択する方が簡単であり、事前の作業はそのような選好比較から報酬モデルをトレーニングすることで最先端のパフォーマンスを達成した。
能動的学習とリスク-逆強化学習を用いてサンプル効率とロバスト性を向上させる不確実性推定によるこれらの問題に対処することを模索する。
論文 参考訳(メタデータ) (2022-03-14T20:13:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。