論文の概要: Beyond the Best Guess: Improving LLM Solution Coverage with Evolution Strategies
- arxiv url: http://arxiv.org/abs/2608.12679v1
- Date: Thu, 13 Aug 2026 00:30:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-14 18:29:38.354006
- Title: Beyond the Best Guess: Improving LLM Solution Coverage with Evolution Strategies
- Title(参考訳): 進化戦略によるLCMソリューションカバレッジの改善
- Authors: Conor F. Hayes, Elliot Meyerson, Kajetan Schweighofer, Roberto Dailey, Babak Hodjat, Risto Miikkulainen, Xin Qiu,
- Abstract要約: 大規模言語モデル(LLM)は、数学や科学といった発見領域にますます多くデプロイされている。
pass@kと呼ばれるプロセスでは、このモデルはソリューション空間を探索し、様々な候補のソリューションを生成することができる。
本稿では,Evolution Strategies (ES) がより広範な出力分布を生成できることを示す。
- 参考スコア(独自算出の注目度): 13.514355263457269
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Language Models (LLMs) are increasingly deployed in discovery domains such as math and science. The usual approach is to present the problem to the model and use its answer as the proposed solution. However, beyond this best guess, discovery can be enhanced by increasing test-time compute. In a process called pass@k, the model is allowed to explore the solution space and generate diverse candidate solutions. Unfortunately, the standard approach to post-training LLMs through Reinforcement Learning (RL) may limit pass@k: the model's output distribution narrows around high-reward outputs, causing the solution coverage to collapse. The alternative is to use Evolution Strategies (ES), a population-based, gradient-free post-training method that optimizes directly in weight space through random perturbations. As this paper shows, ES achieves consistently higher pass@k than RL and produces a broader output distribution with greater solution coverage. This coverage in turn makes it possible to achieve better results in e.g. standard math benchmarks. Thus, ES provides a better foundation for post-training in discovery problems and other domains where diverse solution coverage is critical.
- Abstract(参考訳): 大規模言語モデル(LLM)は、数学や科学といった発見領域にますます多くデプロイされている。
通常のアプローチは、問題をモデルに提示し、その答えを提案された解決策として使うことである。
しかし、このベストな推測を超えて、探索はテスト時間計算の増大によって強化される。
pass@kと呼ばれるプロセスでは、このモデルはソリューション空間を探索し、様々な候補のソリューションを生成することができる。
残念なことに、Reinforcement Learning (RL)によるLLMのトレーニング後の標準的なアプローチでは、pass@kが制限される可能性がある。
進化戦略(Evolution Strategies、ES)は、ランダムな摂動を通じて重量空間を直接最適化する、人口ベースで勾配のないポストトレーニング手法である。
本稿では, ES が RL よりも常に高いパス@k を達成し, より広範な出力分布を生成できることを示す。
このカバレッジによって、例えば標準的なベンチマークでより良い結果が得られるようになります。
したがって、ESは、様々なソリューションカバレッジが重要となる発見問題やその他の領域でのポストトレーニングのためのより良い基盤を提供する。
関連論文リスト
- REVES: REvision and VErification--Augmented Training for Test-Time Scaling [53.197756110943395]
本稿では,オンラインデータ/プロンプト拡張とポリシー最適化を交互に行う2段階反復フレームワークを提案する。
我々は、RLベースライン上の+6.5点と、標準マルチターントレーニングにおける+4.0点の利得を観察する。
論文 参考訳(メタデータ) (2026-06-17T10:37:23Z) - Rewarding the Rare: Uniqueness-Aware RL for Creative Problem Solving in LLMs [126.45104018441698]
強化学習(RL)は、大規模言語モデル(LLM)の訓練後の中心パラダイムとなっている。
この失敗は、解の集合の多様性よりもむしろ局所的なトークンの振る舞いを規則化することに起因すると我々は主張する。
我々は,まれなハイレベル戦略を示す正しいソリューションを明示的に報酬する,ロールアウトレベルの目標であるUniqueness-Aware Reinforcement Learningを提案する。
論文 参考訳(メタデータ) (2026-01-13T17:48:43Z) - GCPO: When Contrast Fails, Go Gold [6.596504114809683]
本稿では、外部標準基準回答を組み込んだグループコントラストポリシー最適化(GCPO)を紹介する。
モデルが問題を解くことができない場合、参照応答は正しい応答を提供し、不当に正確な更新方向に向けてモデルを操る。
GCPOは、複数のベンチマークデータセットで卓越した結果を達成し、ベースラインモデルよりも大幅に改善されている。
論文 参考訳(メタデータ) (2025-10-09T05:09:06Z) - Nudging the Boundaries of LLM Reasoning [77.26972440427285]
現在のオンライン強化学習アルゴリズムは、モデルに「解決不可能」な問題から学べない。
自己生成ヒントを用いてLLM推論の上界を推し進める「看護」手法であるNuRLを提案する。
NuRLは、テスト時間スケーリングを補完しながら、6つのベンチマークと3つのモデルで一貫した改善を実現している。
論文 参考訳(メタデータ) (2025-09-30T02:01:40Z) - Exploring Solution Divergence and Its Effect on Large Language Model Problem Solving [37.94354699202412]
より高度な解の発散は、様々なモデルにまたがるより良い問題解決能力に肯定的に関係していることを示す。
SFT戦略とRL戦略の両方をサポートする新しい指標として解の発散を提案する。
論文 参考訳(メタデータ) (2025-09-26T15:27:50Z) - \(X\)-evolve: Solution space evolution powered by large language models [16.586197761629744]
X)-evolveは、代わりに解空間(X)(個々の解の集合)を進化させるパラダイムシフト法である。
スコアに基づく探索アルゴリズムは、目的関数のスコアからのフィードバックによって導かれるこのパラメトリックに定義された空間を効率的に探索する。
論文 参考訳(メタデータ) (2025-08-11T12:47:59Z) - DiffSG: A Generative Solver for Network Optimization with Diffusion Model [75.27274046562806]
生成拡散モデルは、様々なクロスドメインアプリケーションで人気がある。
これらのモデルは複雑なネットワーク最適化問題に対処する上で有望である。
本稿では拡散モデルに基づく解生成という,拡散モデル生成のための新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2024-08-13T07:56:21Z) - Upside-Down Reinforcement Learning Can Diverge in Stochastic
Environments With Episodic Resets [4.126347193869613]
Upside-Down Reinforcement Learning (UDRL)は、価値関数を必要としない問題を解決するためのアプローチである。
Goal-Conditional Supervised Learning (GCSL)は目標達成性能の低い境界を最適化した。
これにより、任意の環境における最適ポリシーへの保証された収束を享受できるという期待が高まる。
論文 参考訳(メタデータ) (2022-05-13T12:43:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。