論文の概要: Beyond Repeated Sampling: Learning Search Policies for LLM Reasoning
- arxiv url: http://arxiv.org/abs/2609.26704v1
- Date: Tue, 22 Sep 2026 16:56:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-24 01:05:39.759787
- Title: Beyond Repeated Sampling: Learning Search Policies for LLM Reasoning
- Title(参考訳): 繰り返しサンプリングを超えて: LLM推論のための検索ポリシーを学ぶ
- Abstract要約: まず,問題固有の概念,ヒント,戦略を抽出することにより,意味レベルで探索を行うことができることを示す。
我々はこれを、より単純でより探索的な手順に洗練し、単一の軌道で多くの多様な概念を放出する。
小型のコンセプトジェネレータは強化学習により最適化され、その概念はより大型で凍結された回答ジェネレータの下流の成功を最大化する。
- 参考スコア(独自算出の注目度): 27.744389235222997
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models increasingly tackle hard reasoning problems by spending more test-time compute, yet the dominant strategy remains naive repeated sampling: draw many independent solutions and hope one is correct. Because such sampling explores only through local decoding noise, it tends to produce many near duplicate attempts rather than genuinely different ideas. We ask whether exploration can instead be steered at a semantic level, by first sampling problem specific concepts, hints, or strategies and then conditioning answer generation on them. We refine this into a simple, more exploratory procedure that emits many diverse concepts in a single trajectory, and evaluate it on hard problems where repeated sampling struggles. We then go a step further and make concept generation trainable: a small concept generator is optimized with reinforcement learning so that its concepts maximize the downstream success of a larger, frozen answer generator. On hard mathematical reasoning problems, the trained concept generator substantially improves the answer generator's pass@k over naive repeated sampling at the same answer generation allocation, surpasses concepts drawn from much larger untuned models, and transfers to answer generators it was never trained against, including a model from a different family. A small model can thus be trained into an effective, reusable search policy for a much larger one.
- Abstract(参考訳): 大規模な言語モデルは、より多くのテストタイム計算に費やすことで、ハード推論の問題に対処する傾向にあるが、主要な戦略は、繰り返しサンプリングを行うことである:多くの独立したソリューションを引き出して、それが正しいことを願っている。
このようなサンプリングは局所的な復号化ノイズを通してのみ探索するため、真に異なるアイデアではなく、ほぼ重複した試みを多く生み出す傾向にある。
まず、まず問題固有の概念、ヒント、戦略をサンプリングし、答えの生成を条件付けることで、意味レベルで探索を行うことができるかどうかを問う。
我々はこれを1つの軌道で多種多様な概念を放出する、単純でより探索的な手順に洗練し、繰り返しサンプリングが苦労する難しい問題に対して評価する。
小型のコンセプトジェネレータは強化学習によって最適化され、そのコンセプトがより大きなフリーズ回答ジェネレータの下流の成功を最大化する。
厳密な数学的推論問題では、トレーニングされたコンセプトジェネレータは、同じ回答生成アロケーションでナイーブな繰り返しサンプリングよりも、回答ジェネレータのpass@kを大幅に改善し、はるかに大きな未修正モデルから引き出された概念を超越し、異なるファミリーのモデルを含む、トレーニングされていない応答ジェネレータに転送する。
これにより、より大規模なモデルに対して、より効果的で再利用可能な検索ポリシーにトレーニングすることができる。
関連論文リスト
- Reaching Beyond the Mode: RL for Distributional Reasoning in Language Models [78.68818219506313]
本稿では,複数解に対する分布推論を行うための多解補足学習手法について述べる。
質問応答, 診断, コーディングベンチマークを通じて, 単一回答学習ベースラインと比較して, 多様性, カバレッジ, 設定レベルの校正スコアが向上した。
論文 参考訳(メタデータ) (2026-03-25T22:20:25Z) - Reasoning with Sampling: Your Base Model is Smarter Than You Think [52.639108524651846]
本稿では,基本モデル自身の可能性を利用した単純な反復サンプリングアルゴリズムを提案する。
我々のアルゴリズムは、ほぼ一致し、RLのアルゴリズムよりも優れているという推論において、大幅に向上することを示した。
我々の方法は、トレーニング、キュレートされたデータセット、検証器を必要としない。
論文 参考訳(メタデータ) (2025-10-16T17:18:11Z) - Answer-Consistent Chain-of-thought Reinforcement Learning For Multi-modal Large Langauge Models [33.398631680508814]
本稿では,GRPOアルゴリズムを補助的整合性チェックで修正するAnswer-Consistent Reinforcement Learningを提案する。
我々は、オリジナルとポストシャッフルの両方の回答が一致して正しい場合にのみ高い報酬を与える一貫性検証報酬を設計する。
我々は、ACREを挑戦的なビデオ推論ベンチマークとマルチモーダル数学推論ベンチマークで評価し、平均2.2%と1.5%の改善を達成した。
論文 参考訳(メタデータ) (2025-10-11T08:32:52Z) - The Majority is not always right: RL training for solution aggregation [53.1050856072799]
我々はアグリゲータモデルをトレーニングし、最終的な正解をレビューし、精査し、合成する。
重要な要素は、簡単なトレーニング例と厳しいトレーニング例のバランスを取ることだ。
我々の手法であるAggLMは、強いルールベースと報酬モデルベースラインの両方を上回ります。
論文 参考訳(メタデータ) (2025-09-08T16:39:38Z) - A Simple "Try Again" Can Elicit Multi-Turn LLM Reasoning [58.80217284841095]
マルチターン問題解決は、大規模な推論モデル(LRM)が彼らの推論を反映し、フィードバックから修正する上で非常に難しい。
既存の強化学習(RL)手法は、検証可能な報酬で1ターンのパラダイム上で大きな推論モデルを訓練する。
我々は,反復的問題解決において,最小限の単一ユーザフィードバックを利用する強化学習のためのUnary Feedback as Observation (UFO)を紹介した。
論文 参考訳(メタデータ) (2025-07-18T18:07:38Z) - Recursive Introspection: Teaching Language Model Agents How to Self-Improve [30.086494067593268]
RISE: Recursive IntroSpEctionは,大規模言語モデルを微調整する手法である。
実験の結果,RISEはLlama2,Llama3,Mistralの各モデルに対して,数学推論タスクのターン数を増やすことで自己改善を可能にすることがわかった。
論文 参考訳(メタデータ) (2024-07-25T17:35:59Z) - A Theoretical Analysis of the Repetition Problem in Text Generation [55.8184629429347]
我々は、繰り返しの問題が、残念ながら、我々の言語自体の特性によって引き起こされていることを示す。
一つの大きな理由は、その後の単語と同じ単語を高い確率で予測する単語が多すぎるという事実に起因する。
高インフロー問題を軽減するための新しい再バランス符号化手法を提案する。
論文 参考訳(メタデータ) (2020-12-29T08:51:47Z) - Conditional Generative Modeling via Learning the Latent Space [54.620761775441046]
マルチモーダル空間における条件生成のための新しい枠組みを提案する。
潜在変数を使って一般化可能な学習パターンをモデル化する。
推論では、潜伏変数は複数の出力モードに対応する最適解を見つけるために最適化される。
論文 参考訳(メタデータ) (2020-10-07T03:11:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。