論文の概要: Step-by-Step Optimization-like Reasoning in LLMs over Expanding Search Spaces
- arxiv url: http://arxiv.org/abs/2606.05464v1
- Date: Wed, 03 Jun 2026 21:43:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-05 22:39:44.41903
- Title: Step-by-Step Optimization-like Reasoning in LLMs over Expanding Search Spaces
- Title(参考訳): 探索空間を拡大するLLMにおけるステップバイステップ最適化のような推論
- Authors: Nicolás Astorga, Nabeel Seedat, Mihaela van der Schaar,
- Abstract要約: OPT*は、LLMのステップバイステップ最適化のような推論を訓練し評価するための最適化スタイルのタスクのファミリーである。
各タスクは実現可能性チェッカーと評価器を提供し、一方、複雑性パラメータは新しい人間ラベルを必要とせずに検索スペースを拡大する。
OPT*のトレーニングは、ステップバイステップの最適化のような推論を改善する。
- 参考スコア(独自算出の注目度): 63.82675722580452
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Verifiable reward training has improved mathematical and coding reasoning, but these domains capture only part of step-by-step decision making. Many real-world tasks require finding a high-value feasible plan among many valid alternatives. We introduce OPT*, a scalable family of optimization-style tasks for training and evaluating LLM step-by-step optimization-like reasoning along a complexity axis: each task provides a feasibility checker and evaluator, while a complexity parameter expands the search space without requiring new human labels. This motivates studying these tasks in two regimes: (i) solver-guided online policy optimization, which uses a solver as a value oracle for partial states and applies rank-based reward shaping to reinforce better next steps, and (ii) search-based offline RL when such solvers are unavailable. Theoretically, we relate success in large search spaces to the information a reasoner extracts per unit of search budget. Empirically, we ablate the ingredients that make search efficient on OPT* and show that training on OPT* improves step-by-step optimization-like reasoning.
- Abstract(参考訳): 検証可能な報酬トレーニングは数学的およびコーディング推論を改善したが、これらのドメインはステップバイステップの意思決定の一部のみをキャプチャする。
多くの実世界のタスクは、多くの有効な代替案の中で高価値の実現可能な計画を見つける必要がある。
我々は,LSMのステップ・バイ・ステップの最適化的推論を複雑軸に沿って学習・評価するための,スケーラブルな最適化スタイルのタスク群であるOPT*を紹介した。
これは、これらの課題を2つの体制で研究する動機である。
一 解決者誘導オンライン政策最適化であって、解決者を部分的状態の値オラクルとして利用し、次段の強化にランクベースの報酬形成を適用すること。
(ii)そのような解法が利用できない場合の検索ベースのオフラインRL。
理論的には、大規模な検索空間における成功と、探索予算単位当たりの推論者が抽出する情報とを関連づける。
実験により,OPT*で探索効率を向上する材料を改良し,OPT*での学習がステップバイステップの最適化ライクな推論を改善することを示す。
関連論文リスト
- Iterative Self-Incentivization Empowers Large Language Models as Agentic Searchers [74.17516978246152]
大規模言語モデル(LLM)は、従来の手法を進化させるために情報検索に広く統合されている。
エージェント検索フレームワークであるEXSEARCHを提案する。
4つの知識集約ベンチマークの実験では、EXSEARCHはベースラインを大幅に上回っている。
論文 参考訳(メタデータ) (2025-05-26T15:27:55Z) - StepSearch: Igniting LLMs Search Ability via Step-Wise Proximal Policy Optimization [14.931231544839687]
StepSearchは、ステップワイドなポリシー最適化手法でトレーニングされたLLMを検索するためのフレームワークである。
情報ゲインと冗長性に基づく、より豊かでより詳細な中間探索報酬とトークンレベルのプロセス監視で構成されている。
標準的なマルチホップQAベンチマークでは、グローバルリワードベースラインをはるかに上回り、3Bモデルと7Bモデルの11.2%と4.2%の絶対的な改善を達成した。
論文 参考訳(メタデータ) (2025-05-21T05:01:31Z) - Offline Reinforcement Learning for LLM Multi-Step Reasoning [15.687002884103537]
OREO(Offline Reasoning Optimization)は,多段階推論の強化を目的としたオフライン強化学習手法である。
これにより、ペアワイズデータを収集する必要がなくなり、より優れたクレジット割り当てが可能になる。
マルチステップ推論ベンチマークでは、既存のオフライン学習手法を超越している。
論文 参考訳(メタデータ) (2024-12-20T18:49:45Z) - Query-Dependent Prompt Evaluation and Optimization with Offline Inverse
RL [62.824464372594576]
ゼロショットプロンプト最適化により,Large Language Models (LLM) の算術的推論能力を向上させることを目的とする。
このような最適化では、以前見過ごされたクエリ依存の目的を特定します。
本稿では、オフライン逆強化学習を利用して、実演データから洞察を引き出すPrompt-OIRLを紹介する。
論文 参考訳(メタデータ) (2023-09-13T01:12:52Z) - JoinGym: An Efficient Query Optimization Environment for Reinforcement
Learning [58.71541261221863]
結合順序選択(JOS)は、クエリの実行コストを最小化するために結合操作を順序付けする問題である。
木質強化学習(RL)のためのクエリ最適化環境JoinGymを提案する。
JoinGymは内部で、事前計算されたデータセットから中間結果の濃度を調べることで、クエリプランのコストをシミュレートする。
論文 参考訳(メタデータ) (2023-07-21T17:00:06Z) - Symmetric Replay Training: Enhancing Sample Efficiency in Deep Reinforcement Learning for Combinatorial Optimization [42.92248233465095]
本稿では,SRT (symmetric replay training) と呼ばれる簡易かつ効果的な手法を提案する。
提案手法は,オンラインインタラクションを伴わない対称領域の探索を促進するために,高解像度サンプルを活用する。
実世界のタスクに適用した多種多様なDRL法に対して,本手法を一貫したサンプル効率向上効果を示す実験結果を得た。
論文 参考訳(メタデータ) (2023-06-02T05:34:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。