論文の概要: Beyond Inference-Time Search: Reinforcement Learning Synthesizes Reusable Solvers
- arxiv url: http://arxiv.org/abs/2605.18374v1
- Date: Mon, 18 May 2026 13:21:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-19 17:57:49.627821
- Title: Beyond Inference-Time Search: Reinforcement Learning Synthesizes Reusable Solvers
- Title(参考訳): 推論時間探索を超えて: 強化学習は再利用可能な解を合成する
- Authors: Soheyl Massoudi, Gabriel Apaza, Milad Habibi, Mark Fuge,
- Abstract要約: 大規模言語モデル(LLM)は一般的に、各インスタンスを個別に解決する推論時プロシージャとして最適化にアプローチする。
本稿では,制約付きクナプサックの制御変種であるSDS(Synergistic Dependency Selection)について考察する。
Qwen2.5-Coder-14B-Instruct with Group Relative Policy Optimization using a feasibility-gated reward and light Structure scaffolding。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) typically approach combinatorial optimization as an inference-time procedure, solving each instance separately through sampling, search, or repeated prompting. We ask whether reinforcement learning can instead shift part of this reasoning cost into the weights of a code LLM, so that the model synthesizes a reusable solver for an entire problem family. We study this question on Synergistic Dependency Selection (SDS), a controlled variant of constrained Quadratic Knapsack designed to expose a specific failure mode: local signals and strict feasibility constraints make greedy heuristics attractive but unreliable. Under identical scaffolding, Best-of-64 base-model sampling saturates at an approximately 28.7% gap to the global Virtual Best Solver (VBS); code audits show that the base model often retrieves Simulated Annealing templates but misimplements the Metropolis acceptance rule. We fine-tune Qwen2.5-Coder-14B-Instruct with Group Relative Policy Optimization (GRPO) using a feasibility-gated reward and light structural scaffolding. The resulting policy converges to a constraint-aware Simulated Annealing template in 99.8% of feasible SDS outputs, achieves a 5.0% gap to that VBS, and is 91 times cheaper in post-generation execution/search cost than cumulative Best-of-64 evaluation. A compile-once check shows that one best frozen solver per seed remains highly competitive when reused unchanged across the SDS test set, while an additional-domain evaluation on Job Shop Scheduling provides narrower but positive evidence that the scaffold transfers beyond SDS. Negative ablations reveal the limits of this recipe: standard stabilizers degrade performance, a soft feasibility gate fails, and results remain sensitive to reward normalization and domain-specific design choices.
- Abstract(参考訳): 大規模言語モデル(LLM)は一般的に、推論時プロシージャとして組合せ最適化にアプローチし、サンプリング、検索、繰り返しプロンプトを通じて各インスタンスを個別に解決する。
我々は、この推論コストの一部をコードLLMの重みにシフトさせることで、このモデルが問題ファミリ全体の再利用可能な解法を合成するかどうかを問う。
本稿では、局所的な信号と厳密な実現性制約により、グリージーヒューリスティックスは魅力的だが信頼できないという、特定の障害モードを公開するために設計された制約付きクアドラティック・クナプサックの制御版であるSDS(Synergistic Dependency Selection)について検討する。
同じ足場の下では、Best-of-64ベースモデルのサンプリングは、世界的仮想ベストソルバー(VBS)と約28.7%の差で飽和し、コード監査では、ベースモデルがしばしばシミュレートされたアニーリングテンプレートを取得するが、メトロポリスの受け入れルールを誤って実装していることを示している。
Qwen2.5-Coder-14B-Instruct with Group Relative Policy Optimization (GRPO) using a feasibility-gated reward and light structure scaffolding。
結果として得られたポリシーは、実測可能なSDS出力の99.8%で制約対応のSimulated Annealingテンプレートに収束し、そのVBSと5.0%のギャップを達成し、累積的Best-of-64評価よりも91倍のコストでポストジェネレーションの実行/検索を行うことができる。
コンパイルオンスチェックでは、SDSテストセットを再利用せずに再利用した場合、シード当たりの最高の解凍器が高い競争力を維持し、Job Shop Schedulingにおける追加のドメイン評価は、足場がSDSを超えて移動しているというよりは、より狭く肯定的な証拠を提供する。
標準安定化器は性能を低下させ、ソフトな実現性ゲートは失敗し、その結果は正規化とドメイン固有の設計選択に敏感である。
関連論文リスト
- Efficient Data Selection for Multimodal Models via Incremental Optimization Utility [6.698411108146732]
本稿では,データ選択をインクリメンタルな最適化ユーティリティランキング問題として再定義するフレームワークであるOne-Step-Train(OST)を提案する。
トップ50サブセットを選択することで、OSTはトレーニングコストを43%削減し(トータルタイム消費は17)、強力なLCM-as-a-Judgeベースラインを1.8ポイント上回る。
論文 参考訳(メタデータ) (2026-05-08T09:28:26Z) - Confidence-Aware Alignment Makes Reasoning LLMs More Reliable [65.44962502963378]
CASPOは、トークンレベルの信頼度とステップワイドな論理的正しさを、個別の報酬モデルをトレーニングせずに整合させるフレームワークである。
推論中、信頼を意識した思考(CaT)を提案し、不確実な推論枝を無視可能なO(V)レイテンシで動的に生成する。
10のベンチマークと複数のモデルファミリでの実験では、CASPOは推論の信頼性と推論効率を一貫して改善している。
論文 参考訳(メタデータ) (2026-05-08T07:08:25Z) - Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data [55.84428098924793]
構造保存探索を行うためのパラメータ自由復号法である Constrained Uniform Top-K Smpling (CUTS) を提案する。
グループ内の利点分散を増幅するために、エクスプロイトと探索的なロールアウトを相乗化するためのトレーニングフレームワークであるMixed-CUTSに統合する。
特にMixed-CUTSは、AIME25ベンチマークのPass@1の精度を標準のGRPOよりも15.1%向上している。
論文 参考訳(メタデータ) (2026-04-20T16:43:28Z) - JANUS: Structured Bidirectional Generation for Guaranteed Constraints and Analytical Uncertainty [0.0]
JANUS(Joint Ancestral Network for Uncertainity and Synthesis)は、ベイズ決定木のDAGを用いて機能を統合するフレームワークである。
主な革新はReverse-Topological Back-fillingであり、因果グラフを通して制約を後方に伝播するアルゴリズムである。
Janusは最先端の忠実度(Detection Score 0.497)を実現し、不均衡なデータのモード崩壊を排除し、複雑なカラム間制約を正確に処理する。
論文 参考訳(メタデータ) (2026-03-04T05:36:11Z) - ODAR: Principled Adaptive Routing for LLM Reasoning via Active Inference [60.958331943869126]
ODAR-Expertは、原則化されたリソース割り当てによる精度と効率のトレードオフを最適化する適応的なルーティングフレームワークである。
我々は、MATHの98.2%の精度、HumanityのLast Examの54.8%を含む、強く一貫した利得を示している。
論文 参考訳(メタデータ) (2026-02-27T05:22:01Z) - ConstraintBench: Benchmarking LLM Constraint Reasoning on Direct Optimization [0.0]
ConstraintBenchは、直接制約付き最適化において、大きな言語モデルを評価するためのベンチマークである。
200のタスクで6つのフロンティアモデルを評価し、最適性ではなく実現可能性が主要なボトルネックであることを確認した。
解法基準の0.1%の範囲内で、結合実現可能性と最適性について30.5%を超えるモデルはない。
論文 参考訳(メタデータ) (2026-02-25T22:54:26Z) - Optimistic Feasible Search for Closed-Loop Fair Threshold Decision-Making [0.0]
バンディットフィードバックからの1次元しきい値ポリシーのオンライン学習について検討する。
我々は,報酬と制約残差に対する信頼境界を維持する単純なグリッドベース手法であるOptimistic Feasible Search (OFS)を提案する。
論文 参考訳(メタデータ) (2025-12-26T10:44:40Z) - Enhancing the Outcome Reward-based RL Training of MLLMs with Self-Consistency Sampling [90.87033586963828]
マルチモーダル大言語モデル(MLLM)のステップ・バイ・ステップ推論を洗練させる手段としては,アウトカム・リワード強化学習(RL)が一般的であり,ますます重要になっている。
この問題を修正するために,自己整合サンプリング(SCS)を提案する。
Qwen2.5-VL-7B-インストラクトに基づいて、SCSは、無視できる余分な計算を伴う6つのマルチモーダルベンチマークにおいて、最大7.7ポイントの精度を向上する。
論文 参考訳(メタデータ) (2025-11-13T18:59:57Z) - Unsupervised Conformal Inference: Bootstrapping and Alignment to Control LLM Uncertainty [49.19257648205146]
生成のための教師なし共形推論フレームワークを提案する。
我々のゲートは、分断されたUPPよりも厳密で安定した閾値を提供する。
その結果は、ラベルのない、API互換の、テスト時間フィルタリングのゲートになる。
論文 参考訳(メタデータ) (2025-09-26T23:40:47Z) - Reverse Preference Optimization for Complex Instruction Following [61.39734201711077]
本稿では,Reverse Preference Optimization (RPO) という,シンプルで効果的な手法を提案する。
選択された応答が完璧であることを保証するために、命令内の制約を動的に反転させることで、優先ペアのノイズを緩和する。
RPOはモデルサイズで効果的にスケールし、70B RPOモデルはGPT-4oを超える。
論文 参考訳(メタデータ) (2025-05-28T09:44:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。