論文の概要: MiniOpt: Reasoning to Model and Solve General Optimization Problems with Limited Resources
- arxiv url: http://arxiv.org/abs/2606.25832v2
- Date: Thu, 25 Jun 2026 05:38:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 15:44:16.37978
- Title: MiniOpt: Reasoning to Model and Solve General Optimization Problems with Limited Resources
- Title(参考訳): MiniOpt: 限られたリソースで一般的な最適化問題をモデル化し解決する
- Abstract要約: MiniOptは、最適化問題を解決するための強化学習フレームワークである。
定式化と解法を共同で評価する階層的なスコア構造を持つ報酬関数である OptReward を導入する。
実験により、MiniOpt-3Bは様々な最適化タイプ、問題シナリオ、タスク領域にまたがる強力な最適化の一般化を示すことが示された。
- 参考スコア(独自算出の注目度): 38.15964861582096
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Achieving strong optimization generalization across diverse optimization problems while requiring limited training resources remains a challenging problem for optimization-oriented large language models (LLMs). Existing approaches typically rely on large-scale supervised datasets, costly reasoning annotations, and expensive intermediate step verification, resulting in substantial training overhead. To address these challenges, we propose MiniOpt, a reinforcement learning framework that learns to solve optimization problems through an "reasoning-to-model-and-solve" paradigm. MiniOpt decomposes optimization reasoning into structured optimization modeling and executable solver generation. Building upon this paradigm, we introduce OptReward, a reward function with hierarchical score structure that jointly evaluates formulation and solution, enabling effective policy learning without expert demonstrations. We further develop an optimization-oriented policy optimization strategy that improves exploration efficiency and stabilizes reinforcement learning for compact models. Extensive experiments show that MiniOpt-3B exhibits strong optimization generalization across various optimization types, problem scenarios, and task domains. For models with fewer than 10B parameters, MiniOpt series achieves the highest average solving accuracy (SA). For models with more than 10B parameters, MiniOpt still shows competitive performance. These results suggest that optimization-oriented reward design and reinforcement learning provide an effective pathway for developing compact optimization-specialized language models with strong optimization generalization capabilities. The code is available at https://github.com/Hsiang-1/MiniOpt.
- Abstract(参考訳): 最適化指向の大規模言語モデル(LLM)では、限られたトレーニングリソースを必要とする一方で、多様な最適化問題に対して強力な最適化の一般化を実現することが難しい問題である。
既存のアプローチは一般的に、大規模な教師付きデータセット、高価な推論アノテーション、高価な中間ステップ検証に依存しており、結果として相当なトレーニングオーバーヘッドが生じる。
これらの課題に対処するため、我々は「モデルと解の推論」パラダイムを用いて最適化問題の解法を学ぶ強化学習フレームワークであるMiniOptを提案する。
MiniOptは最適化推論を構造化最適化モデリングと実行可能なソルバ生成に分解する。
このパラダイムを基盤として,階層的なスコア構造を持つ報酬関数 OptReward を導入し,定式化と解法を共同で評価し,専門家による実演なしに効果的な政策学習を可能にする。
さらに、探索効率を改善し、コンパクトモデルに対する強化学習を安定化する最適化指向のポリシー最適化戦略を開発する。
大規模な実験により、MiniOpt-3Bは様々な最適化タイプ、問題シナリオ、タスク領域にまたがる強力な最適化の一般化を示すことが示された。
10Bパラメータ未満のモデルでは、MiniOptシリーズは最高の平均解法精度(SA)を達成する。
10B以上のパラメータを持つモデルの場合、MiniOptは依然として競争力のある性能を示している。
これらの結果は、最適化指向の報酬設計と強化学習が、強力な最適化一般化機能を備えたコンパクトな最適化特化言語モデルを開発するための効果的な経路となることを示唆している。
コードはhttps://github.com/Hsiang-1/MiniOpt.comから入手できる。
関連論文リスト
- Decision-Driven Regularization: A Blended Model for Learning and Optimization [1.4055982190455338]
学習と最適化のアプローチについて検討し、まず特徴から結果がどう影響するかを学習し、次にこれらの結果に基づいて最適な決定を選択する。
本稿では, 予測精度とコスト最小化のバランスを保ち, 決定駆動正規化(Deciciment-driven regularization)と呼ばれる二目的定式化を提案する。
論文 参考訳(メタデータ) (2026-08-15T08:49:33Z) - Democratizing Large-Scale Re-Optimization with LLM-Guided Model Patches [14.24802309734814]
本稿では,大規模言語モデル(LLM)がORエキスパートとして機能するエージェント的再最適化フレームワークを提案する。
提案フレームワークは,デプロイされた最適化モデルの対話的かつ連続的な適応を可能にする。
論文 参考訳(メタデータ) (2026-05-18T17:28:25Z) - TCPO: Thought-Centric Preference Optimization for Effective Embodied Decision-making [75.29820290660065]
本稿では,効果的な具体的意思決定のための思考中心推論最適化(TCPO)を提案する。
モデルの中間的推論プロセスの整合性を強調し、モデル劣化の問題を緩和する。
ALFWorld環境での実験では、平均成功率は26.67%であり、RL4VLMよりも6%向上している。
論文 参考訳(メタデータ) (2025-09-10T11:16:21Z) - A Survey on Inference Optimization Techniques for Mixture of Experts Models [50.40325411764262]
大規模Mixture of Experts(MoE)モデルは、条件計算によるモデル容量と計算効率の向上を提供する。
これらのモデル上で推論をデプロイし実行することは、計算資源、レイテンシ、エネルギー効率において大きな課題を示す。
本調査では,システムスタック全体にわたるMoEモデルの最適化手法について分析する。
論文 参考訳(メタデータ) (2024-12-18T14:11:15Z) - Backpropagation of Unrolled Solvers with Folded Optimization [55.04219793298687]
ディープネットワークにおけるコンポーネントとしての制約付き最適化モデルの統合は、多くの専門的な学習タスクに有望な進歩をもたらした。
1つの典型的な戦略はアルゴリズムのアンローリングであり、これは反復解法の操作による自動微分に依存している。
本稿では,非ロール最適化の後方通過に関する理論的知見を提供し,効率よく解けるバックプロパゲーション解析モデルを生成するシステムに繋がる。
論文 参考訳(メタデータ) (2023-01-28T01:50:42Z) - Learning for Robust Combinatorial Optimization: Algorithm and
Application [26.990988571097827]
最適化学習(L2O)は、ニューラルネットワークの強い予測力を活用することにより、最適化問題を解決するための有望なアプローチとして登場した。
本稿では,不確実な状況下で頑健な解を迅速に出力するLRCOという新しい学習ベース最適化を提案する。
その結果、LRCOは、非常に少ない複雑さで、最悪のケースコストとランタイムを大幅に削減できることがわかった。
論文 参考訳(メタデータ) (2021-12-20T07:58:50Z) - Conservative Objective Models for Effective Offline Model-Based
Optimization [78.19085445065845]
計算設計の問題は、合成生物学からコンピュータアーキテクチャまで、様々な場面で発生している。
本研究では,分布外入力に対する接地的目標の実際の値を低くする目的関数のモデルを学習する手法を提案する。
COMは、様々なMBO問題に対して、既存のメソッドの実装と性能の面では単純である。
論文 参考訳(メタデータ) (2021-07-14T17:55:28Z) - Automatically Learning Compact Quality-aware Surrogates for Optimization
Problems [55.94450542785096]
未知パラメータで最適化問題を解くには、未知パラメータの値を予測し、これらの値を用いて問題を解くための予測モデルを学ぶ必要がある。
最近の研究によると、複雑なトレーニングモデルパイプラインのレイヤーとして最適化の問題を含めると、観測されていない意思決定の繰り返しを予測することになる。
我々は,大規模最適化問題の低次元サロゲートモデルを学習することにより,解の質を向上させることができることを示す。
論文 参考訳(メタデータ) (2020-06-18T19:11:54Z) - Optimizing Wireless Systems Using Unsupervised and
Reinforced-Unsupervised Deep Learning [96.01176486957226]
無線ネットワークにおけるリソース割り当てとトランシーバーは、通常最適化問題の解決によって設計される。
本稿では,変数最適化と関数最適化の両問題を解くための教師なし・教師なし学習フレームワークを紹介する。
論文 参考訳(メタデータ) (2020-01-03T11:01:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。