論文の概要: Active-GRPO: Adaptive Imitation and Self-Improving Reasoning for Molecular Optimization
- arxiv url: http://arxiv.org/abs/2607.00531v1
- Date: Wed, 01 Jul 2026 07:22:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.774799
- Title: Active-GRPO: Adaptive Imitation and Self-Improving Reasoning for Molecular Optimization
- Title(参考訳): Active-GRPO:分子最適化のための適応的模倣と自己改善推論
- Abstract要約: 命令に基づく分子最適化における問題について検討し、応答のみを教師付き微調整が多段階の推論を分解する問題について検討する。
提案手法は,参照をいつ模倣するかを基準として,ポリシーが積極的に決定するパラダイムである。
このパラダイムを2つの結合機構を通じて実現したアクティブグループ相対政策最適化(Active-GRPO)としてインスタンス化する。
- 参考スコア(独自算出の注目度): 8.326287542160793
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Scientific reasoning is an increasingly important capability of large language models, yet improving the robustness and efficiency of training such reasoning remains a key open challenge. We study this problem in instruction-based molecular optimization, where answer-only supervised fine-tuning (SFT) collapses multi-step reasoning and reinforcement learning with verifiable rewards (RLVR) suffers from sparse feedback. Reference-guided Policy Optimization mitigates both by anchoring policy updates to dataset-provided references, but its effectiveness is tightly coupled to reference quality: weak or misaligned references impose a performance ceiling. To overcome this ceiling, we propose active reasoning, a paradigm in which the policy actively decides, on a per-instance basis, when to imitate a reference and when to reinforce its own discoveries, while continuously upgrading what it imitates. We instantiate this paradigm as Active Group Relative Policy Optimization (Active-GRPO), realized through two coupled mechanisms: active imitate-reinforce and active referencing. The former performs imitation learning when the reference still outperforms the policy's own candidates, and shifts to self-improvement via reinforcement learning once the policy has generated molecules that surpass the reference. The latter continuously upgrades the reference itself by replacing it with the best policy-generated candidate discovered so far, progressively raising the imitation target and ensuring that reference guidance remains informative-rather than restrictive-throughout training. Across TOMG-Bench MOLOPT, Active-GRPO improves average SRxSim from 0.0959 for GRPO and 0.1665 for RePO to 0.1773 under matched three-seed evaluation, with statistically significant gains on LogP, MR, and QED.
- Abstract(参考訳): 科学推論は、大規模言語モデルの重要機能としてますます重要になっているが、トレーニングの堅牢性と効率性の改善は、依然として重要な課題である。
本研究は, 命令に基づく分子最適化において, 解答のみによる微調整(SFT)が多段階推論と強化学習を崩壊させ, 検証可能な報奨(RLVR)がスパースフィードバックに悩まされる場合について検討する。
参照誘導ポリシー最適化(Reference-guided Policy Optimization)は、データセットが提供した参照に対するポリシー更新をアンロックすることで緩和するが、その効果は参照品質と密接に結びついている。
この上限を克服するために、我々は、政策がいつ参照を模倣するか、いつ自分自身の発見を補強するかを基準として積極的に決定するパラダイムであるアクティブ推論を提案し、それを継続的にアップグレードする。
我々はこのパラダイムをActive Group Relative Policy Optimization(Active-GRPO)としてインスタンス化し、アクティブな模倣強化とアクティブな参照という2つの結合メカニズムを通じて実現した。
前者は、基準が政策の候補を上回る場合に模擬学習を行い、基準を超える分子を生成すると、強化学習によって自己改善へと移行する。
後者は、これまで発見された最良のポリシー生成候補に置き換えることによって参照自体を継続的にアップグレードし、模倣目標を段階的に引き上げ、参照ガイダンスが制限付きスルートレーニングよりも情報的でないことを保証する。
TOMG-Bench MOLOPT全体では、Active-GRPOは平均SRxSimをGRPOは0.0959、RePOは0.1665から3シード評価で0.1773に改善し、LogP、MR、QEDは統計的に有意な上昇を示した。
関連論文リスト
- One-Way Policy Optimization for Self-Evolving LLMs [63.8638342097375]
RLVR(Reinforcement Learning with Verifiable Rewards)は,Large Language Models(LLMs)の推論能力を拡張するための,有望なパラダイムとなっている。
本稿では,最適化方向を更新等級から切り離す手法である1-Way Policy Optimization (OWPO)を提案する。
実験の結果,OWPOはDAPO,OPD,MOPDなどの強いベースラインより優れていた。
論文 参考訳(メタデータ) (2026-05-21T08:25:27Z) - Learning from Failures: Correction-Oriented Policy Optimization with Verifiable Rewards [73.44333771806282]
RLVR(Reinforcement Learning with Verifiable Rewards)は,大規模言語モデルの推論能力向上に有効なパラダイムとして登場した。
本稿では,RLVRの簡易かつ効果的な拡張であるCIPO(Correction-Oriented Policy Optimization)を提案する。
CIPOは学習効率を向上し、モデルが自身のエラーを修正する能力を明示的に強化する。
論文 参考訳(メタデータ) (2026-05-14T08:22:21Z) - Policy Improvement Reinforcement Learning [40.05196753615896]
Reinforcement Learning with Verifiable Rewards (RLVR) は、大規模言語モデルの推論能力を改善するためのトレーニング後の中心的なパラダイムとなっている。
既存のメソッドは共通の盲点を共有している: 結果の更新によってモデルが実際に改善されたかどうかを検証することなく、即時のグループレベルまたはバッチレベルの統計に基づいてポリシーを最適化する。
我々は、政策改善のフィードバックが欠落していること、すなわち、中間段階の進捗を直接測定し、最適化する能力が欠けていることを論じる。
論文 参考訳(メタデータ) (2026-04-01T13:10:20Z) - Reference-guided Policy Optimization for Molecular Optimization via LLM Reasoning [58.644854860003704]
大規模言語モデル(LLM)は、教師付き微調整(SFT)と、推論タスクにおける検証可能な報酬(RLVR)による強化学習の恩恵を受ける。
基準分子上の応答のみのSFTは推論を崩壊させ、RLVRは類似性制約下でスパースフィードバックを提供する。
本稿では、軌道データを必要としない参照分子から学習する最適化手法である参照誘導政策最適化(RePO)を紹介する。
論文 参考訳(メタデータ) (2026-03-06T04:39:08Z) - RePO: Bridging On-Policy Learning and Off-Policy Knowledge through Rephrasing Policy Optimization [40.41228010377401]
本稿では、政治外の知識と政治上のRLの安定性を両立させるためのリフレージング・ポリシー・オプティマイズ(RePO)を提案する。
RePOは、独自のスタイリスティックでパラメトリックな分布に適合する軌跡に、政治外の知識を言い換える。
いくつかのベンチマークの実験では、RePOがハードサンプルの利用を改善し、既存のベースラインを上回っていることが示されている。
論文 参考訳(メタデータ) (2026-02-11T13:02:40Z) - A Step Back: Prefix Importance Ratio Stabilizes Policy Optimization [58.116300485427764]
強化学習のポストトレーニングは、大きな言語モデルにおける推論の振る舞いを引き出すことができる。
トークンレベルの補正は、オフポリシーネスの度合いが大きい場合、不安定なトレーニングダイナミクスにつながることが多い。
我々は,最小固定率 (MinPRO) を簡易かつ効果的に提案する。
論文 参考訳(メタデータ) (2026-01-30T08:47:19Z) - MAESTRO: Meta-learning Adaptive Estimation of Scalarization Trade-offs for Reward Optimization [56.074760766965085]
大規模言語モデル(LLM)の整合性のための効率的なパラダイムとしてグループ相対政策最適化が登場している。
我々は,報酬スカラー化を動的潜在ポリシーとして扱い,モデルの終端隠蔽状態を意味的ボトルネックとして活用するMAESTROを提案する。
本稿では,軽量コンダクタネットワークがメタリワード信号としてグループ相対的優位性を生かしてポリシと共進化する,双方向最適化フレームワークにおけるコンテキスト的帯域幅問題としてこれを定式化する。
論文 参考訳(メタデータ) (2026-01-12T05:02:48Z) - BAPO: Stabilizing Off-Policy Reinforcement Learning for LLMs via Balanced Policy Optimization with Adaptive Clipping [69.74252624161652]
適応クリッピング(BAPO)を用いたBAlanced Policy Optimizationを提案する。
BAPOはクリッピングバウンダリを動的に調整し、適応的に正と負のコントリビューションを再バランスさせ、エントロピーを保持し、RL最適化を安定化させる。
AIME 2024とAIME 2025ベンチマークでは、7B BAPOモデルがSkyWork-OR1-7Bのようなオープンソースモデルを上回っています。
論文 参考訳(メタデータ) (2025-10-21T12:55:04Z) - ACPO: Adaptive Curriculum Policy Optimization for Aligning Vision-Language Models in Complex Reasoning [17.928214942495412]
ACPOは、安定的で、準政治的な探索段階から、効率的で、非政治的な搾取段階へ、原則的な移行を編成する動的カリキュラムを採用している。
我々は、MathVista、LogicVista、MMMU-Proなど、挑戦的なマルチモーダル推論ベンチマークのスイートで広範な実験を行う。
その結果,ACPOはDAPOやPAPOなどの強いベースラインを一貫して上回り,最先端性能,収束の促進,訓練安定性の向上を実現している。
論文 参考訳(メタデータ) (2025-10-01T09:11:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。